데이터 반출 없는 다기관 연합 인공지능 학습 플랫폼

데이터 분석/군집화

결합분포: 1) 공의 무게 군집, 2) 손님 키와 몸무게 쌍 군집

FedTensor 2026. 10. 3. 12:22

깁스 샘플링(Gibbs Sampling)에서 말하는 '결합분포(Joint Distribution)'는 "우리가 추정하고자 하는 모든 미지의 변수(파라미터와 잠재 변수)가 주어진 관측 데이터 하에서 함께 가질 수 있는 종합적인 확률분포", 즉 베이지안 관점의 사후 결합분포(Joint Posterior Distribution)를 의미합니다.

 

각 예시에서 구체적으로 무엇을 결합분포로 정의하는지 살펴보겠습니다.

1. 예시 1: 공의 무게 군집 (Light / Heavy)

  • 관측된 데이터 ($X$): 각 공들의 측정된 1차원 무게들 ($x_1, x_2, \dots, x_N$)
  • 추정해야 할 미지의 변수들:
    1. 개별 공들의 소속 라벨 ($Z$): 각 공이 Light인지 Heavy인지 나타내는 잠재 변수들 ($z_1, z_2, \dots, z_N \in \{\text{Light}, \text{Heavy}\}$)
    2. 각 그룹의 프로필 파라미터 ($\Theta$):
      • Light 그룹의 대표 통계치 (평균 무게 $\mu_L$, 분산 $\sigma_L^2$)
      • Heavy 그룹의 대표 통계치 (평균 무게 $\mu_H$, 분산 $\sigma_H^2$)

여기서의 결합분포:

$$P(\text{모든 공의 라벨 } Z, \text{그룹별 평균/분산 } \Theta \mid \text{관측된 공의 무게 } X)$$
  • 구체적 의미: 공들의 무게 데이터가 주어졌을 때, "각 공이 어느 그룹에 속할지($Z$)"와 "Light 및 Heavy 그룹의 대표 무게/분산이 얼마일지($\Theta$)"가 동시에 형성하는 다차원 결합 확률분포를 지칭합니다.
  • 깁스 샘플링의 역할: $\Theta$와 $Z$를 동시에 구하기 어려우므로,
    • $P(\Theta \mid Z, X)$ (라벨이 주어졌을 때 그룹 평균/분산 갱신)
    • $P(Z \mid \Theta, X)$ (그룹 평균/분산이 주어졌을 때 개별 공 라벨 갱신)
    이 두 조건부 확률분포를 번갈아 샘플링함으로써 위 결합 사후분포의 샘플들을 얻어내게 됩니다.

2. 예시 2: 손님 키와 몸무게 쌍 군집 (4개 그룹)

  • 관측된 데이터 ($X$): 손님들의 2차원 데이터인 [키, 몸무게] 쌍들 ($\mathbf{x}_1, \mathbf{x}_2, \dots, \mathbf{x}_N$)
  • 추정해야 할 미지의 변수들:
    1. 개별 손님의 소속 라벨 ($Z$): 각 손님이 어느 그룹인지 나타내는 잠재 변수 ($z_1, \dots, z_N \in \{\text{어린이, 성인 여성, 성인 남성, 운동선수}\}$)
    2. 각 그룹의 2차원 프로필 파라미터 ($\Theta$):
      • 4개 그룹 각각의 2차원 중심점(평균 키, 평균 몸무게 벡터 $\boldsymbol{\mu}_k$) 및 퍼짐 정도(공분산 행렬 $\boldsymbol{\Sigma}_k$)

여기서의 결합분포:

$$P(\text{모든 손님의 그룹 라벨 } Z, 4\text{개 그룹의 키·몸무게 중심 및 범위 } \Theta \mid \text{관측된 손님들의 [키, 몸무게] 데이터 } X)$$
  • 구체적 의미: 손님들의 키·몸무게 측정값이 주어졌을 때, "100명 손님들의 그룹 지정 상태($Z$)"와 "4개 그룹 각각의 [키, 몸무게] 평균 벡터와 공분산($\Theta$)"이 함께 이루는 결합 확률분포를 지칭합니다.
  • 깁스 샘플링의 역할:
    • $P(\Theta \mid Z, X)$ (현재 손님 라벨들을 기준으로 4개 그룹의 2차원 중심점과 분산 갱신)
    • $P(Z \mid \Theta, X)$ (각 그룹의 2차원 프로필을 기준으로 각 손님의 라벨을 조건부 확률에 따라 재할당)
    이 두 과정을 번갈아 수행하며, 마르코프 체인이 도달하는 불변 분포(정상 상태)가 바로 이 전체 변수들의 결합분포가 됩니다.

요약

결국 두 예시 모두에서 '결합분포'란 "데이터의 잠재적 소속 라벨들"과 "그 라벨들이 규정하는 그룹들의 수학적 특성(평균, 분산 등)"을 한 덩어리로 묶은 다차원 결합 확률분포를 말합니다.