데이터 반출 없는 다기관 연합 인공지능 학습 플랫폼

데이터 분석/군집화

디리클레 과정에서 기저 분포

FedTensor 2026. 8. 6. 18:34

디리클레 과정(Dirichlet Process)에서 기저 분포(Base Distribution, $G_0$)는 무한히 새로 생겨날 수 있는 군집들의 '씨앗'이자 '원형(Prototype)을 제공하는 가이드' 역할을 합니다.

 

$G_0$의 구체적인 수학적 형태와 이것이 DP-GMM에서 어떻게 활용되는지 단계별로 설명합니다.

1. 기저 분포($G_0$)의 본질과 역할

$G_0$는 기본적으로 "군집의 파라미터(Parameter)를 생성하는 확률 분포"입니다.

 

DP-GMM에서 군집 하나가 정의되려면 그 군집의 평균 벡터($\boldsymbol{\mu}$)와 변량/공분산 행렬($\mathbf{\Sigma}$)이 필요합니다.

  • 새로운 군집 $k$가 짠 하고 생겨날 때, 그 군집의 중심 위치와 모양 $(\boldsymbol{\mu}_k, \mathbf{\Sigma}_k)$을 어디서 무작위로 뽑아올지 정해주는 공급원이 바로 $G_0$입니다.
  • 수학 표기: $\theta_k = (\boldsymbol{\mu}_k, \mathbf{\Sigma}_k) \sim G_0$

2. 기저 분포 $G_0$는 어떠한 형태일 수 있는가?

수학적 편의성과 물리적 의미를 위해, $G_0$는 주로 관측 데이터의 분포와 '켤레 사전 분포(Conjugate Prior)' 관계에 있는 분포를 선택합니다.

 

데이터가 가우시안(성인 키/몸무게 등)을 따르는 DP-GMM에서는 주로 Normal-Inverse-Wishart(NIW) 또는 Normal-Gamma 분포를 $G_0$로 사용합니다.

① Normal-Inverse-Wishart (NIW) 분포 (다차원 데이터용)

가장 대표적인 $G_0$ 형태입니다. 평균 $\boldsymbol{\mu}$와 공분산 행렬 $\mathbf{\Sigma}$를 동시에 생성합니다.

$$G_0 = \text{NIW}(\boldsymbol{\mu}_0, \kappa_0, \mathbf{\Lambda}_0, \nu_0)$$
  • $\boldsymbol{\mu}_0$ (기초 중심): 새로 생기는 군집 평균들이 대략 어느 위치 근처에 형성을 시작할지 알려줍니다. (예: 전체 데이터의 글로벌 평균)
  • $\kappa_0$ (위치 확신도): 군집 평균들이 $\boldsymbol{\mu}_0$에 얼마나 빡빡하게 모일지, 아니면 넓게 퍼져 생성될지 결정합니다.
  • $\mathbf{\Lambda}_0, \nu_0$ (형태 및 크기 가이드): 새로 생기는 군집의 모양(타원 형태)과 분산 크기의 기대값을 제공합니다.

② Normal-Gamma 분포 (1차원 데이터용)

공의 무게 예시처럼 데이터가 1차원 숫자일 때는 공분산 대신 분산/정밀도(Precision)를 사용하므로 Normal-Gamma 분포를 $G_0$로 채택합니다.

3. 기저 분포 $G_0$는 실제 추론에서 어떻게 활용되는가?

깁스 샘플링으로 DP-GMM을 실행할 때 $G_0$는 다음 두 가지 핵심 국면에서 활용됩니다.

① 새로운 군집이 탄생할 확률(가중치) 계산

손님 A가 들어왔을 때 기존 군집 어디에도 맞지 않아 아예 새로운 군집을 만들 확률을 계산해야 합니다. 이때 $G_0$가 쓰입니다.

$$\text{새 군집 생성 확률} \propto \alpha \times p(\mathbf{x}_A \mid G_0)$$

여기서 $p(\mathbf{x}_A \mid G_0)$는 "기저 분포 $G_0$가 제안하는 수많은 가능한 군집들 전체를 통틀어 보았을 때, 손님 A의 데이터가 설명될 적합도(Marginal Likelihood)"입니다.

  • 손님 A가 데이터의 일반적인 범위 내에 있다면 $p(\mathbf{x}_A \mid G_0)$가 어느 정도 높게 나와 새 군집을 형성할 자격을 얻습니다.
  • 완전히 터무니없는 아웃라이어 데이터라면 이 값이 극도로 낮아집니다.

② 새 군집의 초기 위치 설정 및 기존 군집의 억제(Regularization)

  • 탄생 순간: 새 군집 $K_{new}$가 결정되면, $G_0$와 손님 A의 관측값을 결합한 사후분포에서 새 군집의 평균과 분산 $(\boldsymbol{\mu}{new}, \mathbf{\Sigma}{new})$을 즉시 생성해냅니다.
  • 학습 안정화: 군집에 포함된 데이터 개수가 매우 적을 때(예: 데이터 2개뿐인 군집), 데이터만 가지고 평균/분산을 구하면 분산이 $0$으로 터지거나 왜곡되기 쉽습니다. 이때 $G_0$가 등대 역할을 하여 군집이 말도 안 되는 모양으로 찌그러지지 않도록 잡아줍니다.

요약

  • 형태: 관측 모델과 켤레 관계를 이루는 Normal-Inverse-Wishart(NIW) 등의 사전 확률 분포 형태로 존재합니다.
  • 활용:
    1. 새 군집이 생성될 때 그 군집의 평균과 공분산을 뽑아내는 샘플링 원천으로 쓰입니다.
    2. 깁스 샘플링 도중 새 군집을 만들지 말지 판단하는 평가 기준이 됩니다.
    3. 데이터가 적은 군집이 이상한 형태(오버피팅)로 찌그러지지 않게 억제하는 역할을 합니다.