데이터 반출 없는 다기관 연합 인공지능 학습 플랫폼

데이터 분석 26

효과 크기(effect size) 두 지표—η²(에타제곱)와 Cramér's V

1. 에타 제곱 ($\eta^2$, Eta-squared)에타 제곱은 주로 분산분석(ANOVA)에서 사용되는 지표로, 독립 변수가 종속 변수의 전체 분산 중 얼마만큼을 설명하는지를 나타냅니다.① 직관적 의미"전체 변동 중에서 우리가 관심 있는 요인(집단 간 차이)이 차지하는 비중이 얼마나 되는가?"를 의미합니다. 예를 들어, 세 가지 다른 학습법이 성적에 미치는 영향을 조사할 때, 성적 차이(분산)가 발생한 원인 중 '학습법의 차이' 때문에 발생한 비율이 바로 $\eta^2$입니다.② 수식$$\eta^2 = \frac{SS_{between}}{SS_{total}}$$$SS_{between}$ (Sum of Squares Between groups): 집단 간 제곱합 (집단 간의 차이로 인한 변동)$SS_..

확률의 벽돌쌓기: 표준 정규분포에서 DP-GMM의 기저분포까지

머신러닝과 통계학에서 비지도학습의 끝판왕 중 하나로 꼽히는 DP-GMM(디리클레 과정 가우시안 혼합 모델)은 데이터에 맞춰 스스로 군집의 개수를 증감시키는 정교한 통계 모델입니다. 이 거대한 아키텍처는 하늘에서 불쑥 떨어진 것이 아닙니다. 고등학교 수준의 표준 정규분포라는 가장 단순한 확률적 벽돌에서 출발하여, 차원을 넓히고, 행렬을 뒤집고, 켤레성을 부여하며 층층이 쌓아 올린 논리적 빌드업의 최종 결과물입니다. 이 7단계의 유기적인 개념 사다리를 차례대로 올라가 봅니다.1. 표준 정규분포: 모든 확률 모델의 1차원 출발점$$Z \sim \mathcal{N}(0, 1)$$개념: 평균이 0, 분산이 1인 가장 대칭적이고 이상적인 연속 확률분포입니다.장치로서의 역할: 통계학의 가장 순수한 원자재입니다. 키,..

군집이 몇 개인지 모를 때: 비모수 베이지안 이야기

카페에 앉아서동네 카페에 앉아 오가는 손님들을 무심코 관찰한다고 해봅시다. 손님마다 키와 몸무게가 다르고, 얼핏 보면 두 무리 정도로 나뉘는 것 같기도 합니다. 그런데 정말 두 무리일까요? 세 무리는 아닐까요? 아니면 그냥 하나의 큰 덩어리일까요?이 질문— "데이터가 몇 개의 군집으로 나뉘는가" — 은 통계학에서 생각보다 까다로운 문제입니다. 대부분의 군집화 기법(k-means가 대표적입니다)은 이 질문에 답하기 전에 먼저 "몇 개로 나눌지"를 사람이 정해줘야 합니다. K=2로 나눠보고, K=3으로도 나눠보고, 결과를 비교해서 "그나마 나은 것"을 고르는 식이죠. 하지만 이건 답을 찾는 게 아니라 답을 미리 정해놓고 데이터를 거기에 끼워 맞추는 것에 가깝습니다.비모수 베이지안(Nonparametric B..

디리클레 과정에서 기저 분포

디리클레 과정(Dirichlet Process)에서 기저 분포(Base Distribution, $G_0$)는 무한히 새로 생겨날 수 있는 군집들의 '씨앗'이자 '원형(Prototype)을 제공하는 가이드' 역할을 합니다. $G_0$의 구체적인 수학적 형태와 이것이 DP-GMM에서 어떻게 활용되는지 단계별로 설명합니다.1. 기저 분포($G_0$)의 본질과 역할$G_0$는 기본적으로 "군집의 파라미터(Parameter)를 생성하는 확률 분포"입니다. DP-GMM에서 군집 하나가 정의되려면 그 군집의 평균 벡터($\boldsymbol{\mu}$)와 변량/공분산 행렬($\mathbf{\Sigma}$)이 필요합니다.새로운 군집 $k$가 짠 하고 생겨날 때, 그 군집의 중심 위치와 모양 $(\boldsymbol{..

군집 개수 미리 지정하지 않고 찾기: 디리클레 과정

중국집 프로세스(CRP)가 데이터 관점에서의 행동 비유라면, 디리클레 과정(Dirichlet Process, DP)은 이를 뒷받침하는 수학적 무한 차원 확률 모델입니다. DP-GMM(Dirichlet Process Gaussian Mixture Model)의 핵심 수학적 원리를 직관적인 흐름으로 정리합니다.1. 디리클레 과정(Dirichlet Process)이란?"무한히 많은 가우시안 분포(군집)를 만들어낼 수 있는 확률 과정"입니다. 일반적인 확률 분포(예: 가우시안)는 숫자를 샘플링하지만, 디리클레 과정은 '분포 자체'를 샘플링합니다.$$G \sim \text{DP}(\alpha, G_0)$$$G_0$ (기저 분포, Base Distribution): 새로운 군집이 생길 때, 그 군집의 평균과 분산이..

군집 개수 미리 정하지 않고 찾기: 중국집 프로세스

군집의 개수($K$)를 미리 정하지 않고 데이터에 맞게 자동으로 찾아내는 기법을 통계학에서는 무한 차원 베이지안 기법(Nonparametric Bayesian)이라고 부릅니다. 이 개념을 가장 직관적으로 이해할 수 있는 대표적인 비유가 바로 '중국집 프로세스(Chinese Restaurant Process, CRP)'입니다.핵심 아이디어: "새 손님은 어느 테이블에 앉을까?"손님(데이터)이 무한히 큰 중국집에 한 명씩 들어온다고 가정해 봅시다. 이 중국집에는 이미 몇 개의 테이블(군집)이 차 있고, 손님이 앉아 있습니다. 새로 들어온 손님(새로운 데이터 포인트)은 다음 두 가지 선택지 중 하나를 확률적으로 선택합니다.기존 테이블에 합석하기: 손님이 많이 앉아 있는 인기가 많은 테이블일수록 앉을 확률이 높..

깁스 샘플링 예시: 1) 공의 무게 군집, 2) 손님 키와 몸무게 쌍 군집

각 예시를 통해 깁스 샘플링이 실제 데이터를 다룰 때 어떻게 주고받으며 반복 추론을 수행하는지 직관적으로 설명합니다.예시 1: 공의 무게로 Light / Heavy 군집 나누기상자 안에 무게만 측정된 여러 개의 공이 섞여 있습니다. 이 공들을 '가벼운 공(Light)' 그룹과 '무거운 공(Heavy)' 그룹으로 나누려고 합니다.1. 문제 상황과 핵심 아이디어우리가 원하는 것: 각 공의 그룹 라벨(Light/Heavy)과 각 그룹의 대표 무게(평균)를 찾는 것.딜레마:공들의 라벨을 알아야 그룹별 평균 무게를 계산할 수 있습니다.반대로 그룹별 평균 무게를 알아야 공을 어느 그룹에 넣을지 결정할 수 있습니다."닭이 먼저냐, 계란이 먼저냐"의 문제입니다.2. 깁스 샘플링의 작동 방식깁스 샘플링은 한쪽을 임의로 ..

마르코프 체인 -> 깁스 샘플링 -> 결합 분포 (수식 포함)

마르코프 체인과 깁스 샘플링, 그리고 이것이 목표로 하는 결합분포로 수렴하는 원리를 직관적인 비유와 단계별 논리로 정리합니다.1. 마르코프 체인(Markov Chain)이란?"바로 직전의 상태만 보고 다음 상태를 결정하는 시스템"입니다.비유 (날씨 모델): 오늘 날씨가 내일 날씨에 영향을 미칩니다. 어제, 그저께 날씨는 까마득히 잊고 '오직 오늘 날씨(현재 상태)'만 가지고 내일 비가 올지, 화창할지의 확률을 계산하여 상태를 이동하는 규칙입니다.핵심 특징:기억 상실성(Memoryless): 과거의 전체 이력은 중요하지 않고, 오직 현재 값 $X_t$에만 의존하여 다음 값 $X_{t+1}$을 뽑습니다.이렇게 상태 이동을 계속 반복(무한히 실행)하다 보면, 어느 순간 각 상태에 머무를 확률이 일정해지는 '정..

마르코프 체인 -> 깁스 샘플링 -> 결합분포 (직관적인 설명)

이 글에서는 다음 세 가지 질문에 대한 답을 제시합니다.먼저 마르코프 체인이 무엇인지?그 다음 왜 깁스 샘플링이 마르코프 체인인지?마지막으로 왜 그 체인의 불변 분포가 우리가 원하는 결합분포가 되는지?이 세 가지는 처음 접하면 굉장히 추상적으로 느껴지는데, 사실은 다음 한 문장으로 요약할 수 있습니다."깁스 샘플링은 원하는 확률분포를 직접 뽑기 어려울 때, 변수들을 하나씩 번갈아 업데이트하는 마르코프 체인을 만들고, 그 체인을 오래 돌리면 결국 우리가 원하는 결합분포를 따르게 되는 방법이다." 아래 순서대로 이해해 보겠습니다.1. 마르코프 체인이란 무엇인가?가장 직관적인 예는 방을 이동하는 사람입니다. 방이 3개 있다고 하겠습니다.A방B방C방사람은 매 분마다 방을 옮깁니다. 규칙은 다음과 같습니다. 현..

가설 검정 이해하기

1. 문제 정의1.1. 사례기존 가설: 20 대 한국인 남성의 100 미터 달리기 평균 속도는 17 초새로운 실험 결과: 무작위로 추출한 20 대 한국인 남성 500 명의 100 미터 달리기 평균 속도는 16 초위 사례에서 새로운 실험 결과가 우연히 일어났다고 보는 것이 적절할까요 아니면 가설이 유효하지 않은걸까요? 정답이 존재하지 않는 이런 종류의 문제를 다루기 위해서는 차이가 얼마나 의미있는지 표현하는 객관적인 방법이 있어야 하지 않을까요?1.2. 문제기존 가설과 새로운 실험의 결과가 양립하는 정도를 체계적인 과정을 통해 숫자로 표현하는 방법은 무엇인가?2. 용어 정리2.1. 출처: 위키백과, WIKIPEDIA통계적 추론추론 통계 또는 추론 통계학(inferential statistics)으로 불린다..