데이터 반출 없는 다기관 연합 인공지능 학습 플랫폼

분류 전체보기 217

효과 크기(effect size) 두 지표—η²(에타제곱)와 Cramér's V

1. 에타 제곱 ($\eta^2$, Eta-squared)에타 제곱은 주로 분산분석(ANOVA)에서 사용되는 지표로, 독립 변수가 종속 변수의 전체 분산 중 얼마만큼을 설명하는지를 나타냅니다.① 직관적 의미"전체 변동 중에서 우리가 관심 있는 요인(집단 간 차이)이 차지하는 비중이 얼마나 되는가?"를 의미합니다. 예를 들어, 세 가지 다른 학습법이 성적에 미치는 영향을 조사할 때, 성적 차이(분산)가 발생한 원인 중 '학습법의 차이' 때문에 발생한 비율이 바로 $\eta^2$입니다.② 수식$$\eta^2 = \frac{SS_{between}}{SS_{total}}$$$SS_{between}$ (Sum of Squares Between groups): 집단 간 제곱합 (집단 간의 차이로 인한 변동)$SS_..

확률의 벽돌쌓기: 표준 정규분포에서 DP-GMM의 기저분포까지

머신러닝과 통계학에서 비지도학습의 끝판왕 중 하나로 꼽히는 DP-GMM(디리클레 과정 가우시안 혼합 모델)은 데이터에 맞춰 스스로 군집의 개수를 증감시키는 정교한 통계 모델입니다. 이 거대한 아키텍처는 하늘에서 불쑥 떨어진 것이 아닙니다. 고등학교 수준의 표준 정규분포라는 가장 단순한 확률적 벽돌에서 출발하여, 차원을 넓히고, 행렬을 뒤집고, 켤레성을 부여하며 층층이 쌓아 올린 논리적 빌드업의 최종 결과물입니다. 이 7단계의 유기적인 개념 사다리를 차례대로 올라가 봅니다.1. 표준 정규분포: 모든 확률 모델의 1차원 출발점$$Z \sim \mathcal{N}(0, 1)$$개념: 평균이 0, 분산이 1인 가장 대칭적이고 이상적인 연속 확률분포입니다.장치로서의 역할: 통계학의 가장 순수한 원자재입니다. 키,..

음성예측도: 민감도, 특이도, 유병률로 표현

음성예측도(NPV, Negative Predictive Value)를 민감도($Se$), 특이도($Sp$), 유병률($P$)로 표현하는 베이즈 정리(Bayes' theorem) 기반 공식은 다음과 같습니다.1. 음성예측도 수식$$\text{NPV} = \frac{Sp \times (1 - P)}{(1 - Se) \times P + Sp \times (1 - P)}$$$Se$ (민감도, Sensitivity): 실제 환자 중 검사 결과가 양성으로 나온 비율$Sp$ (특이도, Specificity): 실제 비환자(정상) 중 검사 결과가 음성으로 나온 비율$P$ (유병률, Prevalence): 전체 대상 집단 중 실제 질환을 앓고 있는 환자의 비율$1 - P$: 비환자(정상)의 비율$1 - Se$: 위음성률..

희소 벡터 생성과 검색 원리

희소 벡터(Sparse Vector)는 전체 차원 중 대부분의 값이 $0$이고, 텍스트에 나타난 주요 단어(토큰) 위치에만 0이 아닌 가중치(가령 단어 중요도나 빈도)가 매핑되는 고차원 벡터 표현 방식입니다. 조항 번호, 고유명사, 전문 용어와 같은 정밀한 키워드 매칭을 수행하면서도 고차원 역색인(Inverted Index)을 통해 빠르게 검색할 수 있습니다.1. 희소 벡터 생성 원리희소 벡터는 전체 단어 사전(보통 3만~25만 차원)을 기반으로 문서를 벡터화합니다. 생성 방식은 크게 통계 기반(Lexical/BM25)과 신경망 기반(Neural/SPLADE)으로 나뉩니다.[입력 텍스트]──> [토크나이징 (Subword/Word)]──> [가중치 산출 (통계 or 신경망)]──> [Sparse Vect..

군집이 몇 개인지 모를 때: 비모수 베이지안 이야기

카페에 앉아서동네 카페에 앉아 오가는 손님들을 무심코 관찰한다고 해봅시다. 손님마다 키와 몸무게가 다르고, 얼핏 보면 두 무리 정도로 나뉘는 것 같기도 합니다. 그런데 정말 두 무리일까요? 세 무리는 아닐까요? 아니면 그냥 하나의 큰 덩어리일까요?이 질문— "데이터가 몇 개의 군집으로 나뉘는가" — 은 통계학에서 생각보다 까다로운 문제입니다. 대부분의 군집화 기법(k-means가 대표적입니다)은 이 질문에 답하기 전에 먼저 "몇 개로 나눌지"를 사람이 정해줘야 합니다. K=2로 나눠보고, K=3으로도 나눠보고, 결과를 비교해서 "그나마 나은 것"을 고르는 식이죠. 하지만 이건 답을 찾는 게 아니라 답을 미리 정해놓고 데이터를 거기에 끼워 맞추는 것에 가깝습니다.비모수 베이지안(Nonparametric B..

자연어 처리 세부 분야

자연어 처리(NLP, Natural Language Processing) 분야는 텍스트 데이터를 다루는 목적과 해결하려는 문제의 특성에 따라 여러 세부 분야로 나뉩니다. 크게 이해(NLU), 생성(NLG), 그리고 주요 하위 과업(Task)으로 구분해 설명합니다.1. 최상위 개념: 이해와 생성구분역할 및 핵심주요 목표NLU(Natural Language Understanding)자연어 이해사람의 언어를 컴퓨터가 이해할 수 있는 형태(의도, 의미, 맥락)로 해석문맥 파악, 개체 인식, 감성 분석, 문장 간 관계 파악 등NLG(Natural Language Generation)자연어 생성컴퓨터가 가진 데이터나 텍스트를 바탕으로 사람이 읽기 자연스러운 문장 작성요약, 번역, 대화 응답 생성, 스토리 집필 등2..

디리클레 과정에서 기저 분포

디리클레 과정(Dirichlet Process)에서 기저 분포(Base Distribution, $G_0$)는 무한히 새로 생겨날 수 있는 군집들의 '씨앗'이자 '원형(Prototype)을 제공하는 가이드' 역할을 합니다. $G_0$의 구체적인 수학적 형태와 이것이 DP-GMM에서 어떻게 활용되는지 단계별로 설명합니다.1. 기저 분포($G_0$)의 본질과 역할$G_0$는 기본적으로 "군집의 파라미터(Parameter)를 생성하는 확률 분포"입니다. DP-GMM에서 군집 하나가 정의되려면 그 군집의 평균 벡터($\boldsymbol{\mu}$)와 변량/공분산 행렬($\mathbf{\Sigma}$)이 필요합니다.새로운 군집 $k$가 짠 하고 생겨날 때, 그 군집의 중심 위치와 모양 $(\boldsymbol{..

군집 개수 미리 지정하지 않고 찾기: 디리클레 과정

중국집 프로세스(CRP)가 데이터 관점에서의 행동 비유라면, 디리클레 과정(Dirichlet Process, DP)은 이를 뒷받침하는 수학적 무한 차원 확률 모델입니다. DP-GMM(Dirichlet Process Gaussian Mixture Model)의 핵심 수학적 원리를 직관적인 흐름으로 정리합니다.1. 디리클레 과정(Dirichlet Process)이란?"무한히 많은 가우시안 분포(군집)를 만들어낼 수 있는 확률 과정"입니다. 일반적인 확률 분포(예: 가우시안)는 숫자를 샘플링하지만, 디리클레 과정은 '분포 자체'를 샘플링합니다.$$G \sim \text{DP}(\alpha, G_0)$$$G_0$ (기저 분포, Base Distribution): 새로운 군집이 생길 때, 그 군집의 평균과 분산이..

군집 개수 미리 정하지 않고 찾기: 중국집 프로세스

군집의 개수($K$)를 미리 정하지 않고 데이터에 맞게 자동으로 찾아내는 기법을 통계학에서는 무한 차원 베이지안 기법(Nonparametric Bayesian)이라고 부릅니다. 이 개념을 가장 직관적으로 이해할 수 있는 대표적인 비유가 바로 '중국집 프로세스(Chinese Restaurant Process, CRP)'입니다.핵심 아이디어: "새 손님은 어느 테이블에 앉을까?"손님(데이터)이 무한히 큰 중국집에 한 명씩 들어온다고 가정해 봅시다. 이 중국집에는 이미 몇 개의 테이블(군집)이 차 있고, 손님이 앉아 있습니다. 새로 들어온 손님(새로운 데이터 포인트)은 다음 두 가지 선택지 중 하나를 확률적으로 선택합니다.기존 테이블에 합석하기: 손님이 많이 앉아 있는 인기가 많은 테이블일수록 앉을 확률이 높..

깁스 샘플링 예시: 1) 공의 무게 군집, 2) 손님 키와 몸무게 쌍 군집

각 예시를 통해 깁스 샘플링이 실제 데이터를 다룰 때 어떻게 주고받으며 반복 추론을 수행하는지 직관적으로 설명합니다.예시 1: 공의 무게로 Light / Heavy 군집 나누기상자 안에 무게만 측정된 여러 개의 공이 섞여 있습니다. 이 공들을 '가벼운 공(Light)' 그룹과 '무거운 공(Heavy)' 그룹으로 나누려고 합니다.1. 문제 상황과 핵심 아이디어우리가 원하는 것: 각 공의 그룹 라벨(Light/Heavy)과 각 그룹의 대표 무게(평균)를 찾는 것.딜레마:공들의 라벨을 알아야 그룹별 평균 무게를 계산할 수 있습니다.반대로 그룹별 평균 무게를 알아야 공을 어느 그룹에 넣을지 결정할 수 있습니다."닭이 먼저냐, 계란이 먼저냐"의 문제입니다.2. 깁스 샘플링의 작동 방식깁스 샘플링은 한쪽을 임의로 ..