데이터 반출 없는 다기관 연합 인공지능 학습 플랫폼

2026/08 9

희소 벡터 생성과 검색 원리

희소 벡터(Sparse Vector)는 전체 차원 중 대부분의 값이 $0$이고, 텍스트에 나타난 주요 단어(토큰) 위치에만 0이 아닌 가중치(가령 단어 중요도나 빈도)가 매핑되는 고차원 벡터 표현 방식입니다. 조항 번호, 고유명사, 전문 용어와 같은 정밀한 키워드 매칭을 수행하면서도 고차원 역색인(Inverted Index)을 통해 빠르게 검색할 수 있습니다.1. 희소 벡터 생성 원리희소 벡터는 전체 단어 사전(보통 3만~25만 차원)을 기반으로 문서를 벡터화합니다. 생성 방식은 크게 통계 기반(Lexical/BM25)과 신경망 기반(Neural/SPLADE)으로 나뉩니다.[입력 텍스트]──> [토크나이징 (Subword/Word)]──> [가중치 산출 (통계 or 신경망)]──> [Sparse Vect..

군집이 몇 개인지 모를 때: 비모수 베이지안 이야기

카페에 앉아서동네 카페에 앉아 오가는 손님들을 무심코 관찰한다고 해봅시다. 손님마다 키와 몸무게가 다르고, 얼핏 보면 두 무리 정도로 나뉘는 것 같기도 합니다. 그런데 정말 두 무리일까요? 세 무리는 아닐까요? 아니면 그냥 하나의 큰 덩어리일까요?이 질문— "데이터가 몇 개의 군집으로 나뉘는가" — 은 통계학에서 생각보다 까다로운 문제입니다. 대부분의 군집화 기법(k-means가 대표적입니다)은 이 질문에 답하기 전에 먼저 "몇 개로 나눌지"를 사람이 정해줘야 합니다. K=2로 나눠보고, K=3으로도 나눠보고, 결과를 비교해서 "그나마 나은 것"을 고르는 식이죠. 하지만 이건 답을 찾는 게 아니라 답을 미리 정해놓고 데이터를 거기에 끼워 맞추는 것에 가깝습니다.비모수 베이지안(Nonparametric B..

자연어 처리 세부 분야

자연어 처리(NLP, Natural Language Processing) 분야는 텍스트 데이터를 다루는 목적과 해결하려는 문제의 특성에 따라 여러 세부 분야로 나뉩니다. 크게 이해(NLU), 생성(NLG), 그리고 주요 하위 과업(Task)으로 구분해 설명합니다.1. 최상위 개념: 이해와 생성구분역할 및 핵심주요 목표NLU(Natural Language Understanding)자연어 이해사람의 언어를 컴퓨터가 이해할 수 있는 형태(의도, 의미, 맥락)로 해석문맥 파악, 개체 인식, 감성 분석, 문장 간 관계 파악 등NLG(Natural Language Generation)자연어 생성컴퓨터가 가진 데이터나 텍스트를 바탕으로 사람이 읽기 자연스러운 문장 작성요약, 번역, 대화 응답 생성, 스토리 집필 등2..

디리클레 과정에서 기저 분포

디리클레 과정(Dirichlet Process)에서 기저 분포(Base Distribution, $G_0$)는 무한히 새로 생겨날 수 있는 군집들의 '씨앗'이자 '원형(Prototype)을 제공하는 가이드' 역할을 합니다. $G_0$의 구체적인 수학적 형태와 이것이 DP-GMM에서 어떻게 활용되는지 단계별로 설명합니다.1. 기저 분포($G_0$)의 본질과 역할$G_0$는 기본적으로 "군집의 파라미터(Parameter)를 생성하는 확률 분포"입니다. DP-GMM에서 군집 하나가 정의되려면 그 군집의 평균 벡터($\boldsymbol{\mu}$)와 변량/공분산 행렬($\mathbf{\Sigma}$)이 필요합니다.새로운 군집 $k$가 짠 하고 생겨날 때, 그 군집의 중심 위치와 모양 $(\boldsymbol{..

군집 개수 미리 지정하지 않고 찾기: 디리클레 과정

중국집 프로세스(CRP)가 데이터 관점에서의 행동 비유라면, 디리클레 과정(Dirichlet Process, DP)은 이를 뒷받침하는 수학적 무한 차원 확률 모델입니다. DP-GMM(Dirichlet Process Gaussian Mixture Model)의 핵심 수학적 원리를 직관적인 흐름으로 정리합니다.1. 디리클레 과정(Dirichlet Process)이란?"무한히 많은 가우시안 분포(군집)를 만들어낼 수 있는 확률 과정"입니다. 일반적인 확률 분포(예: 가우시안)는 숫자를 샘플링하지만, 디리클레 과정은 '분포 자체'를 샘플링합니다.$$G \sim \text{DP}(\alpha, G_0)$$$G_0$ (기저 분포, Base Distribution): 새로운 군집이 생길 때, 그 군집의 평균과 분산이..

군집 개수 미리 정하지 않고 찾기: 중국집 프로세스

군집의 개수($K$)를 미리 정하지 않고 데이터에 맞게 자동으로 찾아내는 기법을 통계학에서는 무한 차원 베이지안 기법(Nonparametric Bayesian)이라고 부릅니다. 이 개념을 가장 직관적으로 이해할 수 있는 대표적인 비유가 바로 '중국집 프로세스(Chinese Restaurant Process, CRP)'입니다.핵심 아이디어: "새 손님은 어느 테이블에 앉을까?"손님(데이터)이 무한히 큰 중국집에 한 명씩 들어온다고 가정해 봅시다. 이 중국집에는 이미 몇 개의 테이블(군집)이 차 있고, 손님이 앉아 있습니다. 새로 들어온 손님(새로운 데이터 포인트)은 다음 두 가지 선택지 중 하나를 확률적으로 선택합니다.기존 테이블에 합석하기: 손님이 많이 앉아 있는 인기가 많은 테이블일수록 앉을 확률이 높..

깁스 샘플링 예시: 1) 공의 무게 군집, 2) 손님 키와 몸무게 쌍 군집

각 예시를 통해 깁스 샘플링이 실제 데이터를 다룰 때 어떻게 주고받으며 반복 추론을 수행하는지 직관적으로 설명합니다.예시 1: 공의 무게로 Light / Heavy 군집 나누기상자 안에 무게만 측정된 여러 개의 공이 섞여 있습니다. 이 공들을 '가벼운 공(Light)' 그룹과 '무거운 공(Heavy)' 그룹으로 나누려고 합니다.1. 문제 상황과 핵심 아이디어우리가 원하는 것: 각 공의 그룹 라벨(Light/Heavy)과 각 그룹의 대표 무게(평균)를 찾는 것.딜레마:공들의 라벨을 알아야 그룹별 평균 무게를 계산할 수 있습니다.반대로 그룹별 평균 무게를 알아야 공을 어느 그룹에 넣을지 결정할 수 있습니다."닭이 먼저냐, 계란이 먼저냐"의 문제입니다.2. 깁스 샘플링의 작동 방식깁스 샘플링은 한쪽을 임의로 ..

마르코프 체인 -> 깁스 샘플링 -> 결합 분포 (수식 포함)

마르코프 체인과 깁스 샘플링, 그리고 이것이 목표로 하는 결합분포로 수렴하는 원리를 직관적인 비유와 단계별 논리로 정리합니다.1. 마르코프 체인(Markov Chain)이란?"바로 직전의 상태만 보고 다음 상태를 결정하는 시스템"입니다.비유 (날씨 모델): 오늘 날씨가 내일 날씨에 영향을 미칩니다. 어제, 그저께 날씨는 까마득히 잊고 '오직 오늘 날씨(현재 상태)'만 가지고 내일 비가 올지, 화창할지의 확률을 계산하여 상태를 이동하는 규칙입니다.핵심 특징:기억 상실성(Memoryless): 과거의 전체 이력은 중요하지 않고, 오직 현재 값 $X_t$에만 의존하여 다음 값 $X_{t+1}$을 뽑습니다.이렇게 상태 이동을 계속 반복(무한히 실행)하다 보면, 어느 순간 각 상태에 머무를 확률이 일정해지는 '정..

마르코프 체인 -> 깁스 샘플링 -> 결합분포 (직관적인 설명)

이 글에서는 다음 세 가지 질문에 대한 답을 제시합니다.먼저 마르코프 체인이 무엇인지?그 다음 왜 깁스 샘플링이 마르코프 체인인지?마지막으로 왜 그 체인의 불변 분포가 우리가 원하는 결합분포가 되는지?이 세 가지는 처음 접하면 굉장히 추상적으로 느껴지는데, 사실은 다음 한 문장으로 요약할 수 있습니다."깁스 샘플링은 원하는 확률분포를 직접 뽑기 어려울 때, 변수들을 하나씩 번갈아 업데이트하는 마르코프 체인을 만들고, 그 체인을 오래 돌리면 결국 우리가 원하는 결합분포를 따르게 되는 방법이다." 아래 순서대로 이해해 보겠습니다.1. 마르코프 체인이란 무엇인가?가장 직관적인 예는 방을 이동하는 사람입니다. 방이 3개 있다고 하겠습니다.A방B방C방사람은 매 분마다 방을 옮깁니다. 규칙은 다음과 같습니다. 현..