데이터 반출 없는 다기관 연합 인공지능 학습 플랫폼

인공지능/자연어 처리

자연어 처리 세부 분야

FedTensor 2026. 8. 10. 09:48

자연어 처리(NLP, Natural Language Processing) 분야는 텍스트 데이터를 다루는 목적과 해결하려는 문제의 특성에 따라 여러 세부 분야로 나뉩니다. 크게 이해(NLU), 생성(NLG), 그리고 주요 하위 과업(Task)으로 구분해 설명합니다.

1. 최상위 개념: 이해와 생성

구분 역할 및 핵심 주요 목표
NLU

(Natural Language Understanding)
자연어 이해

사람의 언어를 컴퓨터가 이해할 수 있는 형태(의도, 의미, 맥락)로 해석
문맥 파악, 개체 인식, 감성 분석, 문장 간 관계 파악 등
NLG

(Natural Language Generation)
자연어 생성

컴퓨터가 가진 데이터나 텍스트를 바탕으로 사람이 읽기 자연스러운 문장 작성
요약, 번역, 대화 응답 생성, 스토리 집필 등

2. NLU 기반 세부 학습 분야

컴퓨터가 문장의 의미적 관계나 의도를 깊게 파악하도록 학습시키는 분야들입니다.

자연어 추론 (Natural Language Inference, NLI)

  • 개념: 두 문장(전제와 가설)이 주어졌을 때, 가설이 전제로부터 참(Entailment)인지, 모순(Contradiction)인지, 중립(Neutral)인지를 판별하는 과업입니다.
  • 핵심: 문맥상의 논리적 함의 관계를 이해해야 하므로, 모델의 고차원적 언어 이해 능력을 평가하는 핵심 지표로 쓰입니다.
  • 예시:
    • 전제: "한 남자가 공원에서 강아지와 뛰놀고 있다."
    • 가설: "남자는 야외에 있다." $\rightarrow$ 참(Entailment)

문장 의미적 유사도 (Semantic Textual Similarity, STS)

  • 개념: 두 문장이 의미적으로 얼마나 유사한지를 점수(예: 0~5점)나 연속적인 수치로 측정합니다.
  • 핵심: 단순히 단어가 얼마나 겹치는지 보는 게 아니라, 다른 단어를 썼더라도 뜻이 통하는지 임베딩 공간에서 벡터 거리를 계산해 평가합니다.
  • 활용: 검색 시스템(RAG), 중복 질문 탐지, 추천 시스템 등

개체명 인식 (Named Entity Recognition, NER)

  • 개념: 텍스트 내에서 인물, 조직, 지역, 날짜, 시간, 수량 등의 고유한 정보를 추출하고 카테고리화합니다.
  • 예시: "이순신 신부님이 서울에서 2026년에 설립했다."
    • 서울 $\rightarrow$ LOCATION, 2026년 $\rightarrow$ DATE

의도 분류 및 슬롯 채우기 (Intent Classification & Slot Filling)

  • 개념: 대화형 AI(대화 시스템)의 핵심으로, 사용자의 말속 의도를 파악하고 필요한 정보(파라미터)를 추출합니다.
  • 예시: "내일 서울 날씨 알려줘"
    • 의도: Get_Weather / 슬롯: Date=내일, Location=서울

3. 대표적인 NLP 핵심 응용 분야

기계 독해 (Machine Reading Comprehension, MRC)

  • 개념: 제시된 지문(Passage)을 모델이 읽고, 해당 지문에 기반한 질문(Question)이 들어왔을 때 정답(Answer)을 찾아내거나 생성합니다.
  • 활용: 문서 기반 Q&A 시스템, 지식 검색, RAG(검색 증강 생성) 핵심 모듈

텍스트 분류 (Text Classification)

  • 개념: 입력된 텍스트를 미리 정해진 카테고리로 분류합니다.
  • 세부 분야:
    • 감성 분석(Sentiment Analysis): 긍정/부정/중립 판별 (예: 영화 리뷰, 고객 피드백 분석)
    • 스팸/유해성 필터링: 스팸 메일, 악성 댓글 감지
    • 주제 분류: 뉴스 기사를 정치, 경제, IT 등으로 분류

기계 번역 (Machine Translation, MT)

  • 개념: 한 언어의 텍스트를 의미를 유지하면서 다른 언어로 전환합니다.
  • 트렌드: 과거 통계 기반(SMT)에서 현재는 신경망 기반(NMT) 및 Transformer 아키텍처 중심으로 발전했습니다.

텍스트 요약 (Text Summarization)

  • 개념: 긴 문서나 대화에서 핵심 내용을 뽑아 짧은 요약문으로 만듭니다.
  • 구분:
    • 추출 요약(Extractive): 본문 중 중요 문장을 그대로 선택
    • 생성 요약(Abstractive): 본문 의미를 이해한 후 새로운 문장으로 재작성

4. 학습 관점에서의 분류

과업 성격 외에 모델을 어떻게 학습시키는지에 따른 구분도 중요합니다.

  • 자율/자기 지도 학습 (Self-Supervised Learning):
    • 라벨 없는 대용량 텍스트로 언어의 기본 구조를 배웁니다.
    • 예: MLM(Masked Language Modeling, BERT 방식), Causal Language Modeling(GPT 방식)
  • 미세 조정 (Fine-tuning):
    • 사전 학습된 LLM을 특정 과업(NLI, STS, 분류 등) 데이터셋으로 지도 학습시켜 전문 성능을 높입니다.
  • 인간 피드백 기반 강화학습 / 직접 선호도 최적화 (RLHF / DPO):
    • 생성된 답변이 인간의 의도와 윤리적 기준에 부합하도록 정렬하는 학습 방식입니다.