본문 바로가기
Study/NLP

[NLP] Tokenization, Stemming & Lemmatization

by kimdaepa 2026. 1. 6.

Tokenization(토큰화)

  • 원시 텍스트를 문장의 구성 요소들로 분해
    • 구성 요소 = 토큰 = 원시 텍스트의 조각
  • 토큰화 단계
    1. original text
    2. split on whitespace
    3. prefix
    4. exception
    5. suffix
    6. exception
    7. done
    • prefix: 접두사(ex. $ ( “)
    • suffix: 접미사(ex. km ) “ , . !)
    • infix: 접두사와 접미사 사이에 붙는 삽입사(ex.- — /)
  • 토큰의 성질
    • Tokens can be retrieved by index position and slice
    • Tokens can’t be reassigned
  • Named Entities(개체명)
    • 고유하게 식별 가능한 대상
    • Ex) Apple to build a Hong Kong factory for $6 million
      • Apple - ORG
      • Hong Kong - GPE
      • $6 million - MONEY
  • Noun Chunks - 명사 청크
    • 기본 명사 구문
    • 어떤 명사를 서술하기 위한 또 다른 명사 단어
    • Ex) Autonomous cars shift insurance liability toward manufacturers.
      • Autonomous cars, insurance liability, manufacturers == Noun Chunks

 

Stemming(어간 추출)

  • 연관된 단어를 분류하는 대략적인 방법
  • Porter Stemmer, Snowball(= English Stemmer, Porter2 Stemmer) 등

Lemmatization(표제어 추출)

  • 단어를 줄이는 것 이상으로 언어의 어휘 전체에 대해 형태론적인 분석을 적용
    • Ex) was → be / mice → mouse
  • 주어진 단어의 품사를 구분하는 것. 단, 단어를 일반적인 구문으로 분류하는 것이 아님
    • Ex) Running is fun.
      • Running은 동사 Run에서 왔지만, 품사는 명사
  • 자주 쓰이는 품사 약어
    약어 풀네임 한글 설명
    ADJ Adjective 형용사: 명사의 성질·상태를 설명
    ADP Adposition 전치사/후치사: 명사와 다른 요소 간의 관계를 표시 (in, on, of 등)
    ADV Adverb 부사: 동사·형용사·문장 전체를 수식
    DET Determiner 한정사: 명사의 범위·지시·수량 한정 (a, the, this)
    INTJ Interjection 감탄사: 감정·반응 표현 (oh, wow)
    NOUN Noun 명사: 사물·개념·사람·장소
    PROPN Proper Noun 고유명사: 이름·지명·기관명
    PRON Pronoun 대명사: 명사를 대신
    NUM Numeral 수사: 수량·순서
    VERB Verb 동사: 동작·상태·사건
    PUNCT Punctuation 문장부호