Tokenization(토큰화)
- 원시 텍스트를 문장의 구성 요소들로 분해
- 구성 요소 = 토큰 = 원시 텍스트의 조각
- 토큰화 단계
- original text
- split on whitespace
- prefix
- exception
- suffix
- exception
- done
- prefix: 접두사(ex. $ ( “)
- suffix: 접미사(ex. km ) “ , . !)
- infix: 접두사와 접미사 사이에 붙는 삽입사(ex.- — /)
- 토큰의 성질
- Tokens can be retrieved by index position and slice
- Tokens can’t be reassigned
- Named Entities(개체명)
- 고유하게 식별 가능한 대상
- Ex) Apple to build a Hong Kong factory for $6 million
- Apple - ORG
- Hong Kong - GPE
- $6 million - MONEY
- Noun Chunks - 명사 청크
- 기본 명사 구문
- 어떤 명사를 서술하기 위한 또 다른 명사 단어
- Ex) Autonomous cars shift insurance liability toward manufacturers.
- Autonomous cars, insurance liability, manufacturers == Noun Chunks
Stemming(어간 추출)
- 연관된 단어를 분류하는 대략적인 방법
- Porter Stemmer, Snowball(= English Stemmer, Porter2 Stemmer) 등
Lemmatization(표제어 추출)
- 단어를 줄이는 것 이상으로 언어의 어휘 전체에 대해 형태론적인 분석을 적용
- Ex) was → be / mice → mouse
- 주어진 단어의 품사를 구분하는 것. 단, 단어를 일반적인 구문으로 분류하는 것이 아님
- Ex) Running is fun.
- Running은 동사 Run에서 왔지만, 품사는 명사
- Ex) Running is fun.
- 자주 쓰이는 품사 약어
약어 풀네임 한글 설명 ADJ Adjective 형용사: 명사의 성질·상태를 설명 ADP Adposition 전치사/후치사: 명사와 다른 요소 간의 관계를 표시 (in, on, of 등) ADV Adverb 부사: 동사·형용사·문장 전체를 수식 DET Determiner 한정사: 명사의 범위·지시·수량 한정 (a, the, this) INTJ Interjection 감탄사: 감정·반응 표현 (oh, wow) NOUN Noun 명사: 사물·개념·사람·장소 PROPN Proper Noun 고유명사: 이름·지명·기관명 PRON Pronoun 대명사: 명사를 대신 NUM Numeral 수사: 수량·순서 VERB Verb 동사: 동작·상태·사건 PUNCT Punctuation 문장부호
'Study > NLP' 카테고리의 다른 글
| [NLP] Feature Extraction From Text(TF-IDF, BM25) (0) | 2026.01.27 |
|---|---|
| [NLP] 분류 평가 기준&ConfusionMatrix&Regression(Linear, Logistic) (0) | 2026.01.10 |
| [NLP] Stopward&NER (0) | 2026.01.07 |