본문 바로가기

Study/NLP4

[NLP] Feature Extraction From Text(TF-IDF, BM25) Feature Extraction From Text(텍스트 특징 추출)대부분의 일반적인 머신러닝은 원시 텍스트를 이해하거나 받아들일 수 없다.대신 수치적 특성을 전달하기 위해 원시 텍스트에서 특징을 추출해야 한다.각 단어가 나타나는 횟수, 카운트 벡터화, 단어 빈도, 역 문서 빈도카운트 벡터화모든 중복되지 않는 단어(특징)의 등장 횟수를 센다.이를 각 문서(=메시지) 별로 정리[한계]최소 표현으로 인한 리소스 낭비빈도적 접근에 따른 문제⇒ DTM(문서 단어 행렬)TF-IDF VectorizerTF(Term-Frequency; 단어 빈도; tf(t, d))단어와 특정 문서의 함수 = 문서에서 그 단어가 나타난 횟수IDF(Inverse Document Frequency)문서들에 매우 빈번하게 나타나는 단어의.. 2026. 1. 27.
[NLP] 분류 평가 기준&ConfusionMatrix&Regression(Linear, Logistic) 분류 평가 기준Accuracy, Recall, Precision, F1-ScoreAccuracy(정확도)올바르게 예측한 횟수 / 전체 예측 횟수대상 클래스의 균형이 잡혀 있을 때 유용. 균형이 맞지 않으면 좋은 평가 기준이 아님Recall(재현율)데이터셋에서 모든 적절한 경우Precision(정밀도)분류모델이 적절한 데이터만 찾아내는 경우F1-Score재현율과 정밀도 사이의 균형을 맞추기 위한 지표조화 평균을 쓰는 이유: 극값을 반영하기 위해ex) Precision = 1, Recall = 0 단순 평균 = 0.5 = F1-Score 조화 평균 = 0 = F1-ScoreConfusion Matrix(혼동 행렬)분류의 다양한 평가 기준총 4가지로 분류SPAM / HAM 분리 한다고 했을 때Correct /.. 2026. 1. 10.
[NLP] Stopward&NER Stopward(불용어)문장에서 a, the와 같은 많이 사용하는 단어, 하지만 어떤 고유의 명사나 동사, 또는 수식어로 분류되지 않는 단어.자연어 처리에서 방해되기 때문에 제일 먼저 제거품사기본 품사 태그 : 명사, 동사, 형용사세부 품사 태그 : 단어가 복수형인지, 과거 시제 동사인지, 최상급 형용사인지 등개체명 인식[NER]텍스트 원문에서 언급된 개체명을 찾아 미리 정의해 놓은 범주로 분류범주 : 인명, 조직, 장소, 의료 코드, 시간 표현, 수량 등ex) Jim bought 300 shares of Acme Corp in 2006Jim[Person] bought 300 shares of Acme Corp[Organization] in 2006[Time]NER 목록TYPEDESCRIPTIONEXAM.. 2026. 1. 7.
[NLP] Tokenization, Stemming & Lemmatization Tokenization(토큰화)원시 텍스트를 문장의 구성 요소들로 분해구성 요소 = 토큰 = 원시 텍스트의 조각토큰화 단계original textsplit on whitespaceprefixexceptionsuffixexceptiondoneprefix: 접두사(ex. $ ( “)suffix: 접미사(ex. km ) “ , . !)infix: 접두사와 접미사 사이에 붙는 삽입사(ex.- — /)토큰의 성질Tokens can be retrieved by index position and sliceTokens can’t be reassignedNamed Entities(개체명)고유하게 식별 가능한 대상Ex) Apple to build a Hong Kong factory for $6 millionApple - .. 2026. 1. 6.