베이즈 정리
나이브 베이즈 분류기라는 이름에서도 등장하는 베이즈 이론을 먼저 알고 가야한다. 베이즈 정리란 조건부 확률을 계산하는 방법중 하나이다.
P(A)는 A가 일어날 확률, P(B|A)는 A가 일어나고나서 B가 일어날 확률이라 할때, 다음과 같이 표현할 수 있다.

나이브 베이즈 분류기는 이러한 베이즈 정리를 바탕으로 분류기를 만들 수 있다.
나이브 베이즈 분류기란?
- 사전 확률 과 새로운 확률을 바탕으로 사후 확률을 계산하는 분류 기법이다.
장점
- 속도가 빠름
- NPL 자연어 처리에 강함
P(y | X) X : 특정 데이터가 주어졋을떄 y라는 값ㅇ니 ㅇ어떻게 될까? 라는 것을 물어보는 문제
분류 문제의 사례
- zldhk ahaanrp emddml xmrtjddmf qhfEo, dutjddlsrk? skatjddlsrk
- ㅏ사진에서의 특성을 볼때, 고양이인가? 강아지 않가?
- 새로운 고객의 특성을 볼ㄷ 때, 우리 회사에 피해를 끼칠까? 끼치지 않을꺼?
- 제목, 주소 등의 특성을 볼 때 이메일이 스팸인가? 아닌지?
- 제못, 키워드 등의 특성을 볼때 이 기사가 스포츠? 정치? 경제?
분류선을 찾을떄 검증은 어떻게 하는가?
사탕 기계에 분류기 비유
- 왜 이런 비유를 들고 왔는가? : 사탕 기계는 모양을 제외하면 구별하기 힘들다. 하지만 색깔의 비율 즉 사탕 색깔의 비율만 가지고 분류하기 때문에.
실제 메일과 스팸 메일은 진짜인것 처럼 작성하지만 진짜가 아니다. 따라서 두 메일 글을 분류하기는 힘들다.
만약 실제 문장을 가지고 긍정 문장과 부정 문장을 분류하는 기계를 만든다면,
- 문장을 토큰화 한다.
- 그 문장속 긍정 단어와 부정 단어의 비율을 바탕으로 분류할 수 있다.
다시 사탕 뽑기 기계로 돌아와서 A 사탕 기계에는 긍정에 대한 글들만 넣어서 긍정과 관련된 글에 사탕 비율이 높고 B 사탕 기계에는 부정에 대한 글들만 넣어서 부정과 관련된 글에 사탕 비율이 높다 내가 사탕 10개를 미리 준비해 와서 긍정 사탕 6개와 부정 사탕 4개가 있을떄 A,B에서 각각의 뽑기를 다시 진행해서 가장 유사하게 나온것이 긍정 글이라고 볼수 있다.
우도
p(A|X) ⇒ P(X|A)
BoW(Back of Word)
(조건)
- 입력된 자연어를 대소문자 구분 없이 소문자로 통이랗여 구성 ⇒ regex
- 영문자, 숫자가 아닌 것 또는 경우의 철ㅈ차는 모두 ’ ’ 으로 치환하여 구성 → re
- 한 글자 이상의 단어만 구성할 것(빈 토큰 제외)
{\d}4
\D # 숫자 빼고 전부 다
\w # 특정 문자만
\W # 특정 문자만 뺴고 전부
\s # 공백과 연관된 모든 것을 없어지게 만든다.
\S # \s 뺴고 나머지 전부
. # Enter 빼고 전부 다