목록딥러닝 (12)
Note
언어 모델이란? 단어 또는 문장에 확률을 할당하는 것을 하는 모델이다. 즉, 이전 단어 다음에 어떤 단어가 올 확률이 가장 높은 것인지를 찾아내는 것이다. 다른 유형으로는 두 사이에 어떤 단어가 올 확률이 높은 것인지를 찾는 모델이 있다. 흔히 말하는 언어 모델링은 주어진 단어를 토대로 주어지지 않은 단어를 예측하는 것이다. 단어 시퀀스에 확률을 할당해줄 때, 기본적으로 문장의 흐름이 자연스러운 쪽에 확률을 높게 할당한다. 기계 번역, 오타 교정, 음성 인식 등에서 문장의 구성이 좀 더 자연스러운 쪽으로 높은 확률을 할당한다. 예를 들면, '떠났다'와 '쩌났다'가 있다고 한다면 '떠났다'에 더 높은 확률을 할당하는 것이다. 이처럼 번역 과정, 오타, 음성 인식에서도 같이 활용된다. 크게 통계적 언어 모델..
1. 연관분석 연관분석이란 말 그대로 데이터 안에서 어떠한 연관을 가지고 있는지 찾아내는 것이다. 크게 두 가지로 정의할 수 있습니다. 첫 번째, 얼마나 같이 구매되는가? 두 번째, 한 아이템을 구매하는 사람이 특정 아이템을 구매하는가? 이와 같은 규칙을 찾아내는 것이 연관분석이며, 장바구니 분석이라고도 한다. 2. 연관분석 평가 지표 support (지지도) 항목 A의 전체 거래 건수 중에 모두를 포함하는 거래 건수의 비율. = 항목 A를 모두 포함하는 거래 수 / 전체 거래수 confidence (신뢰도) 항목 A를 포함하는 거래 중에서 B도 포함하는 거래 비율. = A와 B를 모두 포함하는 거래 수 / A가 포함된 거래 수 (조건부 확률) 신뢰도가 높을수록 유용한 규칙일 가능성이 높다. lift (..