정보량·엔트로피·KL 발산을 이해하고, 크로스 엔트로피 손실함수와 정보이론의 연결고리를 파악한다.
정보량이란?
어떤 사건의 정보량(Information Content)은 그 사건이 얼마나 "놀라운가"를 측정합니다. 자주 일어나는 사건은 정보량이 작고, 드문 사건은 정보량이 큽니다.
# 정보량 공식
I(x) = -log₂(P(x)) (단위: 비트)
# 또는
I(x) = -ln(P(x)) (단위: nat, AI에서 주로 사용)
# 예시
P("해가 동쪽에서 뜸") = 1.0 → I = -log(1.0) = 0 (놀랍지 않음)
P("로또 당첨") = 0.000001 → I = -log(0.000001) ≈ 13.8 (매우 놀람)
엔트로피(Entropy)
엔트로피는 확률분포의 평균 정보량입니다. 분포가 고를수록(불확실할수록) 엔트로피가 높습니다.
H(X) = -Σ P(x) × log P(x) (섀넌 엔트로피)
# 동전 던지기 (앞:0.5, 뒤:0.5) — 가장 불확실
H = -(0.5×log(0.5) + 0.5×log(0.5)) = 0.693 nat (최대 엔트로피)
# 불공정 동전 (앞:0.99, 뒤:0.01) — 거의 확실
H = -(0.99×log(0.99) + 0.01×log(0.01)) ≈ 0.056 nat (낮은 엔트로피)
| 상황 | 엔트로피 | 의미 |
|---|---|---|
| 완전히 확실 (P=1) | 0 | 불확실성 없음 |
| 균등 분포 | 최대 | 가장 불확실 |
| 학습 전 모델 | 높음 | 예측 불확실 |
| 잘 학습된 모델 | 낮음 | 확신 있는 예측 |
크로스 엔트로피(Cross-Entropy)
실제 분포 P와 모델의 예측 분포 Q 사이의 차이를 측정합니다. AI에서 가장 많이 사용되는 손실함수의 수학적 정체입니다.
H(P, Q) = -Σ P(x) × log Q(x)
# 이진 분류에서:
# P = 실제 레이블 (0 또는 1)
# Q = 모델 예측 확률
# y=1 (실제 양성) 일 때:
H = -log(Q) # 모델이 1에 가까운 확률을 예측할수록 손실 작음
# y=0 (실제 음성) 일 때:
H = -log(1-Q) # 모델이 0에 가까운 확률을 예측할수록 손실 작음
KL 발산(KL Divergence)
두 확률분포가 얼마나 다른지 측정합니다. 크로스 엔트로피 = 엔트로피 + KL 발산입니다.
KL(P||Q) = Σ P(x) × log(P(x)/Q(x))
# = H(P, Q) - H(P)
# 특성:
# KL(P||Q) ≥ 0 (항상 비음수)
# KL(P||Q) = 0 (P=Q일 때만)
# KL(P||Q) ≠ KL(Q||P) (비대칭)
VAE(변분 오토인코더), GAN, 강화학습에서 KL 발산이 핵심 역할을 합니다.
결정 트리와 엔트로피
결정 트리 알고리즘은 데이터를 분할할 때 엔트로피 감소량(정보 이득)이 최대가 되는 특징을 선택합니다.
정보 이득 = H(부모) - Σ (자식 크기/전체) × H(자식)
# 이 값이 클수록 좋은 분할
핵심: 엔트로피는 불확실성의 척도이고, 크로스 엔트로피 손실은 모델 예측이 실제 분포에서 얼마나 벗어났는지를 정보이론으로 측정한 것입니다.
관련 검색어 · 엔트로피 정보이론, 크로스 엔트로피 손실, KL 발산, 결정 트리 정보 이득, 딥러닝 손실함수 수학, 섀넌 엔트로피
Advertisement