第13講

정보이론 맛보기(엔트로피)

2 閲覧 1

정보량·엔트로피·KL 발산을 이해하고, 크로스 엔트로피 손실함수와 정보이론의 연결고리를 파악한다.

정보량이란?

어떤 사건의 정보량(Information Content)은 그 사건이 얼마나 "놀라운가"를 측정합니다. 자주 일어나는 사건은 정보량이 작고, 드문 사건은 정보량이 큽니다.

# 정보량 공식
I(x) = -log₂(P(x))   (단위: 비트)
# 또는
I(x) = -ln(P(x))     (단위: nat, AI에서 주로 사용)

# 예시
P("해가 동쪽에서 뜸") = 1.0  → I = -log(1.0) = 0  (놀랍지 않음)
P("로또 당첨") = 0.000001    → I = -log(0.000001) ≈ 13.8  (매우 놀람)

엔트로피(Entropy)

엔트로피는 확률분포의 평균 정보량입니다. 분포가 고를수록(불확실할수록) 엔트로피가 높습니다.

H(X) = -Σ P(x) × log P(x)   (섀넌 엔트로피)

# 동전 던지기 (앞:0.5, 뒤:0.5) — 가장 불확실
H = -(0.5×log(0.5) + 0.5×log(0.5)) = 0.693 nat (최대 엔트로피)

# 불공정 동전 (앞:0.99, 뒤:0.01) — 거의 확실
H = -(0.99×log(0.99) + 0.01×log(0.01)) ≈ 0.056 nat (낮은 엔트로피)
상황엔트로피의미
완전히 확실 (P=1)0불확실성 없음
균등 분포최대가장 불확실
학습 전 모델높음예측 불확실
잘 학습된 모델낮음확신 있는 예측

크로스 엔트로피(Cross-Entropy)

실제 분포 P와 모델의 예측 분포 Q 사이의 차이를 측정합니다. AI에서 가장 많이 사용되는 손실함수의 수학적 정체입니다.

H(P, Q) = -Σ P(x) × log Q(x)

# 이진 분류에서:
# P = 실제 레이블 (0 또는 1)
# Q = 모델 예측 확률

# y=1 (실제 양성) 일 때:
H = -log(Q)  # 모델이 1에 가까운 확률을 예측할수록 손실 작음

# y=0 (실제 음성) 일 때:
H = -log(1-Q)  # 모델이 0에 가까운 확률을 예측할수록 손실 작음

KL 발산(KL Divergence)

두 확률분포가 얼마나 다른지 측정합니다. 크로스 엔트로피 = 엔트로피 + KL 발산입니다.

KL(P||Q) = Σ P(x) × log(P(x)/Q(x))
# = H(P, Q) - H(P)

# 특성:
# KL(P||Q) ≥ 0  (항상 비음수)
# KL(P||Q) = 0  (P=Q일 때만)
# KL(P||Q) ≠ KL(Q||P)  (비대칭)

VAE(변분 오토인코더), GAN, 강화학습에서 KL 발산이 핵심 역할을 합니다.

결정 트리와 엔트로피

결정 트리 알고리즘은 데이터를 분할할 때 엔트로피 감소량(정보 이득)이 최대가 되는 특징을 선택합니다.

정보 이득 = H(부모) - Σ (자식 크기/전체) × H(자식)
# 이 값이 클수록 좋은 분할
핵심: 엔트로피는 불확실성의 척도이고, 크로스 엔트로피 손실은 모델 예측이 실제 분포에서 얼마나 벗어났는지를 정보이론으로 측정한 것입니다.

관련 검색어  ·  엔트로피 정보이론, 크로스 엔트로피 손실, KL 발산, 결정 트리 정보 이득, 딥러닝 손실함수 수학, 섀넌 엔트로피

Advertisement

コメント0件

채용정보
공지사항
인사이트
MY