기댓값·분산·표준편차를 계산하고, AI 모델 성능 평가와 배치 정규화에서 이를 활용하는 방법을 익힌다.
기댓값(Expected Value)
기댓값은 확률 변수의 평균적인 값입니다. "이 실험을 무한히 반복하면 평균적으로 얼마가 나올까?"에 대한 답입니다.
# 이산 확률 변수의 기댓값
E[X] = Σ (x × P(X=x))
# 주사위 기댓값
E[X] = 1×(1/6) + 2×(1/6) + 3×(1/6) + 4×(1/6) + 5×(1/6) + 6×(1/6)
= 3.5
머신러닝에서 "평균 손실(mean loss)"이 바로 기댓값입니다.
분산(Variance)
분산은 값들이 평균에서 얼마나 멀리 퍼져 있는지를 측정합니다.
Var[X] = E[(X - μ)²] = E[X²] - (E[X])²
# μ = E[X] (평균)
# 예시: 두 학생의 시험 점수
# A: 70, 70, 70, 70 → 평균 70, 분산 0
# B: 40, 60, 80, 100 → 평균 70, 분산 500
import numpy as np
print(np.var([70, 70, 70, 70])) # 0.0
print(np.var([40, 60, 80, 100])) # 500.0
표준편차(Standard Deviation)
분산의 제곱근. 원래 단위와 같아서 해석이 쉽습니다.
σ = √Var[X]
# 위의 예시
# A의 표준편차: 0
# B의 표준편차: √500 ≈ 22.4
AI에서의 활용
1. 배치 정규화(Batch Normalization)
각 레이어의 출력을 평균 0, 표준편차 1로 정규화하여 학습을 안정화합니다.
# 배치 정규화 수식
x_normalized = (x - mean(x)) / std(x)
# PyTorch
import torch.nn as nn
bn = nn.BatchNorm1d(num_features=256)
output = bn(layer_output)
2. 데이터 전처리: 표준화(Standardization)
from sklearn.preprocessing import StandardScaler
scaler = StandardScaler()
X_scaled = scaler.fit_transform(X)
# 각 피처를 평균=0, 표준편차=1로 변환
3. 모델 성능 지표
# MSE = Mean Squared Error = 평균 제곱 오차
# 예측값과 실제값 차이의 제곱 기댓값
MSE = E[(y_pred - y_true)^2]
# RMSE = Root MSE = 표준편차와 유사한 의미
RMSE = sqrt(MSE)
공분산과 상관관계
두 변수가 함께 변화하는 경향을 측정합니다.
# 공분산
Cov(X, Y) = E[(X - μX)(Y - μY)]
# 상관계수 (-1 ~ 1)
ρ = Cov(X, Y) / (σX × σY)
# 1에 가까울수록 강한 양의 상관관계
데이터 피처 간 상관관계 분석은 피처 엔지니어링의 기초입니다.
핵심: 기댓값은 중심, 분산은 퍼짐을 나타냅니다. 배치 정규화·손실함수·데이터 전처리 등 AI의 핵심 기법들이 이 개념에 기반합니다.
관련 검색어 · 기댓값 분산 표준편차, 배치 정규화, MSE RMSE, 상관관계, 데이터 표준화, 딥러닝 통계