10강

기댓값·분산·표준편차

2 조회 1

기댓값·분산·표준편차를 계산하고, AI 모델 성능 평가와 배치 정규화에서 이를 활용하는 방법을 익힌다.

기댓값(Expected Value)

기댓값은 확률 변수의 평균적인 값입니다. "이 실험을 무한히 반복하면 평균적으로 얼마가 나올까?"에 대한 답입니다.

# 이산 확률 변수의 기댓값
E[X] = Σ (x × P(X=x))

# 주사위 기댓값
E[X] = 1×(1/6) + 2×(1/6) + 3×(1/6) + 4×(1/6) + 5×(1/6) + 6×(1/6)
     = 3.5

머신러닝에서 "평균 손실(mean loss)"이 바로 기댓값입니다.

분산(Variance)

분산은 값들이 평균에서 얼마나 멀리 퍼져 있는지를 측정합니다.

Var[X] = E[(X - μ)²] = E[X²] - (E[X])²
# μ = E[X] (평균)

# 예시: 두 학생의 시험 점수
# A: 70, 70, 70, 70  → 평균 70, 분산 0
# B: 40, 60, 80, 100 → 평균 70, 분산 500

import numpy as np
print(np.var([70, 70, 70, 70]))   # 0.0
print(np.var([40, 60, 80, 100]))  # 500.0

표준편차(Standard Deviation)

분산의 제곱근. 원래 단위와 같아서 해석이 쉽습니다.

σ = √Var[X]

# 위의 예시
# A의 표준편차: 0
# B의 표준편차: √500 ≈ 22.4

AI에서의 활용

1. 배치 정규화(Batch Normalization)

각 레이어의 출력을 평균 0, 표준편차 1로 정규화하여 학습을 안정화합니다.

# 배치 정규화 수식
x_normalized = (x - mean(x)) / std(x)

# PyTorch
import torch.nn as nn
bn = nn.BatchNorm1d(num_features=256)
output = bn(layer_output)

2. 데이터 전처리: 표준화(Standardization)

from sklearn.preprocessing import StandardScaler
scaler = StandardScaler()
X_scaled = scaler.fit_transform(X)
# 각 피처를 평균=0, 표준편차=1로 변환

3. 모델 성능 지표

# MSE = Mean Squared Error = 평균 제곱 오차
# 예측값과 실제값 차이의 제곱 기댓값
MSE = E[(y_pred - y_true)^2]

# RMSE = Root MSE = 표준편차와 유사한 의미
RMSE = sqrt(MSE)

공분산과 상관관계

두 변수가 함께 변화하는 경향을 측정합니다.

# 공분산
Cov(X, Y) = E[(X - μX)(Y - μY)]

# 상관계수 (-1 ~ 1)
ρ = Cov(X, Y) / (σX × σY)
# 1에 가까울수록 강한 양의 상관관계

데이터 피처 간 상관관계 분석은 피처 엔지니어링의 기초입니다.

핵심: 기댓값은 중심, 분산은 퍼짐을 나타냅니다. 배치 정규화·손실함수·데이터 전처리 등 AI의 핵심 기법들이 이 개념에 기반합니다.

관련 검색어  ·  기댓값 분산 표준편차, 배치 정규화, MSE RMSE, 상관관계, 데이터 표준화, 딥러닝 통계

댓글 0

채용정보
공지사항
인사이트
MY