第14講

종합: 신경망 속 수학 따라가기

3 閲覧 1

이 시리즈에서 배운 선형대수·미적분·확률통계가 신경망 순전파와 역전파에서 어떻게 함께 작동하는지 통합하여 정리한다.

신경망 속 수학 총정리

지금까지 배운 선형대수, 미적분, 확률·통계가 신경망에서 어떻게 유기적으로 작동하는지 전체 흐름을 따라가 봅니다. 이것이 이 시리즈의 최종 목표입니다.

신경망 구조 한눈에 보기

# 간단한 2레이어 신경망
입력층 (784) → 은닉층 (256) → 출력층 (10)
# MNIST 손글씨: 28×28=784 픽셀 → 숫자 0~9 분류

순전파(Forward Pass): 선형대수의 무대

# 레이어 1: 선형변환 + ReLU 활성화
Z1 = X @ W1 + b1   # (배치×784) @ (784×256) = (배치×256)
A1 = ReLU(Z1)      # 비선형 활성화

# 레이어 2: 선형변환 + 소프트맥스
Z2 = A1 @ W2 + b2  # (배치×256) @ (256×10) = (배치×10)
A2 = softmax(Z2)   # → 각 클래스의 확률분포 (합계=1)

모든 연산이 행렬 곱셈(선형대수)입니다. GPU가 이를 병렬로 처리합니다.

손실 계산: 정보이론의 무대

# 크로스 엔트로피 손실 (정보이론)
loss = CrossEntropy(A2, y_true)
     = -Σ y_true × log(A2)

# 예: 정답이 클래스 3 (인덱스 3)
# y_true = [0, 0, 0, 1, 0, 0, 0, 0, 0, 0]
# loss = -log(A2[3])  → 모델이 3일 확률이 낮을수록 손실 큼

역전파(Backward Pass): 미적분의 무대

# 역전파 = 연쇄 법칙의 반복 적용
# dL/dW2 = dL/dA2 × dA2/dZ2 × dZ2/dW2

# PyTorch가 이를 자동으로 계산
loss.backward()  # 모든 파라미터에 대한 그래디언트 자동 계산

# 그래디언트 확인
print(W1.grad.shape)  # (784, 256)
print(W2.grad.shape)  # (256, 10)

파라미터 업데이트: 경사하강법의 무대

# Adam 옵티마이저가 경사하강법 실행
optimizer.step()

# 내부적으로:
W1 = W1 - lr × dL/dW1
b1 = b1 - lr × dL/db1
W2 = W2 - lr × dL/dW2
b2 = b2 - lr × dL/db2

각 수학 분야의 역할 정리

수학 분야신경망에서의 역할
벡터 (2강)데이터 표현, 임베딩
행렬 (3강)가중치 표현, 순전파 연산
선형변환 (4강)각 레이어의 핵심 연산
미분 (5강)역전파 그래디언트 계산
경사하강법 (6강)파라미터 최적화
확률 (7~9강)소프트맥스 출력 해석
통계 (10~11강)배치 정규화, 모델 평가
손실함수 (12강)학습 목표 수치화
엔트로피 (13강)크로스 엔트로피 손실 근거

완전한 학습 사이클

model = SimpleNN()
optimizer = torch.optim.Adam(model.parameters(), lr=0.001)
loss_fn = torch.nn.CrossEntropyLoss()

for epoch in range(10):
    for X_batch, y_batch in train_loader:
        # 순전파 (선형대수)
        predictions = model(X_batch)

        # 손실 계산 (정보이론)
        loss = loss_fn(predictions, y_batch)

        # 역전파 (미적분)
        optimizer.zero_grad()
        loss.backward()

        # 업데이트 (경사하강법)
        optimizer.step()

    print(f"Epoch {epoch+1}: Loss={loss:.4f}")

다음 단계로 나아가기

이 시리즈에서 다룬 수학은 AI의 출발점입니다. 이제 이 기초 위에서 더 깊이 탐구할 수 있습니다.

  • 합성곱 신경망(CNN): 행렬 연산의 확장
  • 순환 신경망(RNN): 시간축의 연쇄 법칙
  • Transformer/어텐션: 행렬 곱셈과 소프트맥스의 정교한 조합
  • 생성 모델(GAN, Diffusion): 확률분포 학습
선형대수·미적분·확률통계는 AI의 언어입니다. 이제 그 언어로 논문을 읽고, 코드를 이해하고, 새로운 모델을 설계할 준비가 되었습니다.

관련 검색어  ·  신경망 수학 총정리, 순전파 역전파, 딥러닝 전체 흐름, AI 수학 정리, 머신러닝 수학 완성, 인공지능 기초 수학

Advertisement

コメント0件

채용정보
공지사항
인사이트
MY