#역전파
4편
- 역전파 — 기울기를 한 번에 다 구하는 법파라미터가 2만 2천 개인 망에서 수치미분으로 기울기를 구하면 12초가 걸리고, 역전파로 구하면 0.8밀리초가 걸린다. 값은 소수 열 번째 자리까지 같다. 역전파가 공짜는 아니다. 순전파의 중간값을 전부 기억해야 해서, 층을 하나 쌓을 때마다 학습 메모리가 그 층 출력 크기인 2.0MB씩 늘었다
- 야코비안 — 다변수 함수의 '기울기 행렬'딥러닝 곳곳에 나오는 야코비안을 한 장으로. 야코비안은 벡터를 벡터로 보내는 함수의 '모든 편미분을 모은 행렬'이자, 그 점에서 가장 좋은 선형근사다. 해석식·자동미분·유한차분 세 방법이 오차 1e-8로 일치했고, 합성함수의 야코비안이 정확히 '야코비안의 곱'임을 확인했다 — 이것이 역전파와 그라디언트 소실의 뿌리다
- 역전파 없이 1,000층? — 라그랑주 승수가 오차를 '파도'로 바꾸는 법사카나 AI가 층마다 이웃과만 신호를 주고받는 국소 규칙(PC-ALM)으로 역전파와 같은 기울기를 만들고, 1,000층 망도 역전파에 2%p 안쪽으로 학습된다고 소개했다. 예측 부호화의 오차가 왜 '물 번지듯' 느리게 퍼지는지, 라그랑주 승수 하나가 왜 그것을 '파도'로 바꾸는지, 왜 추론 스텝이 딱 2L 인지를 작은 실험 네 개로 직접 쟀다
- 딥러닝 — 사람이 3을 3으로 읽는 이유와 그 밑의 수학퍼셉트론에서 역전파까지, 그리고 머신러닝에 필요한 선형대수 최소한