#최적화
2편
- 최적화 — Adam·워밍업·스케줄이 하는 일정규화와 잔차 편이 그라디언트를 살렸다면, 최적화 편은 그것으로 실제로 학습시키는 법이다. 조건수 1000인 그릇에서 SGD는 2.13에 발이 묶였고 Adam은 10^-15까지 내려가 5.7×10^14배 낮았다. 깊은 post-norm은 워밍업 없이 초반 손실이 4.6배로 튀었고, 코사인 감쇠는 잡음 바닥에 5.2% 더 가까이 안착했다
- 역전파 없이 1,000층? — 라그랑주 승수가 오차를 '파도'로 바꾸는 법사카나 AI가 층마다 이웃과만 신호를 주고받는 국소 규칙(PC-ALM)으로 역전파와 같은 기울기를 만들고, 1,000층 망도 역전파에 2%p 안쪽으로 학습된다고 소개했다. 예측 부호화의 오차가 왜 '물 번지듯' 느리게 퍼지는지, 라그랑주 승수 하나가 왜 그것을 '파도'로 바꾸는지, 왜 추론 스텝이 딱 2L 인지를 작은 실험 네 개로 직접 쟀다