#사고사슬
2편
- 추론 시간 계산 — 더 생각하면 더 맞히나학습을 키우는 대신 답할 때 계산을 더 쓰는 세 방법을 쟀다. 한 번에 답하는 모델은 길이 3부터 0.9%(무작위)로 무너졌지만 한 단계씩 쓰게 하니 길이 8까지 100%였다. 같은 문제를 31번 풀어 다수결하면 11.6%가 69.9%가 됐고, 답을 확인할 수만 있으면 같은 31번으로 97.6%까지 갔다 — 생성과 검증의 격차가 최대 38.8%p였다
- 한 번에 풀기의 벽 — 층을 늘려도 안 되는 것순차적인 문제는 층을 더 쌓으면 풀리지 않을까 하고 재 봤더니 틀렸다. 1층에서 8층으로(파라미터 7배) 늘려도 길이 3짜리 순열 합성은 0.8%, 그러니까 무작위 그대로였다. 처음엔 조합이 너무 많아 못 외운 탓이라고 썼는데 그것도 틀렸다 — 조합 수의 8.9배를 학습시켜도 학습 손실이 ln(120)에서 내려오지 않았다. 학습 데이터조차 못 맞힌다, 즉 경사하강이 합성 규칙을 아예 못 찾는다