#해석가능성
2편
- 문맥 내 학습과 유도 헤드 — 능력이 켜지는 순간모델이 프롬프트의 예시만 보고 새 규칙을 푸는 일은 어떻게 생길까. 외울 수 없게 만든 과제에서 정확도가 250스텝까지 10%에 머물다가 200스텝 만에 80%로 갈아탔다. 어텐션 1층으로는 10.2%였고 2층부터 87.6%였다 — 두 단계가 필요하기 때문이다. 그 구간에 어텐션이 정답 자리로 몰리는 것을 그대로 찍었다
- 기계적 해석가능성 — 프로브에서 회로로모델 속 '개념'이 어디에 어떻게 들어 있나. 은닉 6차원에서 특징 16개를 선형 프로브로 읽으니 중요한 특징은 또렷했고(균형정확도 75%) 덜 중요한 건 중첩에 밀려 무작위(50%)로 사라졌다. 그 개념의 방향을 활성에 더하자 그 특징만 정확히 켜졌다(상관이 아니라 인과). 특징 방향들은 서로 겹쳐(비직교) 저장돼, 뉴런 하나가 평균 6.8개 특징을 겸했다