#중첩
3편
- 고차원의 기하 — 무작위 벡터는 왜 거의 직교한가임베딩·벡터 검색·중첩이 전부 이 한 가지 사실에 기댄다. 차원이 커질수록 아무 두 벡터나 거의 직각이 된다 — 유사도의 폭이 1/√D로 줄어드는 것을 쟀다(D=2에서 0.706, D=2048에서 0.022). 그래서 64차원에 16,384개의 방향을 서로 겹치지 않게 욱여넣을 수 있다
- 기계적 해석가능성 — 프로브에서 회로로모델 속 '개념'이 어디에 어떻게 들어 있나. 은닉 6차원에서 특징 16개를 선형 프로브로 읽으니 중요한 특징은 또렷했고(균형정확도 75%) 덜 중요한 건 중첩에 밀려 무작위(50%)로 사라졌다. 그 개념의 방향을 활성에 더하자 그 특징만 정확히 켜졌다(상관이 아니라 인과). 특징 방향들은 서로 겹쳐(비직교) 저장돼, 뉴런 하나가 평균 6.8개 특징을 겸했다
- 중첩 — 잠재 상태는 왜 토큰보다 넓은가잠재 반복 vs 토큰 사슬 편은 두 방식이 똑같다고 결론지었는데 이론은 분리를 말한다. 잠재 반복 vs 토큰 사슬 편 과제가 분리를 볼 수 없게 만들어져 있었다는 것을 찾아 고쳐 짓고 다시 쟀다. 반경을 4로 붙박아도 이산 CoT만 |S|를 따라 밀리고 천장이 73%까지 내려앉았다. 그리고 진짜 축은 연속이냐 이산이냐가 아니었다