#아키텍처
4편
- 잠재 반복 vs 토큰 사슬 — 추가 계산을 세로로 넣을 것인가 가로로 넣을 것인가같은 블록으로 같은 문제를 세로(잠재 반복)와 가로(토큰 사슬)로 풀어 맞대 봤다. 정확도는 둘 다 100%로 같았고, 든 값은 블록 2배·토큰 0 대 192개로 갈렸으며, 중간 생각은 한쪽만 그냥 읽혔다. 아스트라와 페이블의 공개 수치가 정확히 그 지문을 남긴다
- 중첩 — 잠재 상태는 왜 토큰보다 넓은가잠재 반복 vs 토큰 사슬 편은 두 방식이 똑같다고 결론지었는데 이론은 분리를 말한다. 잠재 반복 vs 토큰 사슬 편 과제가 분리를 볼 수 없게 만들어져 있었다는 것을 찾아 고쳐 짓고 다시 쟀다. 반경을 4로 붙박아도 이산 CoT만 |S|를 따라 밀리고 천장이 73%까지 내려앉았다. 그리고 진짜 축은 연속이냐 이산이냐가 아니었다
- 루프 트랜스포머 — 깊이를 파라미터가 아니라 시간으로 사는 법GPT-6 아스트라가 쓴다고 알려진 순환 심도(recurrent depth). 논문 구조를 축소 재현해 재보니, 블록 하나(61K)가 12층(602K)과 똑같은 100%를 냈고 학습 때 6바퀴만 돌아 본 모델이 14바퀴를 돌려 배운 적 없는 깊이를 풀었다
- Transformer 각 층 상세 해부임베딩부터 Softmax 까지 층마다 무엇을 하는지. 직접 만든 층이 PyTorch 공식 층과 오차 0.0 으로 일치한다