#자기회귀
2편
- Jev — 글자를 안 만드는 모델은 왜 수백 배 싼가TypeSafe AI가 텍스트를 전혀 생성하지 않는 'System One' 모델 Jev를 냈다. 상태와 질문을 넣으면 모든 답의 확률을 한 번의 패스로 돌려준다. 왜 200배 빠르고 400배 싼가를 축소 모형으로 쟀다 — 자기회귀 생성 비용은 답 길이 L에 비례해 L=32에서 48배로 벌어졌고, 판별은 1로 평평했다. 분류 정확도는 둘 다 100%로 같았고, 판별은 정의상 파싱 실패가 불가능했다
- KV 캐시와 추론 — 생성은 왜 메모리에 묶이나자기회귀 생성은 토큰을 하나씩 만든다. 캐시가 없으면 매 스텝 과거를 다시 계산해 L=512에서 260배나 더 일했다(L²). 과거의 K·V를 저장하면 새 토큰만 계산해 선형으로 준다. 대신 캐시는 문맥 길이에 선형으로 커져, 70B 모델에서 64K 토큰이면 캐시(168GB)가 모델 가중치(140GB)를 넘었다. GQA·MQA로 KV 헤드를 줄이면 캐시가 8배·64배 준다