#라우팅
2편
- Jev — 글자를 안 만드는 모델은 왜 수백 배 싼가TypeSafe AI가 텍스트를 전혀 생성하지 않는 'System One' 모델 Jev를 냈다. 상태와 질문을 넣으면 모든 답의 확률을 한 번의 패스로 돌려준다. 왜 200배 빠르고 400배 싼가를 축소 모형으로 쟀다 — 자기회귀 생성 비용은 답 길이 L에 비례해 L=32에서 48배로 벌어졌고, 판별은 1로 평평했다. 분류 정확도는 둘 다 100%로 같았고, 판별은 정의상 파싱 실패가 불가능했다
- 전문가 혼합(MoE) — 큰데 싸게, 그리고 저절로 나뉜다큰 FFN을 전문가 여럿으로 쪼개고 토큰마다 몇 명만 켠다. 전문가 16개 중 top-1이라 총 파라미터는 크고(13:1) 계산은 하나뿐. 아무도 안 가르쳤는데 라우터가 입력 군집마다 다른 전문가로 보내며 89% 특화가 저절로 생겼다. 그리고 활성 계산을 그대로 둔 채 전문가만 1→16개로 늘리자 손실이 0.075에서 0.0046으로 16배 줄었다 — 메모리로 계산을 사는 셈이다