#특화
1편
- 전문가 혼합(MoE) — 큰데 싸게, 그리고 저절로 나뉜다큰 FFN을 전문가 여럿으로 쪼개고 토큰마다 몇 명만 켠다. 전문가 16개 중 top-1이라 총 파라미터는 크고(13:1) 계산은 하나뿐. 아무도 안 가르쳤는데 라우터가 입력 군집마다 다른 전문가로 보내며 89% 특화가 저절로 생겼다. 그리고 활성 계산을 그대로 둔 채 전문가만 1→16개로 늘리자 손실이 0.075에서 0.0046으로 16배 줄었다 — 메모리로 계산을 사는 셈이다