#부하균형
2편
- 전문가 혼합(MoE) — 큰데 싸게, 그리고 저절로 나뉜다큰 FFN을 전문가 여럿으로 쪼개고 토큰마다 몇 명만 켠다. 전문가 16개 중 top-1이라 총 파라미터는 크고(13:1) 계산은 하나뿐. 아무도 안 가르쳤는데 라우터가 입력 군집마다 다른 전문가로 보내며 89% 특화가 저절로 생겼다. 그리고 활성 계산을 그대로 둔 채 전문가만 1→16개로 늘리자 손실이 0.075에서 0.0046으로 16배 줄었다 — 메모리로 계산을 사는 셈이다
- 744B인데 40B만 쓴다 — Atria Dawn으로 보는 MoE 희소성과 '검증된 경험'상하이 AI연구소가 GLM-5.2 기반의 에이전트 모델 Atria Dawn(744B 총 / 40B 활성)을 공개했다. 두 가지가 핵심이다 — 전문가 256명 중 8명만 켜는 MoE 희소성과, 겉보기 점수 대신 외부 검증기로 학습하는 '검증된 경험'. 그 산수를 실험 세 개로 직접 쟀다