#Reflection
1편
- 5,010억 개 중 230억 개만 켠다 — 4.6% 의 산수Reflection AI 가 전체 파라미터 501B 중 토큰마다 23B 만 쓰는 희소 전문가 혼합 모델 Beam 을 발표했다. 작은 모형으로 재 보니 토큰 하나를 만드는 시간은 담아 둔 전문가 수와 무관했고(8개든 64개든 0.168 ms), 켠 수에만 비례했다. 그런데 이 이득은 배치 1 의 것이다. 토큰마다 다른 전문가를 고르기 때문에 배치 16 이면 전문가의 55% 를, 64 면 94% 를 읽는다. 전문가 수는 딱 맞게 두는 것보다 넉넉히 둘 때 오차가 33배 작았다