#서빙
2편
- 스펙큘러티브 디코딩 — 작은 모델이 먼저 쓰고 큰 모델이 검사한다큰 모델을 한 번 부를 때 토큰 하나만 얻는 것이 아깝다. 작은 모델에게 세 글자를 미리 쓰게 하고 큰 모델이 한 번에 검사하니 한 호출에 평균 3.56토큰이 확정돼 1.60배 빨라졌다. 놀라운 것은 결과가 근사가 아니라는 점이다 — 초안 모델의 분포가 0.657만큼 다른 자리에서도, 검사 규칙을 지킨 표본은 큰 모델이 직접 뽑은 것과 구별되지 않았다
- 추론 서빙 — 처리량과 지연, 그리고 빈자리배치를 1에서 256으로 키우자 처리량이 223배가 됐는데 한 사람의 대기는 1.1배밖에 늘지 않았다. 한 글자씩 뱉는 구간은 계산이 아니라 가중치를 읽어 오는 데 묶여 있어서다 — 같은 GPU가 질문을 읽을 땐 105 TFLOP/s, 혼자 한 글자를 뱉을 땐 0.3 TFLOP/s였다. 350배 차이다. 그래서 자리를 채우는 일이 전부인데, 정적 배칭은 슬롯의 20%만 쓰고 있었다