#스펙큘러티브디코딩
2편
- 스펙큘러티브 디코딩 — 작은 모델이 먼저 쓰고 큰 모델이 검사한다큰 모델을 한 번 부를 때 토큰 하나만 얻는 것이 아깝다. 작은 모델에게 세 글자를 미리 쓰게 하고 큰 모델이 한 번에 검사하니 한 호출에 평균 3.56토큰이 확정돼 1.60배 빨라졌다. 놀라운 것은 결과가 근사가 아니라는 점이다 — 초안 모델의 분포가 0.657만큼 다른 자리에서도, 검사 규칙을 지킨 표본은 큰 모델이 직접 뽑은 것과 구별되지 않았다
- 거부 샘플링 — 싼 분포로 비싼 분포를 정확히 흉내내기스펙큘러티브 디코딩 편 스펙큘러티브 디코딩의 수락 판정 r < min(1, q/p) 가 왜 근사가 아니라 정확한가. 보정 없이 초안 모델에서 뽑으면 TV 0.199 만큼 분포가 틀어지지만, 수락-거부에 잔차 재샘플링을 붙이면 0.00094 로 떨어진다. 그리고 기대 수락률은 정확히 1 - TV(p,q) 였다