#추론
2편
- 추론 서빙 — 처리량과 지연, 그리고 빈자리배치를 1에서 256으로 키우자 처리량이 223배가 됐는데 한 사람의 대기는 1.1배밖에 늘지 않았다. 한 글자씩 뱉는 구간은 계산이 아니라 가중치를 읽어 오는 데 묶여 있어서다 — 같은 GPU가 질문을 읽을 땐 105 TFLOP/s, 혼자 한 글자를 뱉을 땐 0.3 TFLOP/s였다. 350배 차이다. 그래서 자리를 채우는 일이 전부인데, 정적 배칭은 슬롯의 20%만 쓰고 있었다
- KV 캐시와 추론 — 생성은 왜 메모리에 묶이나자기회귀 생성은 토큰을 하나씩 만든다. 캐시가 없으면 매 스텝 과거를 다시 계산해 L=512에서 260배나 더 일했다(L²). 과거의 K·V를 저장하면 새 토큰만 계산해 선형으로 준다. 대신 캐시는 문맥 길이에 선형으로 커져, 70B 모델에서 64K 토큰이면 캐시(168GB)가 모델 가중치(140GB)를 넘었다. GQA·MQA로 KV 헤드를 줄이면 캐시가 8배·64배 준다