#MQA
1편
- KV 캐시와 추론 — 생성은 왜 메모리에 묶이나자기회귀 생성은 토큰을 하나씩 만든다. 캐시가 없으면 매 스텝 과거를 다시 계산해 L=512에서 260배나 더 일했다(L²). 과거의 K·V를 저장하면 새 토큰만 계산해 선형으로 준다. 대신 캐시는 문맥 길이에 선형으로 커져, 70B 모델에서 64K 토큰이면 캐시(168GB)가 모델 가중치(140GB)를 넘었다. GQA·MQA로 KV 헤드를 줄이면 캐시가 8배·64배 준다
1편
↑↓ 고르기Enter 열기Esc 닫기