#GQA
2편
- 긴 문맥 — 위치는 왜 외삽되지 않는가학습에서 본 적 없는 길이를 주면 모델이 무너진다. 길이 64까지 배운 모델은 512에서 3.7%(무작위 2.2%)로 떨어졌고, 같은 길이를 추가 학습한 모델은 15.2%였다. 재학습 없이 기저 주파수만 늘려도 10.7%까지 되살아났지만, 흔히 같이 권하는 위치 보간은 오히려 2.5%로 더 나빠졌다 — 인접 관계를 구분할 해상도가 무너지기 때문이다
- KV 캐시와 추론 — 생성은 왜 메모리에 묶이나자기회귀 생성은 토큰을 하나씩 만든다. 캐시가 없으면 매 스텝 과거를 다시 계산해 L=512에서 260배나 더 일했다(L²). 과거의 K·V를 저장하면 새 토큰만 계산해 선형으로 준다. 대신 캐시는 문맥 길이에 선형으로 커져, 70B 모델에서 64K 토큰이면 캐시(168GB)가 모델 가중치(140GB)를 넘었다. GQA·MQA로 KV 헤드를 줄이면 캐시가 8배·64배 준다