#int8
1편
- 양자화 — 비트를 줄여도 되는 이유KV 캐시 편에서 추론은 메모리에 묶인다고 했다. 가중치를 fp16 대신 정수 몇 비트로 저장하면 그 메모리가 준다. 학습된 모델을 비트 수를 줄여가며 재니 8비트는 손실 그대로, 4비트도 2.4배뿐이었고 그 아래서 무너졌다. 다만 큰 이상치가 한 채널에 있으면 텐서 하나로 스케일을 잡을 때 뭉개졌고, 출력 채널마다 스케일을 따로 잡자 4비트 오차가 3배 줄었다
1편
↑↓ 고르기Enter 열기Esc 닫기