#어텐션
4편
- 문맥 내 학습과 유도 헤드 — 능력이 켜지는 순간모델이 프롬프트의 예시만 보고 새 규칙을 푸는 일은 어떻게 생길까. 외울 수 없게 만든 과제에서 정확도가 250스텝까지 10%에 머물다가 200스텝 만에 80%로 갈아탔다. 어텐션 1층으로는 10.2%였고 2층부터 87.6%였다 — 두 단계가 필요하기 때문이다. 그 구간에 어텐션이 정답 자리로 몰리는 것을 그대로 찍었다
- 플래시 어텐션 — IO를 아는 어텐션어텐션은 N×N 점수 행렬을 만들어 메모리를 O(N²) 먹고, 그 읽고 쓰기가 병목이다. 플래시 어텐션은 그 행렬을 통째로 만들지 않고 타일로 나눠 처리한다. 재 보니 N=4096에서 메모리가 129배 줄고 속도는 1.9배 빨랐다. 핵심은 온라인 softmax — 블록별 running max·sum만으로 전체 softmax와 오차 2e-8로 같은 값을 낸다
- KV 캐시와 추론 — 생성은 왜 메모리에 묶이나자기회귀 생성은 토큰을 하나씩 만든다. 캐시가 없으면 매 스텝 과거를 다시 계산해 L=512에서 260배나 더 일했다(L²). 과거의 K·V를 저장하면 새 토큰만 계산해 선형으로 준다. 대신 캐시는 문맥 길이에 선형으로 커져, 70B 모델에서 64K 토큰이면 캐시(168GB)가 모델 가중치(140GB)를 넘었다. GQA·MQA로 KV 헤드를 줄이면 캐시가 8배·64배 준다
- 패턴인식 — 좋은 특징이란 무엇인가특징과 일반화, 신경망 기초, 지도·비지도 학습, CNN 과 시퀀스 모델