#데이터
2편
- 데이터 — 중복, 오염, 그리고 품질같은 4,800개라도 고유한 데이터가 16분의 1로 줄자 정확도가 84.0%에서 32.4%로 떨어졌다. 시험 문제의 절반을 학습에 섞으니 발표 점수는 92.3%가 됐지만 깨끗한 문항의 실력은 84.6%였다 — 8%p가 순전히 부풀림이다. 그리고 라벨 오답률 30%인 데이터는 4배를 줘도 깨끗한 데이터를 못 이겼다
- 스케일링 법칙 — 파라미터·데이터·계산의 균형모델을 키우면 손실은 N^-0.56, 데이터를 늘리면 D^-0.57의 멱법칙으로 줄었다(로그-로그 직선). 그런데 계산은 유한하다. C≈6ND를 고정하고 배분을 바꾸니 손실에 U자 골짜기가 생겼고, 예산이 10배 커질 때 최적 N과 D가 각각 C^0.42·C^0.58로 함께 자랐다 — 모델만 키우지 말고 데이터도 같이 키우라는 친칠라의 교훈