#벤치마크
2편
- 데이터 — 중복, 오염, 그리고 품질같은 4,800개라도 고유한 데이터가 16분의 1로 줄자 정확도가 84.0%에서 32.4%로 떨어졌다. 시험 문제의 절반을 학습에 섞으니 발표 점수는 92.3%가 됐지만 깨끗한 문항의 실력은 84.6%였다 — 8%p가 순전히 부풀림이다. 그리고 라벨 오답률 30%인 데이터는 4배를 줘도 깨끗한 데이터를 못 이겼다
- 평가 — 벤치마크 점수는 얼마나 믿을 수 있나실력이 정확히 75%인 모델도 100문항에서는 66%에서 83% 사이 아무 점수나 나왔다. 실력이 1%p 앞선 모델이 100문항 시험에서 지는 일이 43.5%나 됐다. 그리고 실력이 완전히 같은 두 모델을 벤치마크 10개에서 겨루게 하니 99.9%의 확률로 어느 한 곳에서는 이겼다 — 평균 4.21%p 차이로