#다양성
2편
- 앙상블 — 여러 번 세는 것의 값어치똑같이 만든 모델 8개는 각자 83% 남짓인데 확률을 평균내자 84.4%가 됐다. 이득은 평균 실력이 아니라 틀리는 자리가 서로 다른 데서 나온다. 전원이 틀리는 8.3%가 천장이다. 그런데 같은 파라미터 예산을 큰 모델 하나에 쓰면 87.3%로 앙상블을 이겼다 — 앙상블이 확실히 이긴 건 정확도가 아니라 캘리브레이션이었다
- 평균의 분산 — 여럿을 모아도 줄지 않는 부분앙상블이 4개에서 멈추는 이유. n개를 평균내면 분산이 1/n로 준다는 말은 서로 무관할 때만 맞고, 상관 ρ가 있으면 ρσ²에서 멈춘다. 실측해 보니 ρ=0.6이면 64개를 모아도 분산이 0.606이었다. 분류 오차로 옮기면 그 멈추는 자리가 곧 '전원이 틀리는 문제'다