#캘리브레이션
3편
- Meta 뮤즈 — 대신 해 주는 에이전트는 언제 물어봐야 하나메타가 9월 8일 개인 AI 에이전트 뮤즈를 내놓고 9월 23일 커넥트에서 전용 기기와 쇼핑·예약 연동을 발표했다. 대신 결제하고 대신 예약하는 순간 새 질문이 생긴다 — 언제 사람에게 물어야 하나. 재 보니 매 단계 묻는 방식은 8번 중 7.36번이 헛물음이었고, 확신이 낮을 때만 묻자 0.77번으로 99.7%를 지켰다. 그런데 확신이 어긋나면 성공률이 85.2%로 떨어지면서 묻는 횟수까지 줄어든다
- 앙상블 — 여러 번 세는 것의 값어치똑같이 만든 모델 8개는 각자 83% 남짓인데 확률을 평균내자 84.4%가 됐다. 이득은 평균 실력이 아니라 틀리는 자리가 서로 다른 데서 나온다. 전원이 틀리는 8.3%가 천장이다. 그런데 같은 파라미터 예산을 큰 모델 하나에 쓰면 87.3%로 앙상블을 이겼다 — 앙상블이 확실히 이긴 건 정확도가 아니라 캘리브레이션이었다
- 캘리브레이션 — 모델은 자기가 틀린 것을 아는가정확도가 82%에서 멈춘 뒤에도 모델의 평균 확신은 92%에서 95.6%까지 계속 올랐다. 과신 폭이 12.4%p다. 시험셋 일부로 온도 하나(3.395)만 맞추자 보정 오차가 88% 줄었고 정확도는 83.2%로 한 자리도 안 바뀌었다. 그리고 완전한 무작위 잡음을 보여 줬더니 97.2%의 확신으로 답했다