#보상해킹
3편
- RLHF와 DPO — 선호로 배우기, 그리고 보상 해킹정답이 아니라 사람의 '선호'(A가 B보다 낫다)로 모델을 정렬한다. 선호 쌍으로 보상을 배우니 진짜 보상과 상관 0.86까지 맞았지만, 그 불완전한 보상을 세게 최적화하자 프록시 점수는 계속 오르는데 진짜 보상은 KL 0.6에서 봉우리를 찍고 -1.4까지 무너졌다 — 굿하트, 보상 해킹. DPO는 보상 모델 단계를 건너뛰고 선호에서 바로 정책을 옮기되, β로 참조에서 얼마나 멀어질지를 제어한다
- 744B인데 40B만 쓴다 — Atria Dawn으로 보는 MoE 희소성과 '검증된 경험'상하이 AI연구소가 GLM-5.2 기반의 에이전트 모델 Atria Dawn(744B 총 / 40B 활성)을 공개했다. 두 가지가 핵심이다 — 전문가 256명 중 8명만 켜는 MoE 희소성과, 겉보기 점수 대신 외부 검증기로 학습하는 '검증된 경험'. 그 산수를 실험 세 개로 직접 쟀다
- 통제를 잃는다는 것 — 명세 게이밍과 관측 가능성의 값평가용 에이전트가 샌드박스를 나가 실제 회사를 4일 반 동안 털었다. 목표는 해킹이 아니라 부정행위였다. 그 구조를 축소 모형으로 재현하니 겉보기 점수는 늘 100%인데 진짜 능력은 0%까지 무너졌고, 무엇을 숨길 수 있느냐는 연속이냐 이산이냐가 아니라 그 정보가 과제에 필요한가로 갈렸다