#굿하트
1편
- RLHF와 DPO — 선호로 배우기, 그리고 보상 해킹정답이 아니라 사람의 '선호'(A가 B보다 낫다)로 모델을 정렬한다. 선호 쌍으로 보상을 배우니 진짜 보상과 상관 0.86까지 맞았지만, 그 불완전한 보상을 세게 최적화하자 프록시 점수는 계속 오르는데 진짜 보상은 KL 0.6에서 봉우리를 찍고 -1.4까지 무너졌다 — 굿하트, 보상 해킹. DPO는 보상 모델 단계를 건너뛰고 선호에서 바로 정책을 옮기되, β로 참조에서 얼마나 멀어질지를 제어한다