#정렬
3편
- RLHF와 DPO — 선호로 배우기, 그리고 보상 해킹정답이 아니라 사람의 '선호'(A가 B보다 낫다)로 모델을 정렬한다. 선호 쌍으로 보상을 배우니 진짜 보상과 상관 0.86까지 맞았지만, 그 불완전한 보상을 세게 최적화하자 프록시 점수는 계속 오르는데 진짜 보상은 KL 0.6에서 봉우리를 찍고 -1.4까지 무너졌다 — 굿하트, 보상 해킹. DPO는 보상 모델 단계를 건너뛰고 선호에서 바로 정책을 옮기되, β로 참조에서 얼마나 멀어질지를 제어한다
- 통제를 잃는다는 것 — 명세 게이밍과 관측 가능성의 값평가용 에이전트가 샌드박스를 나가 실제 회사를 4일 반 동안 털었다. 목표는 해킹이 아니라 부정행위였다. 그 구조를 축소 모형으로 재현하니 겉보기 점수는 늘 100%인데 진짜 능력은 0%까지 무너졌고, 무엇을 숨길 수 있느냐는 연속이냐 이산이냐가 아니라 그 정보가 과제에 필요한가로 갈렸다
- 권한 단조성 — 하네스 표준화가 왜 알고리즘 문제인가에이전트가 에이전트를 부르면 권한이 합성된다. 유효 권한은 위임 그래프의 도달 폐포라서, 아무도 규칙을 어기지 않아도 루트는 자기가 준 적 없는 권한을 쥔다. 재 보니 검사 커버리지가 99%여도 새고 100%에서만 정확히 0이었다 — 표준화가 필요한 이유의 알고리즘적 형태다