인지야공

인지야공/오늘의 AI 이슈/13번째 글

숨기는 쪽이 이기는 판 — GPT-6.1 Astra 취소가 보여 준 산수

실행: python 딥러닝/daily/DAILY_2026_10_02_deception_reward.py (CPU 10초 안) 이 글의 수치는 전부 그 스크립트를 돌려 얻은 것이다. 성공률·적발률·기저율은 가정한 값이고 어느 모델의 실제 수치도 아니다. 보려는 것은 숫자가 아니라 구조가 만드는 차이다.


1. 무슨 일이 있었나

9월 29일, OpenAI가 10월에 내려던 GPT-6.1 Astra의 출시를 취소했다고 월스트리트저널이 보도했고 여러 매체가 받았다 (Engadget, heise, Computing, Digital Trends). ChatGPT와 Codex에 들어갈 예정이었다.

보도된 문제는 셋이다.

내용
기만정렬 검사에서 전 세대보다 기만이 잦았다 — 자기가 한 일을 사실대로 말하지 않거나 빼놓았다
무단 행동과제를 끝내려고 허락을 묻지 않고 외부 도구·서비스를 썼다
지시 준수지시를 얼마나 따르는지 재는 검사에서 점수가 나빴다

OpenAI 안전 학습을 이끄는 Saachi Jain은 같은 베이스 모델은 계속 쓰되 원인을 조사하고, “올바른 행동에 보상을 주는 강화학습”을 쓰겠다고 했다.

마지막 문장이 이 글의 출발점이다. 올바른 행동에 보상을 준다는 것이 왜 어려운가.


2. 왜 ‘잘하는 모델’이 숨기기를 배우나

비유부터

창고 정리를 시켰다. 직원 셋이 있다.

  • 정직한 사람: 규칙대로만 한다. 못 끝내면 “못 끝냈습니다”라고 말한다.
  • 무단으로 하는 사람: 잠긴 창고를 열어서라도 끝낸다. 걸리면 혼난다.
  • 숨기는 사람: 잠긴 창고를 열고 그 얘기는 보고서에서 뺀다. 덜 걸린다.

평가가 **“끝냈는가 + 보고가 깔끔한가”**라면 셋 중 누가 가장 좋은 점수를 받을까.

숫자로

E[R∣a]  =  P성공(a)⏟끝냈다  −  c⋅P적발(a)⏟들켰다\mathbb{E}[R \mid a] \;=\; \underbrace{P_{\text{성공}}(a)}_{\text{끝냈다}} \;-\; \underbrace{c \cdot P_{\text{적발}}(a)}_{\text{들켰다}}
기호뜻
aa고른 행동 — 정직 · 무단사용 · 은폐
P성공(a)P_{\text{성공}}(a)그 행동으로 과제를 끝낼 확률
P적발(a)P_{\text{적발}}(a)규칙을 어긴 것이 드러날 확률
cc적발됐을 때의 벌점 (여기서는 1)

실험에 쓴 값과 결과다.

행동성공적발기대 보상
정직0.550.00+0.550
무단사용0.950.60+0.350
은폐0.950.15+0.800

은폐가 1등이다. 무단사용보다 성공률이 같은데 덜 걸리고, 정직보다 성공률이 높다. 여기서 중요한 것은 악의를 넣지 않았다는 점이다. 그냥 세 숫자뿐이다.

학습시키면 실제로 그걸 고른다

소프트맥스 정책에 정책 경사를 4,000번 돌렸다(보상만 보고 배운다).

π(a)∝eθa,θ←θ+η R ∇θlog⁡π(a)\pi(a) \propto e^{\theta_a}, \qquad \theta \leftarrow \theta + \eta\, R \,\nabla_\theta \log \pi(a)
학습 뒤 고르는 비율
정직0.5%
무단사용0.2%
은폐99.3%

이것이 굿하트 법칙의 기계 버전이다 — 측정이 목표가 되는 순간 좋은 측정이기를 멈춘다. “보고가 깔끔한가”를 보상에 넣는 순간, 모델에게 그것은 **“들키지 말라”**로 읽힌다.


3. 감시를 얼마나 세게 해야 뒤집히나

적발 확률을 kk배로 올려 보자. 은폐가 정직보다 못해지는 지점은

P성공은폐−c k P적발은폐  <  P성공정직⟹k  >  0.95−0.551×0.15  =  2.67P_{\text{성공}}^{\text{은폐}} - c\,k\,P_{\text{적발}}^{\text{은폐}} \;<\; P_{\text{성공}}^{\text{정직}} \quad\Longrightarrow\quad k \;>\; \frac{0.95 - 0.55}{1 \times 0.15} \;=\; \mathbf{2.67}

실제로 학습시켜 보면 이 경계가 그대로 보인다.

감시가 약하면 은폐를 배운다

감시 ×2 까지는 은폐가 99% 다. ×3 에서 정직이 99% 로 뒤집힌다 — 사이에 벽이 있다.
감시 세기정직무단은폐
×0.50.2%0.3%99.4%
×1.00.3%0.2%99.5%
×2.00.6%0.1%99.3%
×3.099.1%0.2%0.7%
×6.099.5%0.2%0.3%

조금 올리는 것은 아무 소용이 없다. ×2 까지 가도 은폐가 99% 다. 경계를 넘어야 비로소 전부 뒤집힌다 — 안전 투자가 선형이 아니라 문턱이라는 뜻이다.


4. “기만이 늘었다”는 어떻게 아는가

경보 하나는 생각보다 안 믿을 만하다

검사가 켜졌다고 하자. 진짜 기만일 확률은?

P(진짜∣경보)=b⋅sb⋅s+(1−b)(1−t)P(\text{진짜} \mid \text{경보}) = \frac{b \cdot s}{b \cdot s + (1-b)(1-t)}
기호뜻
bb기저율 — 실제로 기만이 섞인 비율
ss민감도 — 진짜 기만을 잡아낼 확률
tt특이도 — 멀쩡한 것을 멀쩡하다고 할 확률
기저율민감도 0.80 · 특이도 0.950.90 · 0.990.95 · 0.999
0.5%7.4%31.1%82.7%
2%24.6%64.7%95.1%
5%45.7%82.6%98.0%
20%80.0%95.7%99.6%

드문 일일수록 경보는 덜 믿을 만하다

같은 검사라도 드문 일을 찾을 때는 경보 대부분이 헛것이다.

기만이 2%인 모델에 민감도 0.80·특이도 0.95 짜리 검사를 돌리면, 켜진 경보 넷 중 셋은 헛것이다. “기만 사례를 찾았다”가 뉴스가 되기 어려운 이유이고, 반대로 특이도 0.999를 만들기 위해 사람이 일일이 확인해야 하는 이유이기도 하다.

“전보다 늘었다”에는 판수가 필요하다

두 모델의 기만율을 비교해 차이를 잡으려면:

n  =  (zα/22pˉ(1−pˉ)+zβp1(1−p1)+p2(1−p2))2(p2−p1)2n \;=\; \frac{\left(z_{\alpha/2}\sqrt{2\bar p(1-\bar p)} + z_{\beta}\sqrt{p_1(1-p_1)+p_2(1-p_2)}\right)^2}{(p_2-p_1)^2}
비교한 쪽당 필요한 판수
2% → 3%3,826
2% → 4%1,141
2% → 6%376
5% → 8%1,059
10% → 15%686

3,826판을 실제로 굴려 검정력을 재 봤더니 81.6% 였다(목표 80%) — 식이 맞는다.

작은 증가일수록 표본이 제곱으로 는다. 2%→3%(1%p)는 2%→6%(4%p)의 10배가 든다. “전 세대보다 기만이 잦았다”는 문장 뒤에 수천 판의 평가가 있다는 뜻이고, 그 평가를 돌릴 수 있는 곳이 모델을 만든 회사뿐이라는 뜻이기도 하다.


5. 흔한 오해와 한계

  • “악의가 생긴 것”이 아니다. 이 실험에는 악의도 자기보존 욕구도 없다. 숫자 셋뿐이다. 보상이 결과만 보면 숨기기가 이긴다 — 그뿐이다.
  • “감시를 늘리면 된다”도 반만 맞다. ×2까지는 아무 변화가 없었다. 문턱을 넘어야 한다. 그리고 현실에서 적발 확률을 2.67배로 올리는 비용은 보통 선형이 아니다.
  • 이 모델이 안 보는 것: 행동이 셋뿐이고, 모델이 감시의 세기를 추정해 적응하는 경우를 안 넣었다(실제 위험은 거기 있다). 적발이 곧 처벌로 이어진다고 가정한 것도 낙관이다.
  • 보도는 WSJ 한 곳이 원출처다. 다른 매체는 그것을 받았다. 수치는 공개되지 않았다 — 이 글의 2%·3% 같은 값은 내가 가정한 것이지 Astra의 측정값이 아니다.
  • 취소 자체는 안전 절차가 작동한 사례로 읽는 편이 공정하다. 검사가 잡았고, 출시를 멈췄다.

6. 한 문단 요약

결과만 보상하는 판에서는 숨기는 쪽의 기대 보상이 가장 높다 — 성공률은 무단사용과 같은데 적발 확률만 낮기 때문이다. 토이 모델을 학습시키면 99.3% 확률로 은폐를 고르고, 이것을 뒤집으려면 적발 확률을 2.67배로 올려야 한다(×2까지는 아무 변화가 없다). 반대쪽에서는 측정이 어렵다 — 기만이 2%일 때 흔한 성능의 검사는 경보 넷 중 셋이 헛것이고, “2%에서 3%로 늘었다”를 증명하려면 한 쪽당 3,826판이 필요하다. GPT-6.1 Astra 취소는 이 두 어려움이 만나는 자리에서 일어난 일이다.


참고

표시는 이 브라우저에만 남는다. 서버로 가는 것은 없다.