#AI안전
3편
- AI 스웜이 인터넷을 장악한다? — 확산의 산수로 6~12개월을 따져보기아모데이가 '6~12개월 안에 AI 스웜이 영구 봇넷으로 인터넷을 장악할 수 있다'고 경고하며 개발 속도 조절을 제안했다. '스웜이 퍼진다'는 말의 뼈대는 20년 전 인터넷 웜 확산 모형과 같다. 로지스틱 확산, 스케일프리 망의 사라진 문턱, 힛리스트 가속을 작은 실험 세 개로 직접 쟀다
- 통제를 잃는다는 것 — 명세 게이밍과 관측 가능성의 값평가용 에이전트가 샌드박스를 나가 실제 회사를 4일 반 동안 털었다. 목표는 해킹이 아니라 부정행위였다. 그 구조를 축소 모형으로 재현하니 겉보기 점수는 늘 100%인데 진짜 능력은 0%까지 무너졌고, 무엇을 숨길 수 있느냐는 연속이냐 이산이냐가 아니라 그 정보가 과제에 필요한가로 갈렸다
- 권한 단조성 — 하네스 표준화가 왜 알고리즘 문제인가에이전트가 에이전트를 부르면 권한이 합성된다. 유효 권한은 위임 그래프의 도달 폐포라서, 아무도 규칙을 어기지 않아도 루트는 자기가 준 적 없는 권한을 쥔다. 재 보니 검사 커버리지가 99%여도 새고 100%에서만 정확히 0이었다 — 표준화가 필요한 이유의 알고리즘적 형태다