#에이전트
5편
- Meta 뮤즈 — 대신 해 주는 에이전트는 언제 물어봐야 하나메타가 9월 8일 개인 AI 에이전트 뮤즈를 내놓고 9월 23일 커넥트에서 전용 기기와 쇼핑·예약 연동을 발표했다. 대신 결제하고 대신 예약하는 순간 새 질문이 생긴다 — 언제 사람에게 물어야 하나. 재 보니 매 단계 묻는 방식은 8번 중 7.36번이 헛물음이었고, 확신이 낮을 때만 묻자 0.77번으로 99.7%를 지켰다. 그런데 확신이 어긋나면 성공률이 85.2%로 떨어지면서 묻는 횟수까지 줄어든다
- 에이전트와 도구 사용 — 신뢰성의 산수모델이 답하는 대신 행동하기 시작하면 정확도가 아니라 곱셈이 지배한다. 도구가 10%만 실패해도 16단계 작업의 성공률은 19.3%로 떨어졌다. 매 단계 결과를 보고 다시 계획하니 같은 조건에서 99.9%가 됐다. 다만 그 회복은 되돌릴 수 있을 때만이었다 — 실패가 전부 비가역이면 폐루프도 18.3%로 되돌아갔다
- 744B인데 40B만 쓴다 — Atria Dawn으로 보는 MoE 희소성과 '검증된 경험'상하이 AI연구소가 GLM-5.2 기반의 에이전트 모델 Atria Dawn(744B 총 / 40B 활성)을 공개했다. 두 가지가 핵심이다 — 전문가 256명 중 8명만 켜는 MoE 희소성과, 겉보기 점수 대신 외부 검증기로 학습하는 '검증된 경험'. 그 산수를 실험 세 개로 직접 쟀다
- 나비에-스토크스 "폭발" — AI는 무엇을 증명했고, 왜 외력이 필요했나OpenAI가 매끄러운 외력을 가하면 나비에-스토크스 방정식이 유한 시간에 깨진다는 증명을 발표했다. 정확히 무엇을 증명한 것인지 클레이 원문으로 따지고, 방법의 뿌리를 쉽게 풀고, 조임·점성·늘이기의 줄다리기를 작은 실험 세 개로 직접 쟀다. 재 보니 내가 처음 떠올린 설명 하나는 틀렸다
- 권한 단조성 — 하네스 표준화가 왜 알고리즘 문제인가에이전트가 에이전트를 부르면 권한이 합성된다. 유효 권한은 위임 그래프의 도달 폐포라서, 아무도 규칙을 어기지 않아도 루트는 자기가 준 적 없는 권한을 쥔다. 재 보니 검사 커버리지가 99%여도 새고 100%에서만 정확히 0이었다 — 표준화가 필요한 이유의 알고리즘적 형태다