#신뢰성
2편
- GPU 120만 개 — 고장이 일상이 되는 규모의 산수머스크가 xAI의 Colossus 2를 연말까지 엔비디아 칩 120만 개 넘게 늘리겠다고 했다. GPU 한 개는 평균 5.8년에 한 번 멈추지만, 120만 개를 묶으면 평균 2.5분마다 어딘가 멈춘다. 이 전부를 한 작업으로 돌리고 고장마다 체크포인트로 되돌아가면, 최적 주기를 골라도 효율은 11.5%다. 저장을 10초로 줄이고 재시작을 1분으로 줄이자 48.4%까지 올라왔다
- 에이전트와 도구 사용 — 신뢰성의 산수모델이 답하는 대신 행동하기 시작하면 정확도가 아니라 곱셈이 지배한다. 도구가 10%만 실패해도 16단계 작업의 성공률은 19.3%로 떨어졌다. 매 단계 결과를 보고 다시 계획하니 같은 조건에서 99.9%가 됐다. 다만 그 회복은 되돌릴 수 있을 때만이었다 — 실패가 전부 비가역이면 폐루프도 18.3%로 되돌아갔다