#강화학습
5편
- 강화학습 기초 — 가치가 퍼져 나간다보상이 있는 칸에서 시작한 '좋음'은 한 번 갱신할 때마다 딱 한 칸씩 번진다. 331칸을 다 채우는 데 37번이 걸렸다. 감가율을 0.90에서 0.95로 올리자 같은 환경에서 목표가 가까운 +1에서 먼 +10으로 바뀌었다. 그리고 탐험 비율을 0부터 1까지 다 돌려도 큰 보상을 쓰지 못했는데, 탐험을 0으로 두고 낙관적 초기화만 넣자 11번째 판에 찾아냈다
- UCB — 모르는 것에 이자를 붙인다강화학습 기초 편에서 ε-그리디가 전부 실패했고 몬테카를로 트리 탐색 편 MCTS는 UCB로 골랐다. 무엇이 다른가를 후회(regret)로 쟀다. ε-그리디는 후회가 직선으로 늘고 UCB는 눕는다 — 2만 수 뒤 331 대 61이었다. 다만 보너스 상수를 2.0으로 키우니 572로 ε-그리디보다 나빴다
- 744B인데 40B만 쓴다 — Atria Dawn으로 보는 MoE 희소성과 '검증된 경험'상하이 AI연구소가 GLM-5.2 기반의 에이전트 모델 Atria Dawn(744B 총 / 40B 활성)을 공개했다. 두 가지가 핵심이다 — 전문가 256명 중 8명만 켜는 MoE 희소성과, 겉보기 점수 대신 외부 검증기로 학습하는 '검증된 경험'. 그 산수를 실험 세 개로 직접 쟀다
- CS229 딥러닝 치트시트를 다시 쓴다 — 0.25 를 스무 번 곱하면활성화 함수·드롭아웃·배치정규화·합성곱 크기 공식. 왜 ReLU 로 갈아탔는지 숫자로 본다
- 강화학습 — 벨만 방정식에서 정책 그라디언트까지밴딧·MDP·DP·MC·TD, Q러닝과 DQN, 그리고 정책 기반 방법