인지야공/딥러닝 기초 정리/33번째 글
중첩 — 잠재 상태는 왜 토큰보다 넓은가
실행:
python 08_superposition.py(검증 환경: torch 2.8.0+cu129, RTX 5080) 이 글의 수치는 전부 그 스크립트를 돌려 얻은 것이다. 잠재 반복 vs 토큰 사슬 편을 먼저 읽어야 한다. 이 글은 잠재 반복 vs 토큰 사슬 편의 결론을 고친다.
잠재 반복 vs 토큰 사슬 편의 결론은 이랬다. 잠재 반복과 토큰 사슬은 같은 단계 수에 같은 정답을 내고, 갈리는 것은 값과 관측 가능성뿐이다.
그런데 이론은 그렇게 말하지 않는다. Zhu 등의 Reasoning by Superposition은 바로 그 과제 (유향 그래프 도달 가능성)에서 두 방식이 다른 단계 수를 쓴다고 증명한다.
| 필요한 단계 수 | |
|---|---|
| 2층 트랜스포머 + 연속 사고 | (그래프 지름) |
| 상수 깊이 + 이산 CoT |
같은 과제, 같은 결론이어야 하는데 내 실험에서는 차이가 0이었다. 둘 중 하나가 틀렸다. 틀린 쪽은 내 실험이었고, 이 글은 어디가 틀렸는지 찾아 고쳐 다시 잰 기록이다.
1. 잠재 반복 vs 토큰 사슬 편이 분리를 볼 수 없었던 이유
이유 1 — 겹쳐 들 것이 애초에 없었다
중첩이 이득인 이유는 BFS 전선(frontier)을 한 벡터에 겹쳐 들 수 있어서다. 전선이 노드 하나뿐이면 겹칠 것이 없다. 잠재 반복 vs 토큰 사슬 편의 그래프 생성 코드를 다시 보면,
p = torch.randint(0, N, (bs, N)) # 노드 i 가 가리키는 곳은 p[i] 하나뿐
노드마다 나가는 화살표가 정확히 하나다(함수 그래프). 그러면 0번에서 뻗는 길이 외길이라 전선이 언제나 노드 하나다. 실제로 재 보면,
잠재 반복 vs 토큰 사슬 편 그래프의 BFS 전선 폭 : 평균 1.00, 최대 1
경로가 하나뿐인데 “여러 경로를 겹쳐 든다”는 이점이 나올 자리가 없다.
이유 2 — 이산 쪽에 중첩을 손으로 만들어 쥐여 줬다
잠재 반복 vs 토큰 사슬 편의 (B) 토큰 사슬은 단계마다 16비트 도달 집합을 넘겼다. 경로가 아니라 집합이다. 이론이 말하는 이산 CoT의 약점은 “한 번에 경로 하나만 적을 수 있다”는 것인데, 나는 집합을 통째로 넘기는 채널을 만들어 준 것이다.
정리하면 잠재 반복 vs 토큰 사슬 편은 두 겹으로 분리를 지웠다. 겹칠 것이 없는 과제를 골랐고, 그 위에 이산 쪽에 집합 채널을 줬다. 차이가 0으로 나온 게 당연하다.
이 글을 시작할 때 나는 이유 2만 고치면 된다고 생각했다. 그것도 절반만 맞았다 — 이유 1을 그대로 두면 채널을 아무리 조여도 분리가 안 나온다. 외길에서는 “지금 어디”만 넘겨도 충분하니까. 둘 다 고쳐야 한다.
2. 중첩이란 무엇인가
개 노드에서 0번이 닿는 집합을 찾는 문제다. BFS로 풀면 이렇다.
가 단계째 전선이다. 핵심은 가 집합이라는 것 — 폭이 5면 노드 다섯 개를 동시에 들고 다음 단계로 넘어가야 한다.
- 연속 상태는 실수 벡터다. 전선 전체를 한 상태에 겹쳐 담고 한 번에 민다. 그래서 단계면 끝난다.
- 이산 토큰은 한 번에 노드 하나(약 비트)다. 전선을 넘기려면 원소를 하나씩 적어야 한다. 여기서 추가 단계가 나온다.
머릿속에서 후보 다섯 개를 동시에 굴리는 것과, 종이에 다섯 줄을 적는 것의 차이다. 종이도 정보를 잃지는 않는다. 다섯 번 써야 할 뿐이다.
3. 과제를 다시 짓는다
두 이유를 다 고친 설계다.
| 잠재 반복 vs 토큰 사슬 편 | 중첩 편 | |
|---|---|---|
| 노드 수 | 16 | 24 |
| 나가는 화살표 | 1개 | 2개 ← 분기가 생긴다 |
| 도달 반경 | 문제마다 다름 | 4로 고정 |
| 재는 것 | 반경별 정확도 | 도달 집합 크기 별 필요 단계 |
반경을 고정한 것이 설계의 핵심이다. 깊이가 아니라 넓이만 따로 보려는 것이다. 로 붙박아 두고 만 키우면, 깊이를 사야 하는 양은 그대로인데 전선에 담을 것만 늘어난다. 이론이 맞다면 연속 쪽은 와 무관하게 4에 머물러야 한다.
그래프는 층으로 짓는다. 레벨 의 노드는 레벨 만 가리킨다. 그러면 레벨 노드까지의 거리가 정확히 이고, 단계째 전선이 곧 레벨 집합이 된다. 마지막 레벨은 이미 닿은 곳으로만 되돌려 반경을 지킨다.
용어를 앞 편과 이어 둔다. 루프 트랜스포머·잠재 반복 vs 토큰 사슬 편에서 쓴 홉(화살표 하나를 건너는 것)으로 옮기면, 여기서 말하는 레벨 은 “정확히 홉 만에 처음 닿는 노드들” 이다. 앞 편의 “홉 집합”이 홉 이내에 닿는 노드를 다 모은 것이라면, 레벨은 그중 그 홉에 새로 들어온 것만 떼어 낸 것 — 즉 이다. 이 글이 재는 것이 “한 단계에 새로 닿는 노드가 몇 개냐”(전선 폭)라서 차집합 쪽이 필요했다.
검산 결과다. 만든 레벨과 그래프만 보고 BFS를 돌려 얻은 레벨이 어긋난 그래프는 400개 중 0개.
전선 폭 평균 2.18, 최대 9 ← 잠재 반복 vs 토큰 사슬 편은 언제나 1
도달 집합 |S| 평균 9.7, 범위 5~20
4. 세 가지 채널
블록도 같고 그래프를 읽는 방식도 같다. 다른 것은 단계 사이에 무엇이 지나가느냐뿐이다.
| 넘기는 것 | 파라미터 | |
|---|---|---|
| (A) 잠재 반복 | 실수 = 1,536개 | 63,106 |
| (B-집합) 토큰 사슬 | 24비트 도달 집합 | 106,626 |
| (B-경로) 토큰 사슬 | 노드 하나 (5비트) / 단계 | 109,785 |
(B-집합)이 잠재 반복 vs 토큰 사슬 편 설정이고, (B-경로)가 진짜 이산 CoT다.
(B-경로)를 공정하게 만드는 데 신경을 썼다. 이 모델은 자기가 뱉은 줄 전체를 다시 볼 수 있다. 인과 마스크를 쓴 보통의 자기회귀 디코더다. 그러니 정보를 잃지 않는다 — 이미 적은 것은 전부 남아 있고, 어텐션으로 다시 읽으면 된다. 배우는 것은 BFS 차례(레벨 순, 같은 레벨 안에서는 번호 순)이고, 다 적으면 STOP을 뱉는다.
즉 (B-경로)의 유일한 제약은 “한 번에 한 칸씩만 쓸 수 있다”는 것이다. 이론이 말하는 이산 채널의 제약이 정확히 이것이다.
5. 결과 1 — 단계가 밀린다
구간별로, 단계 예산을 1부터 24까지 주며 완전 정답률을 쟀다.

| 개수 | (A) 잠재 | (B-집합) | (B-경로) | |
|---|---|---|---|---|
| 5~8 | 3,000 | 4 | 4 | 8 |
| 9~12 | 2,480 | 4 | 4 | 12 |
| 13~16 | 1,197 | 4 | 4 | 16 |
| 17~20 | 564 | 4 | 4 | 20 |
(천장에 닿는 단계 수)
(A)와 (B-집합)은 4에 붙박여 있고, (B-경로)만 를 따라 올라간다. 기울기가 1보다 약간 크다 — 적을 것이 개인데 시작 노드와 STOP이 얹히기 때문이다.
반경은 내내 4였다. 깊이를 사야 하는 양은 하나도 안 변했는데 한쪽만 밀렸다. 밀린 이유는 깊이가 아니라 넓이다.
전체 곡선을 보면 더 분명하다.

파란색(A)과 주황색(B-집합)은 네 칸 모두 4에서 수직으로 100%에 꽂힌다. 빨간색 (B-경로)만 칸을 옮길 때마다 오른쪽으로 걸어간다.
6. 결과 2 — 천장까지 내려앉는다
예상 못 한 것이 하나 더 나왔다. (B-경로)는 예산을 아무리 줘도 닿는 자리가 낮아진다.

| 5~8 | 9~12 | 13~16 | 17~20 | |
|---|---|---|---|---|
| (A) 잠재 | 100% | 100% | 100% | 99.8% |
| (B-집합) | 100% | 100% | 100% | 100% |
| (B-경로) | 97.6% | 90.3% | 80.5% | 73.4% |
잠재 반복 vs 토큰 사슬 편 2장에서 본 곱셈이 여기서도 돈다. 노드를 하나 잘못 뱉으면 되돌릴 방법이 없고, 뱉을 것이 많을수록 틀릴 기회가 많다. 20개를 순서대로 다 맞혀야 하는 문제가 된다.
비용이 두 번 붙는다. 단계가 에 비례해 늘고, 그 늘어난 단계마다 틀릴 기회가 생겨 천장이 내려온다. 이론은 앞의 것만 말하는데, 실제로 돌려 보면 뒤의 것이 더 아프다.
7. 결과 3 — 중첩을 직접 본다
여기까지는 “(B-경로)가 느리다”만 보인 것이다. (A)가 정말 전선을 겹쳐 들고 있는가는 따로 확인해야 한다. 잠재 상태 에서 레벨 집합을 통째로 맞히는 선형 프로브를 학습시켰다. 칸 단위가 아니라 24칸 전부 맞혀야 한 건으로 센다.

| 바퀴 | 1 | 2 | 3 | 4 |
|---|---|---|---|---|
| 전선 전체를 맞힌 비율 | 99.5% | 98.6% | 98.4% | 99.1% |
읽힌다. 그런데 진짜 증거는 오른쪽 그림이다. 전선 폭별로 갈라 보면,
| 전선 폭 | 1 | 2 | 3 | 4 | 5 | 6 |
|---|---|---|---|---|---|---|
| 전체를 맞힌 비율 | 99.0% | 98.9% | 98.7% | 98.8% | 97.6% | 98.9% |
폭이 6이어도 안 떨어진다. 노드 여섯 개를 동시에 들고 있는데도 선형 하나로 전부 읽힌다. 이것이 중첩이다 — 하나를 가리키는 포인터가 아니라, 여섯을 겹친 상태다.
잠재 반복 vs 토큰 사슬 편의 프로브도 100%를 냈지만 그때는 전선 폭이 언제나 1이었다. 노드 하나를 가리키는 것과 구분이 안 되니, 중첩에 대해서는 아무것도 말하지 못하는 측정이었다.
8. 덤 — 잠재 쪽에도 붕괴가 있다
위 그림 오른쪽 칸이다. 필요한 바퀴는 4인데, 더 돌리면 (A)가 서서히 흘러내린다.
| 바퀴 | 4 | 6 | 10 | 16 | 24 |
|---|---|---|---|---|---|
| (A) 정답률 (~) | 98.4% | 99.8% | 98.2% | 94.9% | 94.0% |
6바퀴에서 정점을 찍고 24바퀴에서 6%p 아래로 내려온다. 가 클수록 더 빨리 샌다.
이것이 STARS가 2026년에 지적한 바로 그 현상이다 — 루프 언어 모델은 특정 반복 깊이에서 정점을 찍고 더 돌리면 무너진다. 처방으로 제시된 것은 잠재 상태를 점근 안정 고정점으로 유도하는 것, 즉 야코비안 스펙트럼 반경 제어다.
루프 트랜스포머 편에서 KL이 바퀴에 깨끗하게 멈추는 것을 보고 “고정점에 안착한다”고 썼는데, 그건 반경이 곧 난이도인 외길 과제였기 때문이었던 것 같다. 전선이 넓어지자 같은 구조에서도 흘러내린다.
9. 그래서 진짜 축은 무엇이었나
이 실험에서 가장 중요한 줄은 (B-집합)이 (A)와 똑같았다는 것이다. 네 구간 모두 4단계, 전부 100%. (B-집합)은 이산 채널이다. 실수 벡터가 아니라 24비트다.
그러므로 갈린 축은 “연속이냐 이산이냐”가 아니다. 채널이 집합을 한 번에 담을 수 있느냐다. 24비트짜리 이산 채널도 전선을 담을 수 있으면 연속 상태와 똑같이 행동한다.
연속 상태가 이기는 진짜 이유는 실수여서가 아니라 넓어서다. 자연어 CoT가 지는 이유도 이산이어서가 아니라, 한 토큰이 좁아서 집합을 한 번에 못 적어서다.
잠재 반복 vs 토큰 사슬 편에 “1024개 실수 대 16비트”라고 써 놓고 나는 그것을 정밀도 차이로 읽었다. 실제로 작동한 것은 폭이었다.
이렇게 보면 잠재 반복 vs 토큰 사슬 편 뒤에 정리한 방향들 중 “탐색은 잠재로, 확정은 토큰으로” 라는 하이브리드 예상의 근거가 더 분명해진다. 넓은 채널이 필요한 구간은 탐색이고, 좁아도 되는 구간은 확정이다.
10. 한계
- 천장이 내려앉는 것은 이론이 아니라 관측이다. 이론이 예측하는 것은 단계가 밀리는 것까지다. 73.4%라는 천장은 탐욕적 디코딩의 오차 누적이라, 빔 서치나 더 큰 모델, 더 긴 학습으로 올라갈 여지가 있다. 단계가 밀리는 것은 못 올린다 — 적을 것이 개면 번 써야 한다. 둘을 섞어 읽으면 안 된다.
- 이 아니라 이 나왔다. 나가는 화살표를 2개로 고정해 간선이 이기 때문이다. 논문의 은 간선이 더 촘촘한 일반 그래프 이야기다. 분리의 방향은 같지만 지수는 다르다.
- (B-경로)의 차례를 내가 정해 줬다. BFS 순서를 가르쳤다. 실제 모델은 어떤 순서로 적을지도 스스로 정해야 하고, 그러면 더 불리해질 가능성이 높다.
- 층 구조 그래프는 인위적이다. 레벨 이 레벨 만 가리키게 만들어 반경을 고정했다. 덕분에 깊이와 넓이를 갈라 볼 수 있었지만, 그만큼 실제 추론과는 멀다.
- 6만 파라미터짜리 장난감이다. 잠재 반복 vs 토큰 사슬 편과 같은 한계다.
11. 한 문단 요약
잠재 반복 vs 토큰 사슬 편은 잠재 반복과 토큰 사슬이 똑같다고 결론지었는데, 그건 과제가 분리를 볼 수 없게 만들어져 있었기 때문이었다. 노드마다 나가는 화살표가 하나라 BFS 전선이 언제나 폭 1이었고 (겹쳐 들 것이 없었다), 그 위에 이산 쪽에 집합 채널을 쥐여 줬다. 분기를 넣고(전선 폭 평균 2.18, 최대 9) 반경을 4로 붙박은 뒤 다시 재니, 잠재 반복과 집합 채널은 와 무관하게 4단계에서 100% 인데 노드 하나씩 뱉는 진짜 이산 CoT만 8 → 12 → 16 → 20 단계로 밀리고 천장이 97.6% → 73.4% 로 내려앉았다. 프로브로 잠재 상태를 캐 보니 전선 폭이 6이어도 98.9% 로 통째로 읽혀, 여러 노드를 겹쳐 들고 있다는 것이 확인됐다. 그리고 가장 중요한 것 — (B-집합)도 이산인데 잠재와 똑같았다. 갈린 축은 연속이냐 이산이냐가 아니라 채널이 집합을 한 번에 담느냐였다. 덤으로, 필요한 4바퀴를 넘겨 계속 돌리면 잠재 쪽도 6%p 흘러내린다는 것을 봤다 — 루프 모델의 깊이 붕괴를, 장난감 크기에서도.
과거 편에 되먹인 것
이 연재는 틀린 글을 그대로 두지도, 조용히 고치지도 않는다. 뒤집힌 내용은 과거 편에 돌아가 고치되, 무엇이 왜 틀렸는지를 그 자리에 남긴다. 고친 글이 나중에 다시 읽힐 때 잘못된 내용을 흡수하지 않게 하면서, 틀린 과정에서 얻은 것은 지우지 않기 위해서다.
- 루프 트랜스포머 편 — 3장에 과제 복잡도 정정(함수 그래프 도달성은 L 안에 있다, NL-complete 가 아니다), 6장에 고정점 주장의 적용 범위 단서. 측정값은 그대로다.
- 잠재 반복 vs 토큰 사슬 편 — 3장 결론 뒤집힘 표시, 6장 대역폭 해석 정정(정밀도가 아니라 폭), 한계 1·2 에 주석. 5장 공개 수치와 4장 관측 가능성 논의는 유효하다.
두 글 모두 끝에 고친 기록을 달아 두었다. 거기 적은 교훈을 한 줄로 줄이면 이렇다.
“차이가 없다”는 결론을 쓰기 전에, 이론이 이득의 출처라고 말하는 양을 먼저 재 본다.
여기서는 그 양이 전선 폭이었고, 평균 1.00, 최대 1 을 찍는 데 10초면 됐다. 그 10초를
안 써서 글 한 편이 틀린 결론으로 나갔다.
참고
- Zhu et al., Reasoning by Superposition: A Theoretical Perspective on Chain of Continuous Thought (arXiv:2505.12514) — 이 글이 재현하려 한 분리
- Li, Liu, Zhou, Ma, Chain of Thought Empowers Transformers to Solve Inherently Serial Problems (arXiv:2402.12875, ICLR 2024) — CoT 토큰 수 = 직렬 시간
- Merrill & Sabharwal, A Little Depth Goes a Long Way (arXiv:2503.03961) — 로그 깊이면 TC⁰ 밖
- STARS: Stabilizing Recurrent Dynamics for Test-Time Scalable Latent Reasoning (arXiv:2605.26733) — 8장의 깊이 붕괴와 그 처방
- Zou, Xiong, Liu, Capabilities and Fundamental Limits of Latent Chain-of-Thought (arXiv:2602.01148) — 탐색엔 강하고 계산엔 약한 이유
- A Survey on Latent Reasoning (arXiv:2507.06203) — 분야 지도
- 잠재 반복 vs 토큰 사슬 — 이 글이 고치는 앞 글