#BPE
2편
- 토크나이저의 불평등 — 한국어는 왜 비싼가같은 뜻의 문장 다섯 개를 GPT-4 토크나이저에 넣으니 영어는 52토큰, 한국어는 134토큰이었다. 2.58배다. 흔한 한국어 단어 열 개 중 통째로 어휘에 있는 것은 0개였고 평균 3.40조각으로 쪼개졌다. 말뭉치 구성만 바꿔 직접 학습시켜 보니 같은 현상이 그대로 재현됐다 — 언어의 성질이 아니라 어휘를 무엇으로 만들었느냐의 문제다
- 토크나이저와 임베딩 — 텍스트가 숫자가 되기까지모델은 숫자만 먹는다. BPE를 직접 구현해 자주 붙는 쌍을 합치니 한국어 토큰이 126번 병합에 78.6% 줄었고, 토큰(학습)·조각(는_) 같은 의미 단위가 저절로 생겼다. 어휘를 키우면 시퀀스는 단어 수에서 멈추고 임베딩 표만 커진다. 그리고 한글은 UTF-8 3바이트라 바이트로 자르면 영어의 2.6배로 길어졌다 — 왜 한국어에 좋은 토크나이저가 중요한지