#토크나이저
3편
- 토크나이저의 불평등 — 한국어는 왜 비싼가같은 뜻의 문장 다섯 개를 GPT-4 토크나이저에 넣으니 영어는 52토큰, 한국어는 134토큰이었다. 2.58배다. 흔한 한국어 단어 열 개 중 통째로 어휘에 있는 것은 0개였고 평균 3.40조각으로 쪼개졌다. 말뭉치 구성만 바꿔 직접 학습시켜 보니 같은 현상이 그대로 재현됐다 — 언어의 성질이 아니라 어휘를 무엇으로 만들었느냐의 문제다
- 지프의 법칙 — 긴 꼬리는 예외가 아니라 기본값이다이 블로그 글 118편을 세어 봤다. 어절 빈도는 로그-로그에서 직선(s=0.75)이고, 서로 다른 어절 17,921개 중 56%는 글 전체에서 딱 한 번 나온다. 같은 글을 음절로 쪼개면 종류가 1,035개로 줄고 꼬리도 마르지만, 길이가 2.5배가 된다 — 토크나이저의 불평등 편 토크나이저의 거래가 이것이다
- 토크나이저와 임베딩 — 텍스트가 숫자가 되기까지모델은 숫자만 먹는다. BPE를 직접 구현해 자주 붙는 쌍을 합치니 한국어 토큰이 126번 병합에 78.6% 줄었고, 토큰(학습)·조각(는_) 같은 의미 단위가 저절로 생겼다. 어휘를 키우면 시퀀스는 단어 수에서 멈추고 임베딩 표만 커진다. 그리고 한글은 UTF-8 3바이트라 바이트로 자르면 영어의 2.6배로 길어졌다 — 왜 한국어에 좋은 토크나이저가 중요한지