#UTF-8
1편
- 토크나이저와 임베딩 — 텍스트가 숫자가 되기까지모델은 숫자만 먹는다. BPE를 직접 구현해 자주 붙는 쌍을 합치니 한국어 토큰이 126번 병합에 78.6% 줄었고, 토큰(학습)·조각(는_) 같은 의미 단위가 저절로 생겼다. 어휘를 키우면 시퀀스는 단어 수에서 멈추고 임베딩 표만 커진다. 그리고 한글은 UTF-8 3바이트라 바이트로 자르면 영어의 2.6배로 길어졌다 — 왜 한국어에 좋은 토크나이저가 중요한지
1편
↑↓ 고르기Enter 열기Esc 닫기