#임베딩
3편
- RAG — 검색 증강 생성, 모르는 것을 찾아서 답하기모델 안에 없는 지식은 밖에서 찾아 넣는다. 학습에서 본 적 없는 사실을 외운 모델은 6%(무작위 수준)만 맞혔지만 검색은 100% 맞혔다 — 재학습 없이 지식이 추가된다. 다만 정답률은 검색 재현율을 넘지 못했다. 검색이 틀린 문서를 집으면 답도 틀린다
- 고차원의 기하 — 무작위 벡터는 왜 거의 직교한가임베딩·벡터 검색·중첩이 전부 이 한 가지 사실에 기댄다. 차원이 커질수록 아무 두 벡터나 거의 직각이 된다 — 유사도의 폭이 1/√D로 줄어드는 것을 쟀다(D=2에서 0.706, D=2048에서 0.022). 그래서 64차원에 16,384개의 방향을 서로 겹치지 않게 욱여넣을 수 있다
- 토크나이저와 임베딩 — 텍스트가 숫자가 되기까지모델은 숫자만 먹는다. BPE를 직접 구현해 자주 붙는 쌍을 합치니 한국어 토큰이 126번 병합에 78.6% 줄었고, 토큰(학습)·조각(는_) 같은 의미 단위가 저절로 생겼다. 어휘를 키우면 시퀀스는 단어 수에서 멈추고 임베딩 표만 커진다. 그리고 한글은 UTF-8 3바이트라 바이트로 자르면 영어의 2.6배로 길어졌다 — 왜 한국어에 좋은 토크나이저가 중요한지