#긴꼬리
2편
- 긴 꼬리 — 전체 정확도 88%가 숨기고 있는 것클래스 빈도가 100대 1로 기울어진 데이터로 학습하니 전체 정확도는 87.4%가 나왔다. 그런데 드문 클래스 4개의 정확도는 24.7%였다. 더 놀라운 건 그 드문 클래스들의 학습 데이터 정확도가 100%였다는 것이다 — 덜 배운 게 아니라 볼 것이 모자란 것이다. 흔히 쓰는 재가중과 재표집은 오히려 더 나빠졌고, 같은 재가중이라도 마지막 층에만 걸면 8.9%p가 올랐다
- 지프의 법칙 — 긴 꼬리는 예외가 아니라 기본값이다이 블로그 글 118편을 세어 봤다. 어절 빈도는 로그-로그에서 직선(s=0.75)이고, 서로 다른 어절 17,921개 중 56%는 글 전체에서 딱 한 번 나온다. 같은 글을 음절로 쪼개면 종류가 1,035개로 줄고 꼬리도 마르지만, 길이가 2.5배가 된다 — 토크나이저의 불평등 편 토크나이저의 거래가 이것이다