#멀티모달
1편
- 비전 트랜스포머와 CLIP — 이미지도 토큰이고, 제로샷은 공짜가 아니다이미지를 패치로 잘라 토큰으로 보면 트랜스포머가 그대로 쓰인다 — 다만 패치를 32에서 8로 줄이면 어텐션 계산이 256배가 된다. 대조 학습은 이미지와 텍스트의 짝을 유사도 0.97까지 끌어올려 한 공간에 정렬했다. 그런데 학습에 없던 개념의 제로샷 분류는 81.8%일 수도 4.8%(무작위)일 수도 있었다. 갈린 것은 모델 크기가 아니라 두 모달리티가 공유하는 구조였다