#저계수
2편
- LoRA — 적은 파라미터로 적응하기큰 모델을 통째로 미세조정하는 대신 '저계수 업데이트'만 학습한다. 전체 미세조정으로 바뀐 가중치 ΔW의 특이값을 보니 상위 3개가 지배해, 적응은 사실상 저계수였다. 그래서 기반을 얼리고 rank 4짜리 어댑터만 학습하니 전체 미세조정과 똑같은 손실(0.0001)을 1/42 파라미터로 냈다
- 저계수 행렬과 SVD — 큰 행렬을 작게 쪼개기LoRA·압축·추천 곳곳에 나오는 '저계수'와 SVD를 한 장으로. SVD는 어떤 행렬이든 회전·스케일·회전으로 쪼개, 큰 특이값 몇 개가 행렬의 '에너지 대부분'을 담는다. 참 계수 5인 80×60 행렬에서 rank 5 근사가 상대오차 2%로 4800개 수를 700개로 줄였다