#파이프라인
1편
- 분산 학습 — 계산을 나누면 통신이 남는다GPU를 32배 늘려도 32배 빨라지지 않는다. 나눌 수 없는 부분이 5%만 있어도 12.1배에서 멈췄고, 20%면 5.1배였다. 나누는 방식마다 통신량도 달랐다 — 데이터 병렬은 스텝마다 28GB, 파이프라인은 0.067GB다. 그리고 분산은 속도만을 위한 것이 아니다. 학습에는 파라미터의 4.0배가 드는데(실측), 그것을 32장에 쪼개면 장당 112GB가 3.5GB가 된다
1편
↑↓ 고르기Enter 열기Esc 닫기