메모리 아끼면서 Cross Entropy Loss 계산하기

작성자

카테고리:

← 피드로
GeekNews · trillionlabs · 2026-07-06 개발(SW)

긴 context, 큰 vocab의 LLM 학습에서 LM head + cross entropy가 왜 가장 큰 메모리 소비처 중 하나가 되는지 짚어본 글. 128K context에서는 logits 텐서 하나가 40GB에 육박해서, 모델 weight보다도 커진다. 16B 모델을 128K context로 학습하다 실제로 겪은 OOM에서 출발해, cross entropy의 forward/back

원문 보기 ↗

출처: news.hada.io · https://news.hada.io/topic?id=31168

코멘트

답글 남기기

이메일 주소는 공개되지 않습니다. 필수 필드는 *로 표시됩니다