← 피드로
서구 AI 기업은 중국 연구소의 모델 증류를 비판하면서도, 정작 중국이 공개한 추론 최적화 기술을 도입하고 있다는 비판을 받음 DeepSeek의 KV 캐시 최적화는 코딩처럼 긴 세션 문맥을 사용하는 특정 용도에서 캐시 메모리 사용량을 DeepSeek-V1 대비 약 437분의 …
출처: news.hada.io · https://news.hada.io/topic?id=34552