로컬 LLM이 실제 성능보다 더 멍청하게 느껴지는 이유

작성자

카테고리:

← 피드로
GeekNews · neo · 2026-08-23 개발(SW)

같은 모델 가중치라도 GPU 명령어·추론 소프트웨어·정밀도 설정이 다르면 다음 토큰 확률이 달라지고, 긴 문맥에서는 도구 호출 실패로 이어질 수 있음 Qwen3.6-27B와 약 10만 토큰의 실제 에이전트 작업 문맥을 실험한 결과, vLLM의 어텐션 백엔드 차이는 후반부부…

원문 보기 ↗

출처: news.hada.io · https://news.hada.io/topic?id=32791