← 피드로
같은 모델 가중치라도 GPU 명령어·추론 소프트웨어·정밀도 설정이 다르면 다음 토큰 확률이 달라지고, 긴 문맥에서는 도구 호출 실패로 이어질 수 있음 Qwen3.6-27B와 약 10만 토큰의 실제 에이전트 작업 문맥을 실험한 결과, vLLM의 어텐션 백엔드 차이는 후반부부…
출처: news.hada.io · https://news.hada.io/topic?id=32791