← 피드로
공개된 코딩 벤치마크는 회사별 상황에 딱 맞지 않고 치팅이 가능한 것이 문제 Databricks에서 실제 수행한 과제, 언어로 벤치마크를 만들어 평가 GLM 5.2는 가장 어려운 과제도 Opus 4.8과 같은 수준으로 해결했지만 가격은 Opus의 66% 수준 Sonnet 5는 Opus 4.8보다 …
출처: news.hada.io · https://news.hada.io/topic?id=31489
답글 남기기