코딩 평가에서 신호와 잡음 분리하기

작성자

카테고리:

← 피드로
GeekNews · xguru · 2026-07-10 개발(SW)

AI 모델의 코딩 능력 평가는 배포와 안전성 판단에 직접 연결되지만, OpenAI의 감사에서 SWE-Bench Pro 작업 중 약 30%가 깨진 상태로 추정됨 SWE-Bench Pro는 더 긴 작업 범위와 현실적인 과제를 목표로 했으나, 731개 공개 작업에서 통과율이 8개월 만에 23.3%에…

원문 보기 ↗

출처: news.hada.io · https://news.hada.io/topic?id=31291

코멘트

답글 남기기

이메일 주소는 공개되지 않습니다. 필수 필드는 *로 표시됩니다