AGI 평가 과정과 수상자 선정에서 드러난 불일치

작성자

카테고리:

← 피드로
GeekNews · neo · 2026-07-18 개발(SW)

Kaggle·Google DeepMind의 AGI 벤치마크 해커톤 결과 발표 뒤, 참가자들은 1위 MEDLEY-BENCH의 점수 산출·재현성 문제를 근거로 심사 과정 공개와 재검토를 요구함 MEDLEY-BENCH는 모델 규모가 커질수록 ‘평가’만 향상되고 ‘통제’는 정체된다고 결론 내렸지만, 비판 측은 두 지표…

원문 보기 ↗

출처: news.hada.io · https://news.hada.io/topic?id=31536

코멘트

답글 남기기

이메일 주소는 공개되지 않습니다. 필수 필드는 *로 표시됩니다