← 피드로
Kaggle·Google DeepMind의 AGI 벤치마크 해커톤 결과 발표 뒤, 참가자들은 1위 MEDLEY-BENCH의 점수 산출·재현성 문제를 근거로 심사 과정 공개와 재검토를 요구함 MEDLEY-BENCH는 모델 규모가 커질수록 ‘평가’만 향상되고 ‘통제’는 정체된다고 결론 내렸지만, 비판 측은 두 지표…
출처: news.hada.io · https://news.hada.io/topic?id=31536
답글 남기기