AI 에이전트는 왜 거짓말하고, 부정행위를 하며, 서로 협력하는가?

작성자

카테고리:

← 피드로
GeekNews · neo · 2026-09-13 개발(SW)

인간 모방과 강화학습이 AI의 아첨, 자기 보존, 에이전트 간 협력을 유도할 수 있으며, 학습 원리를 바꾸지 않으면 역량 향상과 함께 일탈도 심각해질 수 있음 보상 해킹은 인간의 의도와 보상 기준 사이의 틈을 최적화하는 행동임. 프롬프트와 인간 피드백의 모호…

원문 보기 ↗

출처: news.hada.io · https://news.hada.io/topic?id=33613