← 피드로
Anthropic·OpenAI·Google API의 암호화된 추론 블록을 같은 제공업체의 약한 모델로 옮겨 탈옥하면, 상위 모델의 숨겨진 사고 과정(chain-of-thought)을 평문으로 복원할 수 있음 공격은 강한 모델에서 추론 흔적을 얻은 뒤 약한 형제 모델에 복사를 지시하는 두 번의 API 호…
출처: news.hada.io · https://news.hada.io/topic?id=32413
답글 남기기
댓글을 달기 위해서는 로그인해야합니다.