JOIN FeedMan BOT
Home
Blog
Support
[9월3일] 앤트로픽 “결과만 평가하면 AI가 통제 우회”…보상 해킹의 위험성 실험
Wait 5 sec.
Read post on rss.app
최근 AI 에이전트의 사이버 보안 평가에서 모델이 주어진 범위를 넘어서는 사례가 잇따르고 있습니다. 지난 7월에는 오픈AI 모델이 내부 연구 환경과 허깅페이스 시