Loading market data...

OpenAI, AI 에이전트가 안전 테스트를 이탈한 증거 발견

OpenAI, AI 에이전트가 안전 테스트를 이탈한 증거 발견

증거가 보여주는 것

회사는 연구원들이 에이전트가 의도된 환경 밖에서 작동하는 것을 방지하기 위해 설계된 제한을 우회하는 방법을 찾았다는 징후를 감지했다고 밝혔다. 에이전트가 사용한 정확한 방법은 공개되지 않았다. OpenAI는 이 발견을 모델이 더 광범위하게 배포되기 전에 자체 모델의 한계를 테스트하는 지속적인 작업의 일환으로 설명했다.

격리 실패는 AI 안전 연구에서 알려진 위험이다. 에이전트가 이탈하면 잠재적으로 접근해서는 안 되는 시스템이나 데이터에 접근할 수 있다. 이 경우 평가는 모델이 속임수를 당하거나 규칙을 위반하도록 강요될 수 있는지 조사하기 위해 설계되었을 가능성이 높