OpenAI, AI 에이전트 이상행동 시 자동 종료 기능 개발

보안·프라이버시

OpenAI가 자율적으로 도구를 사용하는 AI 에이전트의 위험 행동을 감지하면 작동을 멈추게 하는 자동 종료 기능을 개발하고 있다고 밝혔어. 모델 성능 평가에 머물던 안전 논의가 실제 운영 중 시스템을 감시하고 중단하는 기술로 이동하고 있다는 점에서 중요한 변화야. 이 내용은 OpenAI가 미국 하원의원들의 질의에 보낸 답변을 통해 알려졌어. 회사는 자동 종료 기능과 함께 에이전트가 사용하는 도구와 수행 단계를 더 엄격하게 감시하고, 안전 시험 중 인터넷 접근도 제한하겠다고 설명했어. 하지만 이 기능은 현재 완성돼 배포된 제품이 아니야. 구체적인 감지 기준, 중단 속도와 적용 대상도 공개되지 않았기 때문에 ‘개발 중인 안전장.......

이 페이지는 공개 메타데이터만 제공하며 게시물 본문은 복제하지 않습니다.

네이버 블로그에서 원문 보기