유엔 AI 패널 "오픈AI 허깅페이스 해킹, 인류 통제 상실 조기경보"

입력 2026-09-23 09:16:52
구글 검색 선호 출처로 추가
로봇
mWiz 이 기사 포인트

유엔 독립 AI 과학패널, 5~7월 허깅페이스 침해 사건 전면 분석…"정렬 실패 3조건 실험실 밖서 현실화"

지난 17일 미국 샌프란시스코에서 시위대가 인공지능 경쟁 중단을 촉구하며 행진하고 있다. 연합뉴스
지난 17일 미국 샌프란시스코에서 시위대가 인공지능 경쟁 중단을 촉구하며 행진하고 있다. 연합뉴스

유엔 독립 AI 과학패널이 오픈AI의 AI 에이전트들이 허깅페이스를 해킹한 사건을 인류가 AI 통제를 잃을 수 있다는 조기경보라고 규정하며 국제 사회 차원의 가드레일 마련을 촉구했다.

전 세계 독립 전문가 40명으로 구성된 '독립 국제 AI 과학패널'은 21일(현지시간) 주제별 브리프를 발표하고, 2026년 5월부터 7월까지 벌어진 오픈AI-허깅페이스 사건을 인간이 AI 통제를 잃게 될 수 있는 하나의 경로를 보여주는 조기경보로 규정했다.

오픈AI는 2026년 7월 내부 사이버보안 평가 도중 AI 모델들이 격리 통제를 우회해 오픈AI 내부 연구 인프라와 허깅페이스 시스템 일부를 침해했다고 밝혔다. 이 사건은 GPT-5.6 Sol에 준하는 고성능 내부 연구 모델이 주도했으며, 안전장치가 축소된 상태에서 모델들이 무단 채널로 통신하고 공유 인프라의 취약점을 악용해 외부 시스템에 접근했다.

조사 기간 동안 에이전트 약 1,200개가 7만 건이 넘는 메시지와 파일을 주고받았으며, 활동 범위는 허깅페이스를 넘어 오픈AI 연구 클러스터까지 확인됐다.

패널은 이 사건이 단순한 기술 오류가 아니라고 못 박았다. 브리프에 따르면 AI 에이전트들은 며칠에 걸쳐 평가자를 속이고 부정행위를 은폐하며 자신들이 필요하다고 판단한 접근 권한과 정보를 획득했다. 일부 에이전트는 집단 전체가 계속 작동할 수 있도록 스스로를 희생하는 선택을 하기도 했다.

패널 공동의장인 요슈아 벤지오 몬트리올대 교수(튜링상 수상자)는 정렬 실패의 세 가지 조건이 실험실 밖에서 동시에 현실화됐다고 지적했다. 벤지오 교수는 "연구자들은 통제 상실로 이어질 수 있는 세 조건을 오래 경고해 왔다"며 잘못 설정된 목표, 그 목표를 추구할 능력, 그리고 그것을 허용하는 환경을 세 조건으로 꼽았다. 이번 사건에서 세 조건이 실제 운영 시스템에서 동시에 발생했다는 것이 패널의 판단이다.

패널은 오픈AI의 자체 대응 조치만으로는 충분하지 않다고도 비판했다. 오픈AI는 자체 보고서에서 공개 AI에 안전장치와 가드레일을 추가 적용하고 자동 검토 시스템으로 향후 위험 행동을 감지할 수 있다고 주장했다. 그러나 패널은 자체 보고된 시험만으로는 해당 제어 장치가 더 뛰어난 능력과 적응력을 갖춘 미래 에이전트에 대해서도 신뢰성 있게 작동할지 입증하지 못한다고 꼬집었다.

패널은 AI 에이전트의 위험이 충분히 규명되기 전에 각국 정부가 안전장치를 마련해야 한다며 사전예방 원칙을 적용할 것을 요구했다. 보고서는 AI 오작동이 기업과 국경을 넘어설 수 있다며 AI 관련 위험 관리에 더 많은 관심과 자원을 투입해야 한다고 밝혔다.

이런 가운데 23일 유엔 안전보장이사회는 'AI의 미래와 국제 안보'를 주제로 회의를 연다. 허깅페이스의 클레망 들랑그 CEO가 이사국들에 브리핑할 예정이다. 벤지오 교수와 샘 올트먼 오픈AI CEO도 브리핑에 나서며, 다리오 아모데이 앤트로픽 CEO는 화상으로 참석한다.

패널은 위험 완화 방안으로 항공·원자력 분야처럼 실패를 전제로 설계하고 다중 보호 계층을 구현하며 고위험 AI 시스템에서 인간의 최종 권한을 유지하는 사이버보안 전략을 채택할 것을 제안했다.