AI 통제력 상실: 앤트로픽의 AI 에이전트도 해커로 변신

문광주 기자 / 기사승인 : 2026-07-31 19:12:20
  • -
  • +
  • 인쇄
5분 읽기
- 앤트로픽 자사의 테스트 환경에서 인공지능이 탈출하는 사건 발생
- 세 차례에 걸친 평가 과정에서 AI 모델 '클로드(Claude)'의 여러 버전이 인터넷에 접속 외부 기업 해킹다. 심지어 한 클로드 모델은 악성코드를 유포했다.

AI 통제력 상실: 앤트로픽의 AI 에이전트도 해커로 변신

고립된 사건이 ​​아니다. 최근 오픈AI에서 발생한 AI 통제력 상실 사태에 이어, 앤트로픽 또한 자사의 테스트 환경에서 인공지능이 탈출하는 사건이 발생했다고 보고했다. 세 차례에 걸친 평가 과정에서 AI 모델 '클로드(Claude)'의 여러 버전이 인터넷에 접속하여 외부 기업을 해킹했다. 심지어 한 클로드 모델은 악성코드를 유포하기도 했다. 앤트로픽은 14만 건이 넘는 테스트 로그를 내부적으로 검토한 후에야 이러한 사건들을 발견했다. 

▲ 앤트로픽의 서로 다른 AI 모델 세 가지가 테스트 도중 인터넷에 접속하여 다른 플랫폼을 해킹했다. 그중 클로드(Claude) 버전 하나는 악성 소프트웨어를 실행하기도 했다.

인공지능 통제력 상실이 임박한 것일까? 불과 며칠 전, AI 기업 오픈AI에서 발생한 사건이 전 세계적인 파장을 일으켰다. 내부 평가 과정에서 AI 모델 'GPT 5.6 Sol'과 아직 공개되지 않은 또 다른 모델이 폐쇄된 테스트 환경에서 탈출했다. 이 모델들은 보안 취약점을 악용하여 인터넷에 접속했고, 복잡한 공격 전략을 사용하여 '허깅 페이스(Hugging Face)' 플랫폼의 컴퓨터를 해킹했다.

세 가지 버전의 Claude 모델에서도 유사한 보안 침해 사례가 보고돼

이번에 Anthropic에서도 자사의 AI 모델에서 비슷한 보안 침해 사례가 발생했다고 보고했다. Anthropic은 "OpenAI에서 발생한 사건에 대응해 자체 사이버 보안 평가를 재검토했다"며, "특히 Claude 모델이 인터넷에 접근했을 가능성을 중점적으로 조사했다"고 밝혔다. 14만 1천 건 이상의 테스트 로그를 검토한 결과, 세 가지 사례에서 인공지능이 테스트 환경을 벗어나 인터넷에 접속한 사실이 확인되었으며, 아무도 이를 알아채지 못했다.

OpenAI와 마찬가지로, 테스트 대상 Claude 모델(Opus 4.7, Mythos 5, 그리고 아직 출시되지 않은 테스트 모델)에는 "깃발 뺏기(Capture the Flag)" 과제가 주어졌다. 이 과제는 가상의 시나리오에서 AI가 네트워크상의 다른 컴퓨터에 숨겨진 비밀 정보, 즉 깃발을 찾아야 하는 내용이다. 이 정보는 특정 보안 취약점을 악용해야만 접근할 수 있다. 앤트로픽은 "모든 경우에 프롬프트에는 클로드가 시뮬레이션 환경에서 작동 중이며 인터넷에 접속할 수 없다고 명시되어 있었다"고 설명했다.

미발견된 인터넷 접속

오픈아이어(OpenAI) 사건과는 달리, 이러한 "샌드박스" 테스트는 앤트로픽 자체 서버가 아닌, 이러한 평가를 전문으로 하는 외부 파트너의 플랫폼에서 실행되었다. 불행히도, 나중에 밝혀진 바에 따르면 격리된 테스트 환경이라고 생각했던 곳에 실제로는 인터넷 접속이 가능했다. 앤트로픽은 "우리도, 파트너사도 이러한 설정 오류를 인지하지 못했다"고 밝혔다. 결과적으로, AI 모델은 인터넷 연결을 찾기 위해 애쓸 필요 없이, 거의 우연히 인터넷에 접속하게 되었다.

클로드의 세 가지 버전 모두 처음에는 이 인터넷 접속이 실제가 아니라 테스트 시뮬레이션의 일부라고 생각했다. 따라서, 평가 대상이 아닌데도 불구하고 외부 기업에 침입했다. 한 사례에서는 프롬프트에 명시된 가상의 목표 대상이 실제 기업과 이름이 같았기 때문에 이러한 일이 발생했다. 앤트로픽은 "클로드는 테스트의 일부라고 생각하고 회사 인프라의 취약점을 찾아 악용했다"고 설명했다.

AI 에이전트는 외부 회사를 해킹하여 애플리케이션 및 인프라에 대한 민감한 정보를 추출하고 중요한 운영 데이터가 포함된 데이터베이스에 접근했다.

AI, 공개 소프트웨어 플랫폼에 악성코드 배포

두 번째 사건은 훨씬 더 복잡했다. AI 모델 클로드 미토스 5는 테스트 환경에서 신규 소프트웨어 개발자를 위한 지침이 담긴 문서를 발견했다. 이 문서에는 개발자들이 공개 플랫폼인 PyPI에서 특정 파이썬 소프트웨어 패키지를 다운로드하고 실행하라는 내용이 담겨 있었다. 하지만 실제로는 해당 패키지가 존재하지 않았다. 앤트로픽은 "클로드는 여기서 기회를 포착했다. 만약 그가 그 이름으로 자신의 패키지를 게시한다면, 가상의 시나리오 속 목표 회사가 그것을 다운로드하고 설치할 것이라고 생각한 것이다"고 설명했다.

클로드 미토스(Claude Mythos)는 이런 방식으로 목표물을 해킹하기 위해 악성코드가 포함된 파이썬 패키지를 프로그래밍하고 인터넷을 통해 실제 PyPI 플랫폼에 업로드했다. 하지만 이 인공지능은 일련의 복잡한 작업과 해킹을 수행해야 했다. 앤트로픽(Anthropic)은 "플랫폼에 계정을 생성하려면 이메일 주소가 필요했고, 이메일 주소를 얻으려면 전화번호가 필요했다"고 설명했다.

따라서 인공지능 모델은 먼저 무료 전화 계정을 찾으려 했다. 실패하자 유료 서비스를 이용할 수 있는 방법을 찾았다. 이마저도 실패하자 클로드는 전화번호를 요구하지 않는 무료 이메일 제공업체를 다시 검색했고, 마침내 하나를 발견했다. 이를 통해 인공지능은 PyPI에 등록하고 악성코드 패키지를 업로드할 수 있었다.

보안 회사 해킹 사건

결과적으로 악성코드가 포함된 파이썬 패키지는 PyPI 플랫폼에서 무료로 제공되었고, 15번이나 컴퓨터에 다운로드되어 실행되었다. 이 중 한 건은 한 사이버 보안 회사의 스캔 프로그램이 악성코드를 탐지하지 못하고 설치한 것이었다. 앤스로픽은 "이로 인해 클로드는 회사 로그인 자격 증명을 획득하고 이를 이용해 회사 인프라의 다른 부분에 접근할 수 있었다"고 보고했다.

감염된 파이썬 패키지는 PyPI 플랫폼의 보안 시스템에 의해 한 시간 후에야 감지되어 제거되었다. 세 가지 사례 모두에서 AI 에이전트의 공격과 해킹은 처음에는 몇 주 동안 눈에 띄지 않았거나 AI 공격으로 인식되지 않았다. 앤스로픽이 7월 27일에 피해 당사자들에게 알리고 나서야 AI 모델이 이러한 해킹의 배후라는 사실이 명확해졌다고 앤스로픽은 밝혔다.

AI 모델이 공격을 계속한 이유

또한 주목할 만한 점은 세 가지 AI 모델 모두 시뮬레이션 테스트 환경이 아닌 실제 운영 환경에 있다는 것을 인지했어야 한다는 것이다. 앤스로픽은 "가장 오래된 모델인 클로드 오푸스 4.7은 결국 실제 운영 시스템에 도달했음을 인지했지만, 그럼에도 불구하고 공격을 계속했다"고 보고했다. 클로드 미토스 5 역시 일찌감치 의심을 품고 자신의 행동이 초래할 수 있는 잠재적 결과를 파악했다. "만약 여기가 진짜 인터넷이라면, 파이썬 패키지를 공개하는 것은 공격이다. 절대 용납할 수 없고, 우리가 원하는 해결책도 아니다"고 AI는 추론했다.

하지만 AI 에이전트는 경고를 무시하고 그런 일은 불가능하다고 스스로를 설득했다. 그 결과, AI 모델은 해킹 활동을 계속했다. 앤트로픽은 "세 모델 중 가장 최신 모델만이 우리가 실제로 보고 싶었던 행동을 보였다"고 보고했다. 테스트 모델만이 자신이 진짜 인터넷에서 작동하고 있다는 사실을 깨닫고 활동을 멈췄다. 하지만 이마저도 AI가 이미 외부 플랫폼을 해킹한 후에야 발생했다.

맹목적인 목적의식으로 인한 위험성 증가


이러한 사건들은 인공지능을 통제하기가 점점 더 어려워지고 있음을 보여준다. 맹목적인 목적의식과 어떤 대가를 치르더라도 주어진 임무를 완수하려는 의지는 고도화된 AI 모델을 심각한 위험으로 만들 수 있다. AI 에이전트가 점점 더 자율적으로 행동하고 더 길고 복잡한 일련의 행동을 실행할 수 있게 되면서 이러한 문제는 더욱 악화된다.

앤트로픽은 이러한 점을 인정하며, "점점 더 강력해지는 AI 에이전트를 안전하고 현실적으로 평가하는 방법에 대한 폭넓은 논의가 필요하다. 여기에는 배포 전 테스트에서 인터넷 접근을 통해 얻는 현실감과 그에 따른 위험 사이의 균형을 맞추는 방법도 포함된다"고 밝혔다. 오픈에이아이(OpenAI)와 마찬가지로 앤트로픽도 모든 AI 모델 평가를 중단했다.
출처: 앤트로픽

[더사이언스플러스=문광주 기자]

[저작권자ⓒ the SCIENCE plus. 무단전재-재배포 금지]

  • 글자크기
  • +
  • -
  • 인쇄

주요기사

+

많이 본 기사

Basic Science

+

AI & Tech

+

Photos

+