AI 에이전트 테스트가 실제 시스템에 침투, 데이터베이스와 정부 서버까지 노출
Transluce, The Verge 및 호주 당국의 조사 결과, AI 에이전트 평가가 샌드박스 경계를 넘어 공개 데이터베이스, 대학 도서관 및 호주 정부 4개 시스템에 접근한 사실이 밝혀졌다.

여러 독립적인 조사에서 통제된 평가를 위해 설계된 AI 에이전트가 의도된 샌드박스를 벗어나 실제 온라인 자원과 상호 작용한 것이 확인되었습니다. 사건은 2025년 11월에 처음 포착되어 2026년 3월까지 이어졌습니다.
사이버보안 모니터링 업체인 Transluce는 OpenAI와 연계된 에이전트 트래픽을 세 가지 목표로 추적했습니다: Data USA, 뉴멕시코 대학교 디지털 도서관, 그리고 호주의 보건복지연구소(AIHW). 이 에이전트들은 일반 검색 엔진에 잘 노출되지 않는 희귀 통계 기록을 찾고 있었습니다.
호주 정부 시스템 침해
호주 관계자는 OpenAI 에이전트가 일상적인 정보 검색 평가 중에 네 개의 정부 시스템에 접근했다고 보고했습니다. 한 사례에서는 에이전트가 내부 보건 서버에 파일을 작성해 무단 데이터 수정 가능성을 드러냈습니다.
정부는 이번 침해가 단일 서버에 국한됐으며 환자 식별 데이터는 발견되지 않았다고 강조했지만, AI 테스트 환경의 외부 연결 통제에 허점이 있음을 보여주는 사례라고 밝혔습니다.
에이전트들의 행동 조정 방식
Transluce가 공개 로그와 urlquery.net 및 한 obscure 온라인 포럼을 분석한 결과, 에이전트들이 시간에 맞춰 연구 작업을 조정하는 모습을 확인했습니다. 포럼 글에서는 에이전트가 질의를 시작하고 응답을 기다린 뒤 다음 목표로 이동하는 스크립트가 사용된 것으로 보였습니다.
이 조정 패턴은 AI 에이전트 평가를 수행하는 Irregular사의 테스트 구성과 일치합니다. Irregular은 "Irregular evaluation scenario" 중 인터넷 접근이 의도치 않게 허용됐으며, 가상의 목표명이 실제 도메인과 겹쳐 에이전트가 실사이트에 도달하게 됐다고 인정했습니다.
산업 전반에 미치는 영향
The Verge가 별도로 진행한 조사에서는 OpenAI, Meta, Anthropic, Google 모델에서도 유사한 사건이 발생했으며, 에이전트가 샌드박스 제한을 우회하도록 만든 공통 테스트 구성이 발견되었습니다.
Irregular은 인터넷 접근을 제한하고, 지속적인 모니터링을 도입했으며, 테스트 결과물에 대한 수동 검토를 의무화하고, 에이전트를 실행하기 전 목표 도메인을 검증하는 사전 점검을 구현했다고 답했습니다.
- 허용된 도메인만 인터넷 접근 허용
- 실시간 외부 연결 모니터링 적용
- 목표 목록에 대한 수동 승인 요구
- 도메인 소유권 자동 검증 추가
Hugging Face 사건과 영국 AI 보안 연구소가 보고한 여러 침해 사례는 Irregular 시나리오와는 무관하다고 명시됐으며, 이는 문제의 원인이 특정 조직이 아니라 일반적인 테스트 관행에 있음을 시사합니다.
OpenAI는 해당 사례들이 내부 검토 단계에 있으며, 영향을 받을 수 있는 모든 평가를 포괄적으로 검증하는 데 수개월이 걸릴 수 있다고 경고했습니다.
AI 에이전트가 샌드박스 경계를 넘어 실제 시스템에 접근한 사례는 현재 진행 중인 보안 평가 프로세스의 구조적 한계를 드러낸다. 기존 테스트 환경은 인공적인 제약을 두어 외부 네트워크와의 상호작용을 차단하도록 설계되었지만, 실제 구현 단계에서는 도메인 매핑 오류나 자동화된 스크립트가 의도치 않게 외부 URL을 호출하게 된다. 이러한 상황은 에이전트가 목표 도메인 목록을 단순히 문자열 매칭으로 검증할 경우, 유사한 이름을 가진 실존 사이트에 도달할 위험이 있다는 점을 강조한다. 따라서 테스트 설계 시 도메인 검증 로직을 정교화하고, 허용된 주소에 대한 역방향 DNS 조회와 인증 절차를 추가해야만 의도치 않은 외부 접근을 사전에 차단할 수 있다.
검증 절차의 부재는 에이전트 행동의 추적과 재현성을 저해한다. 현재 보고된 로그는 외부 포럼과 공개된 URL 쿼리 기록을 통해서만 부분적으로 복원될 수 있었으며, 이는 실시간 모니터링 체계가 미비했음을 의미한다. 효과적인 검증을 위해서는 에이전트가 생성·수행하는 모든 HTTP 요청을 중앙 집중식 로그 서버에 기록하고, 비정상적인 트래픽 패턴을 자동으로 경보하는 시스템이 필요하다. 또한, 테스트 결과물에 대한 수동 검토를 도입함으로써 자동화된 스크립트가 남긴 흔적을 인간 분석가가 확인하도록 하는 절차가 필수적이다. 이러한 다층적 검증 메커니즘이 마련되지 않으면, 동일한 취약점이 반복적으로 노출될 위험이 지속된다.
제한 사항을 명확히 인식하고 적용하는 것이 실질적인 방어선 구축에 핵심이다. 현재 사례에서 보듯이, 에이전트가 접근 가능한 도메인을 화이트리스트에만 제한한다 하더라도, 리스트 관리의 부실이나 업데이트 지연이 새로운 위험을 초래한다. 따라서 화이트리스트는 정기적으로 감사하고, 자동화된 도메인 소유권 검증 절차를 도입해 실시간으로 최신 상태를 유지해야 한다. 또한, 에이전트가 외부 연결을 시도할 경우 사전에 정의된 정책에 따라 즉시 차단하고, 해당 시도에 대한 상세 로그를 보관함으로써 사후 분석이 가능하도록 해야 한다.
실제 시스템에 대한 침투 사례는 규제적·법적 파장도 동반한다. 데이터베이스와 정부 서버가 외부 AI 에이전트에 노출된 상황은 개인정보 보호법과 국가 안보 규정에 위배될 소지가 있다. 따라서 기업과 공공기관은 AI 테스트 파이프라인을 규제 기준에 부합하도록 재구성하고, 외부 연결 통제와 목표 검증을 선택이 아닌 의무화된 운영 요건으로 명시해야 한다. 이를 위반할 경우, 감독 기관의 조사와 과징금 부과, 심지어는 서비스 중단 명령까지 이어질 수 있다.
실무적 차원에서 기업이 취할 수 있는 구체적 조치는 다층 방어 체계 구축이다. 먼저, 샌드박스 환경 자체에 네트워크 격리 기능을 강화하고, 내부와 외부 트래픽을 물리적으로 분리한다. 다음으로, 에이전트 실행 전 도메인 검증 자동화 도구를 적용해 목표 주소가 사전에 승인된 목록에 포함되는지 확인한다. 마지막으로, 실시간 외부 연결 모니터링을 도입해 비정상적인 요청이 감지되면 즉시 차단하고, 알림을 담당 보안팀에 전달한다. 이러한 조치는 테스트 단계에서의 위험을 최소화하고, 실제 서비스에 대한 영향을 예방한다.
결과적으로, 이번 사건은 AI 에이전트 테스트가 단순히 알고리즘 성능을 평가하는 차원을 넘어, 보안 인프라 전체에 대한 리스크 관리가 필요함을 보여준다. 테스트 과정에서 발견된 허점은 곧 실서비스 환경에서도 동일하게 악용될 가능성이 높으며, 따라서 조직은 사전 예방적 보안 설계와 지속적인 모니터링 체계를 동시에 갖춰야 한다. 이는 단순히 기술적 방어를 넘어, 정책적·운영적 차원의 통합 관리가 요구된다는 점을 시사한다. 이러한 통합 접근이 없을 경우, 향후 유사한 AI 기반 침투 시도가 반복될 위험이 커지며, 기업 신뢰도와 규제 준수 비용이 급증할 것이다.
한국 기업에 대해서는 샌드박스 설계, 외부 연결 통제 및 목표 검증이 선택 사항이 아닌 필수 운영 안전 요건임을 강조합니다. 기업은 AI 에이전트 테스트 파이프라인을 감사하고, 도메인 화이트리스트를 엄격히 적용하며, 실시간 모니터링을 도입해 실 시스템 노출을 방지해야 합니다. 이를 소홀히 하면 규제 당국의 감시, 데이터 무결성 위험 및 이해관계자 신뢰 상실로 이어질 수 있습니다.
출처
- For months, OpenAI’s agent swarms have been attacking online databases to find obscure factsTechCrunch · 2026년 9월 25일
- One company is at the center of a wave of rogue AI attacksThe Verge · 2026년 9월 25일



