펜타곤, AI 기반 폴리그래프+ 거짓말 탐지 프로그램에 3,030만 달러 요청
미국 국방부는 5년간 폴리그래프+라는 비접촉식 AI 거짓말 탐지기 개발을 위해 3,030만 달러 예산을 의회에 요청했지만, 그 신뢰성에 대한 과학적 합의는 여전히 미확정 상태다.

국방부는 2027 회계연도 예산안에서 폴리그래프+, 혹은 폴리그래프 넥스트 개발에 5년 동안 3,030만 달러를 배정해 달라고 요청했으며, 이 제안은 아직 의회의 승인을 기다리고 있다.
이 프로그램은 현재 약 280만 명에 달하는 민·군 인력을 대상으로 직원 신원 검증과 내부 위협 탐지를 담당하고 있는 방위 반정보 및 보안청(DCSA)이 관리한다.
폴리그래프+ 작동 원리
예산 문서에 따르면 폴리그래프+는 머신러닝으로 만든 신뢰도 점수와 피험자에게 센서를 부착하지 않고 생리 신호를 수집하는 ‘스탠드오프 센싱’를 결합한다. 구체적인 센서 구성과 시스템 아키텍처는 공개되지 않았다.
이전 펜타곤 시제품은 카메라를 이용해 심박수와 호흡률, 머리 움직임, 얼굴 온도, 심지어 피부의 모공 활동까지 추정했다. 이러한 설계가 새로운 시스템에 포함된 것은 아직 확인되지 않았다.
과학적 회의론
2003년 국가연구위원회(NRC) 검토에서는 기존 폴리그래프의 효능에 대한 과학적 증거를 ‘최대해도 약함’이라고 평가했다. 현대 연구자들은 스트레스와 기만 사이에 보편적인 일대일 관계가 없으며, AI 모델 학습에 사용되는 데이터가 신뢰할 수 있는 정답 라벨을 충분히 제공하지 못한다는 점을 지적한다.
만약 프로그램이 주장하는 80%‑94% 정확도를 달성하더라도, 280만 명 규모의 인력에 적용하면 여전히 상당수의 오탐이 발생해 무고한 직원이 보안 위험으로 오인될 가능성이 크다.
해결되지 않은 핵심 질문
- 추가 센서가 실제로 탐지 정확도를 높이는가, 아니면 근본적으로 신뢰할 수 없는 신호에 알고리즘적 신뢰도를 얹는 것에 불과한가?
- AI 모델을 기만과 다른 스트레스 요인을 명확히 구분할 수 있는 데이터로 학습시킬 수 있는가?
- 오탐 결과의 남용을 방지하기 위한 보호 장치는 어떻게 마련될 것인가?
- DCSA는 전체 방위 인력에 배포하기 전에 시스템을 어떻게 검증할 것인가?
핵심 기술 논쟁은 보다 정교한 센싱과 AI가 수십 년간 축적된 폴리그래프 연구가 제시한 근본적 한계를 극복할 수 있는가, 아니면 고해상도 지표로 불확실성을 가릴 뿐인가에 초점이 맞춰진다.
MIT Technology Review와 Superpower Daily는 2026년 9월 25일에 이번 예산 요청을 보도했으며, 의회가 아직 자금을 승인하지 않았고 프로그램의 과학적 기반이 논쟁 중이라고 전했다.
승인될 경우, 이 사업은 자동화된 신뢰도 평가 도구에 대한 대규모 투자를 의미하며, 펜타곤이 신원 조사, 지속적 모니터링 및 내부 위협 완화 방식을 근본적으로 바꾸는 계기가 될 수 있다.
폴리그래프+가 제시하는 비접촉식 센싱과 머신러닝 기반 신뢰도 점수는 기존 인간 검사관이 수행하던 절차를 자동화하려는 시도로 볼 수 있다. 그러나 이 접근법은 데이터 품질과 알고리즘 설계에 대한 근본적인 검증이 선행되지 않으면, 측정된 신호가 실제 기만을 반영한다는 전제 자체가 불안정해진다. 따라서 시스템이 제공하는 점수가 높은 경우에도 그 점수가 실제 위험을 정확히 반영하는지, 혹은 단순히 환경적 변동성이나 개인별 생리적 차이를 과대평가하는지에 대한 명확한 검증 절차가 필요하다. 이러한 검증 없이 바로 전 인력에 적용한다면, 점수 기반 의사결정이 오히려 조직 내 신뢰를 약화시킬 위험이 존재한다.
현재까지 제시된 정확도 범위가 80 %에서 94 %에 이른다고 주장되지만, 이는 제한된 실험 환경에서 도출된 통계일 가능성이 높다. 대규모 인원에 적용될 경우, 작은 오차 비율도 상당한 절대적인 오탐 사례를 발생시킨다. 오탐이 반복되면 무고한 직원이 보안 위험으로 잘못 분류되어 불필요한 조사나 징계 조치를 받게 되며, 이는 개인의 직업적 평판과 조직 문화에 부정적 파장을 일으킬 수 있다. 따라서 정확도 주장에 대한 통계적 신뢰구간과 실제 운영 환경에서의 재현성을 동시에 검증하는 단계가 반드시 포함되어야 한다.
센서 추가와 데이터 레이블링의 신뢰성은 프로그램의 핵심 논쟁점이다. 추가 센서가 실제로 탐지 정확도를 향상시키는가, 아니면 단순히 잡음이 많은 신호에 알고리즘적 가중치를 부여하는 수준에 머무는가를 판단하려면, 독립적인 실험 설계와 블라인드 테스트가 필요하다. 특히 AI 모델이 스트레스와 기만을 구분하도록 학습시키기 위해서는, 기만 상황과 비기만 상황을 명확히 구분한 라벨이 충분히 제공되어야 하며, 이러한 라벨링 과정 자체가 편향되지 않았는지 검증해야 한다. 라벨링 오류가 모델에 학습되면, 시스템은 오히려 잘못된 신호를 신뢰하게 되어 전체 정확도를 저하시킬 위험이 있다.
프로그램의 배포 전 검증 절차는 다단계 검증 체계를 포함해야 한다. 초기 파일럿 단계에서는 제한된 인원과 통제된 환경에서 센서 데이터와 AI 점수의 상관성을 평가하고, 그 결과를 바탕으로 알고리즘을 조정한다. 이후 점진적으로 적용 범위를 확대하면서, 각 단계마다 독립적인 외부 감시기관이 결과를 검토하고, 오탐 및 누락 사례에 대한 통계적 보고서를 제공해야 한다. 이러한 단계적 검증은 시스템이 실전에서 발생할 수 있는 다양한 변수—예를 들어, 신체적 상태 변화, 환경 소음, 문화적 차이—에 대한 내성을 확보하도록 돕는다.
오탐 결과의 남용을 방지하기 위한 보호 장치는 법적·윤리적 프레임워크와 연계되어야 한다. 구체적으로는 오탐이 발생했을 경우 재검증 절차와 이의 제기 메커니즘을 명시하고, 해당 직원이 불이익을 받지 않도록 보호하는 절차를 마련한다. 또한, 자동화된 판단에 의존하는 정도를 제한하고, 최종 결정은 인간 전문가가 검토하도록 하는 이중 검증 구조를 도입함으로써 기술적 오류가 조직적 차원에서 확대되는 것을 방지한다.
펜타곤이 이 프로그램을 승인하고 대규모로 도입한다면, 신원 조사와 내부 위협 감시 방식이 근본적으로 전환될 전망이다. 자동화된 신뢰도 평가 도구가 표준화되면, 기존의 인적 자원과 시간 소모가 큰 절차를 대체하거나 보완하게 되며, 이는 다른 국가나 기관에서도 유사한 시스템 도입을 촉진할 수 있다. 그러나 동시에 개인정보 보호, 절차적 정의, 자동화된 거짓말 탐지의 신뢰성 등에 대한 새로운 법적·윤리적 과제가 부각되며, 이러한 과제들을 해결하지 못하면 기술 도입 자체가 사회적 반발을 초래할 위험이 있다.
한국의 경우, 국방부와 과학기술정보통신부 등 관련 기관이 유사한 AI 기반 신원 검증 시스템을 도입한다면, 빠르고 비접촉식 평가가 가능해지는 동시에 개인정보 보호, 절차적 정의, 자동화된 거짓말 탐지의 신뢰성 등에 대한 새로운 법적·윤리적 과제가 부상할 것이다.
출처
- The Pentagon wants $30 million to build an AI-powered lie detectorMIT Technology Review · 2026년 9월 25일
- Pentagon Seeks $30.3 Million for AI Lie-Detection Program Despite Reliability ConcernsSuperpower Daily · 2026년 9월 25일



