The Brief가 FactStack이 되었습니다

FactStack
AI 인사이트

AI 환각 검증 프로세스 만드는 법, 군 작전 취소 사례로 배우는 3단계

거버넌스/리스크

한마디로

AI 챗봇의 환각이 미군 무력 작전 직전까지 갔던 사건, 법률 특화 모델의 정답률 54.0%, 에이전트 재현성 격차 24.4포인트를 한자리에 놓고 봤어요. 공통점은 AI 산출물이 '공식 문서' 형식을 입는 순간 검증 대상에서 신뢰 대상으로 바뀐다는 점입니다. 마케팅 조직이 리포트와 인사이트를 결재 라인에 올릴 때 무엇을 바꿔야 하는지 정리했습니다.

한눈에

AI 환각의 진짜 위험은 오류율이 아니라 오류가 '정식 보고서' 형식을 입고 결재 라인을 타는 구조에 있습니다. 미군에서는 챗봇이 선박 화물 명세서를 잘못 읽은 결과가 공식 요약 형태로 지휘 계통에 유포돼 무력 작전 직전까지 갔고, 법률 특화 모델인 Astra for Law조차 Vals AI 벤치마크 정답률이 54.0%에 그칩니다. 여기에 에이전트 재현성 문제가 겹칩니다. AppWorld 벤치마크에서 GPT-4.1 기반 ReAct 에이전트의 평균 성공률(Mean@5)은 77.4%였지만 같은 작업을 5번 다 성공한 비율(Pass^5)은 53.0%였어요. 실무 대응은 모델 교체가 아니라 원본 소스 대조를 의무화하는 프로세스 설계, 그리고 AI 산출물에 출처와 불확실성 라벨을 강제하는 포맷 규칙입니다.

무슨 일이 일어나고 있나

올해 봄 미군 항공기가 이미 출동한 상태에서 작전이 마지막 순간에 취소됐습니다. CNN 보도를 인용한 TechCrunch에 따르면 중국 선박을 겨냥한 무력 작전의 근거 정보가 AI 챗봇이 만들어낸 환각이었어요. 시작은 특수작전사령부의 분석관 한 명이었습니다. 공개 출처 데이터와 기밀 신호정보를 종합하려고 챗봇에 질의했고, 챗봇이 선박의 화물 명세서를 잘못 식별했습니다. 이란과의 전쟁 중 유통된 이 보고서는 해당 선박이 핵무기 프로그램 부품을 싣고 있다고 주장했어요. 여기까지는 흔한 오류입니다. 문제는 다음 단계예요. 분석관은 같은 도구를 한 번 더 써서 그 잘못된 결과를 official-looking summary, 그러니까 공식 문서처럼 보이는 요약본으로 정리했고 이게 지휘 채널 전반에 유포됐습니다.

같은 주에 OpenAI는 법률 업무 전용 모델 Astra for Law를 공개했습니다. 2억 3천만 건 이상의 URL로 구성된 법률 검색 인덱스를 붙이고 미국 판례법, 법령, 규정, 법원 규칙, 행정 결정을 검색하게 만들었어요. CourtListener를 운영하는 Free Law Project와의 협업으로 미국 공표 선례 판례법의 99.9% 이상을 포함했다고 밝혔습니다. Vals AI의 Legal Research Bench 비공개 검증 세트 200개 질문에서, 양쪽 모두 최고 추론 강도로 돌렸을 때 웹 검색만 쓰는 GPT-6 Astra의 정답률 38.7% 대비 54.0%였습니다. 상대적으로 40% 개선인데, 뒤집으면 전문 인덱스와 전문 지침을 다 붙이고도 46%는 여전히 통과하지 못한다는 뜻입니다.

세 번째 조각은 에이전트의 재현성입니다. AppWorld 벤치마크에서 GPT-4.1 기반 ReAct 에이전트의 Mean@5는 77.4%였지만 Pass^5는 53.0%였어요. 24.4포인트의 '일관성 격차'입니다. 같은 작업을 다섯 번 돌리면 두 번 이상 다른 결과가 나온다는 뜻이죠. 연구팀이 Consistency Analyzer로 판단이 뒤집히기 쉬운 결정 지점을 찾아 consistency guideline을 주입하자 격차가 12.0포인트로 줄었고 Pass^5는 69.0%, Mean@5는 81.0%로 올랐습니다. 유사 작업에서도 Pass^5가 13.0포인트, 더 약한 모델인 gpt-oss-120b에서도 같은 작업 6.0포인트, 유사 작업 8.7포인트 개선이 나타났어요.

세 사건을 관통하는 건 같은 질문입니다. AI가 만든 출력물을 사람이 어느 시점에, 무슨 근거로 믿기 시작하는가.

왜 중요한가

환각률을 낮추는 기술 경로는 이미 여러 갈래로 가동 중입니다. RAG를 붙이고, 도메인 인덱스를 얹고, 추론 강도를 올립니다. Astra for Law는 그 모든 걸 했고 15.3%포인트를 올렸어요. 판례 관련 질문에서는 참조 판례를 24% 더 많이 찾아냈습니다. 개선 폭 자체는 의미가 있지만, 남은 46%가 사라지지 않는다는 사실이 프로세스 설계의 출발점이 돼야 합니다.

여기에 Pass^k 수치를 겹쳐보면 그림이 선명해집니다. 정답률 54.0%는 '한 번 물었을 때' 숫자예요. 같은 질문을 다섯 번 던지면 매번 같은 답이 나온다는 보장은 별개 문제입니다. AppWorld 사례에서 Mean@5 77.4%와 Pass^5 53.0%의 24.4포인트 차이가 바로 그 지점이고요. 임원 보고서에 들어갈 숫자를 뽑을 때 한 번 돌려서 나온 결과를 그대로 쓰는 관행이 왜 위험한지, 이 두 지표의 간극이 설명해줍니다.

미군 사례가 무서운 지점은 환각 그 자체가 아니라 두 번째 프롬프트입니다. 분석관은 오류를 검증한 게 아니라 오류를 포맷팅했어요. 챗봇이 뱉은 내용이 헤더와 요약 구조를 갖춘 문서가 되는 순간, 그걸 받아 든 사람에게는 '검토할 초안'이 아니라 '보고된 사실'로 보입니다. 국방부는 AI가 kill chain 속도를 높여 지휘관이 제때 대응하게 해준다고 설명해왔는데, TechCrunch 지적대로 AI를 매력적으로 만드는 바로 그 속도가 인간 감독이 부족한 상태에서 환각을 통과시키는 통로가 됩니다.

마케팅 조직도 구조가 똑같아요. AI가 뽑은 오디언스 인사이트나 캠페인 성과 해석을 임원 보고 슬라이드에 그대로 얹는 경우가 흔합니다. 결재 라인을 한 단계 올라갈 때마다 원본 데이터를 다시 여는 사람 수는 줄어듭니다. 3단계 위에서는 아무도 쿼리 결과나 리포트 원본을 열지 않아요. 슬라이드에 적힌 숫자만 읽습니다.

여기에 도구 쪽 변화가 겹칩니다. Anthropic은 챗봇인 Claude Chat과 에이전트형 도구 Claude Cowork를 수요일부터 하나로 합치고, 베타로 Claude Docs와 Claude Slides를 내놨습니다. Slides는 Claude 안에서 바로 만들고 편집해 PowerPoint나 PDF로 내려받을 수 있고, Docs는 여러 사람이 실시간 협업하는 동안 Claude가 초안을 쓰고 코멘트까지 답니다. 기존 독립 도구였던 Claude Design도 모든 대화창 안에서 쓸 수 있게 넓게 배포됩니다. HubSpot은 Unbound26 첫날 Breeze Assistant를 새로 디자인해, 원하는 결과만 말하면 필요한 전문 에이전트를 골라 캠페인 기획, 리포트, 제안서를 만들어주는 구조로 CRM을 다시 짰어요. 통화, 이메일, 미팅 내용을 자동 캡처해 Smart CRM에 동기화합니다.

즉 AI 출력을 '공식 문서 포맷'으로 바꾸는 작업이 이제 추가 프롬프트조차 필요 없는 기본 기능이 됐습니다. 미군 분석관이 두 번째 프롬프트로 했던 일을 도구가 알아서 해줍니다. 검증 지점 하나가 조용히 사라진 셈이에요.

이해관계, 역학

누가 이 흐름으로 이득을 보는지 보면 발표 타이밍과 형식이 읽힙니다.

OpenAI가 Astra for Law를 지금, 이 구성으로 내놓은 건 정교한 배치입니다. 법률은 오답 비용이 크지만 동시에 검증 노동의 단가도 높은 시장이에요. 54.0%짜리 도구라도 시니어 변호사가 검수하는 전제라면 주니어 리서치 시간을 대체하는 경제성이 성립합니다. 그래서 OpenAI는 모델만 판 게 아니라 인덱스(2억 3천만 URL), 지침, 프라이버시, 거버넌스 컨트롤, 그리고 26개 생태계 플러그인을 한 세트로 묶었습니다. Relativity, Clio, iManage, Thomson Reuters 같은 기존 워크플로 벤더에 꽂히는 순간, 로펌 입장에서 갈아타기 비용이 급격히 올라가요. Harvey와 Legora는 API 고객사로 들어왔고, Sullivan & Cromwell, Ropes & Gray, Cooley는 이미 자체 도구를 만들었습니다. 리걸테크 스타트업에는 양날인데, 유통은 얻지만 자기 차별점이던 검색 인덱스와 법률 프롬프트 레이어가 플랫폼에 흡수됩니다. 진짜 싸움은 기능이 아니라 '어느 인덱스가 법조계 기본값이 되느냐'예요. 기본값이 되면 정답률이 54%든 70%든 표준 자체가 그 도구의 오답 패턴을 물려받습니다.

Anthropic의 슈퍼앱 통합도 UX 개선 서사 아래 다른 계산이 깔려 있습니다. 챗과 에이전트를 한 창에 합치면 사용자는 '어느 도구를 열지' 고민하지 않지만, 동시에 '지금 내가 에이전트를 돌리고 있다'는 자각도 사라집니다. 에이전트형 작업은 여러 단계를 추론하고 도구를 호출하느라 단순 채팅보다 토큰을 훨씬 많이 씁니다. 청구 기준이 토큰인 이상, 라우팅 설계가 곧 매출 설계예요. '오늘 날씨 어때' 같은 질문에 에이전트 판단 로직이 먼저 걸리는지 아닌지에 따라 Pro와 Max 구독자의 체감 비용이 갈립니다. 롤아웃이 Pro와 Max부터 시작하고 Team과 Free가 나중인 순서도, 단가를 감당할 층에서 먼저 사용량 데이터를 모으겠다는 뜻으로 읽힙니다. 실무자가 통합 발표에서 먼저 확인할 건 Docs와 Slides의 협업 기능이 아니라 요금제별 사용량 제한이 어떻게 바뀌는지입니다.

HubSpot의 자동 캡처도 마찬가지입니다. 통화, 이메일, 미팅을 자동으로 CRM에 채워 넣으면 입력 노동은 줄지만, 데이터 원천이 사람의 판단에서 모델의 요약으로 바뀝니다. Context Home이 정보 공백을 찾아주고 Marketing Studio가 AEO 가시성 점수나 부진 세그먼트를 짚어주는 구조는, 진단 자체가 그 캡처 데이터 위에 올라탄다는 뜻이에요. 즉 벤더 입장에서는 고객사 데이터가 자기 플랫폼 안에서 생성, 해석, 실행되는 폐쇄 루프가 완성되고, 고객 입장에서는 캡처 정확도가 낮을 때 오류가 어느 단계에서 들어왔는지 추적하기 어려워집니다. ChatGPT Ads와 Microsoft Advertising 연동까지 붙으면 광고 리드부터 어트리뷰션까지 한 벤더 안에서 돌아요. 편리함과 검증 가능성이 정확히 반대 방향으로 갑니다.

공급 쪽 이해관계도 하나 더 있습니다. 뉴욕타임스 소송에서 공개된 92페이지 문서에서 Microsoft Applied Science 디렉터 Brent Hecht는 데이터 스크래핑을 '인류 역사상 최대 규모의 노동 절도'라 표현했고, 내부 문서는 자사 AI 콘텐츠 전략이 모델과 웹 전체 성능을 동시에 해치는 doom loop을 시작했다고 적었습니다. 최종 제품이 필수 공급자의 경제적 기반을 위협하는 건 대단히 이례적이라는 표현까지 문서에 담겼어요. 검색 referral 트래픽이 최대 60% 줄었을 수 있다는 추정도 포함됐습니다. Microsoft 대변인 Alex Haurek은 이 발언들이 한 직원의 개인 견해이고 법적 분석도 회사 입장도 아니라고 선을 그었고, Microsoft AI의 데이터 전략 GM Jordan Usdan은 별도 서면에서 Hecht의 역할이 비대칭적이고 미래지향적인 학술 관점을 가져오는 자리라고 설명했습니다. 회사가 어떻게 방어하든, 모델 입력이 되는 원본 콘텐츠 생태계가 약해지는 중이라면 출력을 대조할 기준점 자체도 같이 흐려집니다.

실무에 주는 함의

내일부터 바꿀 것들입니다.

첫째, AI 산출물에 출처 필드를 포맷 차원에서 강제하세요. 임원 보고에 들어가는 모든 AI 생성 수치와 인사이트에 '원본 소스, 조회 시각, 확인자' 세 항목을 슬라이드 템플릿이나 문서 템플릿에 미리 박아둡니다. 비워둔 채로는 결재가 안 올라가게요. 미군 사례에서 무너진 지점이 정확히 여기예요. 공식 문서 형식은 갖췄는데 출처 추적 경로가 없었습니다. Claude Slides나 HubSpot Breeze가 만든 문서에도 같은 규칙을 적용해야 합니다.

둘째, 같은 질문을 3회 이상 돌려 답이 흔들리는지 확인하세요. Pass^k 개념을 그대로 가져온 겁니다. AppWorld에서 Mean@5 77.4%와 Pass^5 53.0%의 차이가 24.4포인트였다는 건, 한 번 돌려 나온 결과를 그대로 쓰는 게 통계적으로 위험하다는 뜻이에요. 실무에서는 예산 배분, 세그먼트 정의, 경쟁사 분석처럼 되돌리기 어려운 판단의 근거일수록 반복 실행을 규칙으로 만듭니다. 답이 갈리면 그 지점이 바로 사람이 봐야 할 결정 지점이고요.

셋째, 결재 단계별 검증 '종류'를 나누세요. 실무자는 원본 대조, 팀장은 논리 정합성, 임원은 의사결정 판단입니다. 지금 대부분 조직은 위로 갈수록 검증이 줄어드는 구조인데, 이걸 위로 갈수록 검증 종류가 바뀌는 구조로 바꿔야 해요. 특히 대형 캠페인 중단이나 예산 재배분처럼 되돌리기 어려운 결정에는 원본 데이터 첨부를 필수로 겁니다.

넷째, 자주 쓰는 질문 30-50개로 자체 정답 세트를 만들고 분기마다 돌리세요. Astra for Law의 54.0%는 법률 도메인 공개 벤치마크 숫자입니다. 우리 회사 데이터로 우리 질문 유형을 던졌을 때 몇 %가 맞는지는 아무도 대신 재주지 않아요. 중요한 건 총점이 아니라 오답 유형입니다. 어떤 종류 질문에서 틀리는지 분류해두면 검증 인력을 그 구간에 몰아줄 수 있습니다. Consistency Analyzer 접근처럼 '판단이 뒤집히기 쉬운 지점'을 목록화하는 게 핵심이에요.

다섯째, CRM 자동 캡처는 첫 분기에 샘플링 감사를 병행하세요. HubSpot이 통화, 이메일, 미팅을 자동으로 CRM에 채워 넣는 구조에서 캡처 정확도가 낮으면 그 위에서 판단하는 에이전트 결론도 같이 틀어집니다. 주 단위로 무작위 20건을 뽑아 원본 녹취나 메일과 대조하는 정도면 충분합니다.

여섯째, 유입 채널 구성을 다시 계산하세요. referral 트래픽 60% 감소 추정이 현실화하는 시나리오에서 검색 단일 의존은 위험합니다. 커뮤니티, 뉴스레터, 직접 방문 비중을 늘리는 작업과 SEO 예산 중 얼마를 AI 검색 노출 최적화로 옮길지를 이번 분기 안에 결론 내는 게 낫습니다. HubSpot Marketing Studio가 AEO 가시성 점수를 CRM 안에서 보여주기 시작한 것도 이 수요를 읽은 결과예요.

리스크, 반대 관점

검증 프로세스를 강화하면 AI 도입 속도가 느려집니다. 이게 가장 흔한 반론이고 부분적으로 맞아요. GovAI 연구원이자 미 육군 장교 출신 Jake Steckler는 이 사건이 AI를 피할 이유가 아니라 안전장치를 더할 근거가 돼야 한다고 말했습니다. 도구는 적절한 맥락과 안전장치가 있으면 유용하지만, 도입 속도를 다른 모든 것보다 우선하면 결국 사고가 나고 구성원이 시스템을 불신하게 돼서 오히려 도입이 느려진다는 지적이에요. 그는 특히 타깃팅, 정보 분석, 작전 기획처럼 무력 사용으로 이어질 수 있는 결정에서는 LLM의 불확실성을 이해하는 게 결정적이라고 했습니다. 검증은 속도의 반대말이 아니라 지속 가능한 속도의 조건입니다.

반대 시나리오도 봐야 합니다. capability overhang을 다룬 글의 지적처럼, 현재 모델 능력이 이미 충분한데 사람들이 못 쓰고 있는 게 진짜 병목일 수 있어요. GPT-6 Astra가 1977년 텍스트 게임 Zork를 3D 액션 게임으로 만든 사례, Fable 5.1이 도면 없이 영상 십여 개와 재단 사진, 도서 목록 두 건만으로 움베르토 에코의 밀라노 서재를 3D로 재구성한 사례가 나옵니다. 책등을 프레임 단위로 읽고 방 구조를 추론해 27,000개 선반 자리에 식별 가능한 5,000여 권을 배치했어요. 눈여겨볼 건 화려함이 아니라 라벨링입니다. 각 책을 확실(certain), 추정(guess), 미상(unknown)으로 표시하고 카메라가 닿지 않은 책장은 안개로 그렸습니다. 불확실성을 출력물 안에 명시하는 방식이 검증 비용을 극적으로 낮춥니다. 우리 리포트에도 이 세 라벨을 붙일 수 있는지가 실질적 질문이에요. 미군 보고서에 '추정'이라는 표시 하나만 있었어도 이야기가 달랐을 겁니다.

다만 capability overhang 담론 자체는 과대평가하기 쉽습니다. 새 도구가 나올 때마다 반복되는 서사고, 조직에서 실제로 막히는 건 개인의 취향이나 주도성 부족보다 데이터 접근 권한, 승인 프로세스, 실패를 허용하지 않는 문화인 경우가 훨씬 많아요. Zork나 에코의 서재 같은 시연은 반복 가능한 워크플로로 바뀌기 전까지 실무 자산이 아닙니다. 그 중간 단계 설계가 여전히 병목입니다.

일관성 가이드라인 접근에도 한계가 있습니다. 격차를 24.4포인트에서 12.0포인트로 줄인 건 인상적이지만, 결정 지점을 찾아 규칙을 만드는 과정 자체가 도메인마다 새로 반복해야 하는 수작업이에요. 완전 자동화된 해법이 아니라는 뜻이고, 실무에서는 이 진단 프로세스를 어떻게 파이프라인으로 만들지가 다음 과제로 남습니다. 절반으로 줄여도 12.0포인트는 남는다는 점도 잊으면 안 되고요.

마지막으로 실무자가 놓치기 쉬운 함정 하나. 벤치마크 점수 개선을 검증 면제의 근거로 삼는 습관입니다. 38.7%에서 54.0%로 올랐다는 발표를 보고 '이제 믿을 만하다'고 판단하는 순간, 오히려 검증 강도가 떨어져 실제 사고 확률이 올라갑니다. 정확도가 올라갈수록 사람은 덜 의심하고, 남은 오류는 더 조용히 통과합니다. 미군 분석관도 챗봇이 그동안 대체로 잘 맞았기 때문에 그날도 믿었을 겁니다. 정확도가 높아질수록 검증 프로세스를 느슨하게가 아니라 더 촘촘하게 설계해야 하는 역설이 여기 있습니다.

자주 묻는 질문

AI 환각이란 무엇인가요

AI 모델이 실제로 존재하지 않는 정보를 사실처럼 만들어내는 현상입니다. 미군 사례에서는 챗봇이 선박의 화물 명세서를 잘못 식별해 핵무기 프로그램 부품을 싣고 있다는 허위 정보를 만들었어요. RAG나 전문 인덱스를 붙여 확률을 낮출 수는 있지만 0으로 만들 방법은 현재 없습니다.

AI 환각을 줄이는 방법이 있나요

도메인 특화 인덱스와 지침을 붙이는 게 가장 검증된 경로입니다. Astra for Law는 2억 3천만 건 이상 URL의 법률 검색 인덱스를 붙여 Vals AI 벤치마크 정답률을 38.7%에서 54.0%로 올렸어요. 다만 46%는 여전히 통과하지 못하기 때문에 기술 개선과 함께 원본 소스 대조를 의무화하는 프로세스가 반드시 병행돼야 합니다.

AI 검증 프로세스는 어떻게 설계하나요

출처 표기 강제, 반복 실행 확인, 결재 단계별 검증 책임 분리 세 가지가 기본입니다. AI 산출물에 원본 소스와 조회 시각, 확인자를 포맷으로 붙이고, 중요한 질문은 3회 이상 돌려 답이 흔들리는지 봅니다. 실무자는 원본 대조, 팀장은 논리 정합성을 맡고, 자주 쓰는 질문 30-50개로 정답 세트를 만들어 분기마다 오답 유형을 확인하세요.

AI 에이전트 성능 비교는 무엇을 기준으로 하나요

평균 성공률만 보면 안 됩니다. AppWorld 벤치마크에서 GPT-4.1 기반 ReAct 에이전트는 Mean@5가 77.4%였지만 5회 모두 성공한 Pass^5는 53.0%로 24.4포인트 차이가 났어요. 금융 거래 대사나 계약서 검토처럼 실패가 치명적인 업무일수록 Pass^k 같은 재현성 지표를 함께 봐야 합니다.

AI 에이전트 도입 시 비용은 얼마나 늘어나나요

구체 단가는 공개되지 않았습니다. 다만 방향은 분명한데, 에이전트형 작업은 여러 단계를 추론하고 도구를 호출하느라 단순 채팅보다 토큰을 훨씬 많이 씁니다. Anthropic이 Claude Chat과 Cowork를 통합하면서 간단한 질문에도 에이전트 로직이 걸리면 체감 비용이 오를 수 있으니, Pro와 Max 등 요금제별 사용량 제한이 어떻게 바뀌는지를 먼저 확인하는 게 좋습니다.

참고 출처 | 원문 보기

태그

공유

관련 AI 인사이트