Agentic AI 평가지표, 완료율 대신 의사결정 정확도로 바꿔야 하는 이유
AI가 추천만 하던 시절엔 수락률로 충분했지만 이제 AI가 직접 결정하고 실행하니까 얼마나 자주 승인받았나 대신 그 결정이 실제로 맞았는지 사업과 고객에 어떤 영향을 줬는지를 봐야 한다는 이야기예요
The Brief가 FactStack이 되었습니다
트렌드 36건 | 카테고리 4 | 출처 16곳
2026년 8월 17일 - 8월 23일 한 주간 FactStack은 AI 트렌드 36건을 발행했습니다. 분야별로는 마케팅·AX 16건, 데이터 9건, 연구소/벤더 5건, 테크 프레스 6건입니다. 이번 주 가장 주목한 소식은 "Agentic AI 평가지표, 완료율 대신 의사결정 정확도로 바꿔야 하는 이유"입니다.
AI가 추천만 하던 시절엔 수락률로 충분했지만 이제 AI가 직접 결정하고 실행하니까 얼마나 자주 승인받았나 대신 그 결정이 실제로 맞았는지 사업과 고객에 어떤 영향을 줬는지를 봐야 한다는 이야기예요
이제 AI가 콘텐츠를 빨리 만드는 것보다 캠페인 도중에도 돈을 어디로 옮길지 실시간으로 결정해주는 게 더 큰 경쟁력이에요
Meta의 Robyn, Google의 Meridian 같은 오픈소스 마케팅 믹스 모델링 도구를 AI 에이전트에게 시키면 데이터 과학자 없이도 누구나 실행할 수 있게 됐어요
광고 예산을 실제로 집행하는 부분은 확률적으로 답이 매번 바뀌는 LLM이 아니라 정해진 규칙대로 움직이는 시스템에 맡겨야 안전하다는 이야기예요
챗GPT가 대화 중간에 스폰서 상품을 자연스럽게 보여주는 광고를 한국에서도 시작했고, Claude는 텍스트에 티 안 나는 워터마크를 심어 AI 작성 여부를 나중에 확인할 수 있게 됐어요
카테고리별, 발행순. 제목을 누르면 요약과 에디터 노트로 이동합니다.
이제 AI가 콘텐츠를 빨리 만드는 것보다 캠페인 도중에도 돈을 어디로 옮길지 실시간으로 결정해주는 게 더 큰 경쟁력이에요
인플루언서들이 이제 인스타그램 알고리즘 대신 챗GPT나 Claude 같은 AI 검색에 걸리도록 콘텐츠를 최적화하기 시작했어요
AI로 시간을 아끼는 게 목표가 아니라 그 시간을 뭔가 더 나은 일에 쓰는 게 진짜 목표라는 거예요
챗GPT가 대화 중간에 스폰서 상품을 자연스럽게 보여주는 광고를 한국에서도 시작했고, Claude는 텍스트에 티 안 나는 워터마크를 심어 AI 작성 여부를 나중에 확인할 수 있게 됐어요
직원 개개인이 만든 뛰어난 AI 프롬프트나 노하우가 슬랙과 개인 문서에 묻혀있는데 이걸 조직 전체가 나눠쓰게 만드는 방법을 알려주는 거예요
광고에 AI를 썼다고 무조건 다 표시하면 오히려 소비자가 표시 자체를 무시하게 된다는 게 IAB의 새 가이드라인 핵심이에요
OpenAI가 유럽에서 ChatGPT 광고를 시작하면서 메타처럼 벌금 맞고 나서가 아니라 처음부터 사용자 동의를 받는 방식을 택했어요
Gemini에게 같은 질문을 반복해도 매번 다른 업체를 추천하는 경우가 많아서 AI 검색 결과 하나만 믿고 마케팅 전략을 짜면 위험하다는 거예요
같은 작업인데 오픈웨이트 AI 모델은 14센트, 폐쇄형은 50달러가 나올 수 있는데 무조건 싼 쪽이 이득은 아니고 업무를 나눠 쓰는 게 핵심이에요
고객 데이터로 맞춤화할 때 고객이 예상하는지, 도움이 되는지, 불편해하지 않는지 세 가지만 체크하면 선을 넘었는지 알 수 있어요
CJ메조미디어가 자연어 질문만으로 광고 전략부터 운영, 분석까지 다 해주는 AI 플랫폼 애들리를 SaaS로 내놨어요
Discord가 게임 안에서 특정 행동을 완료하면 보상을 주는 광고 포맷을 내놓고, 노출 너머 실제 행동까지 추적해서 성과형 광고 사업을 키우려 하고 있어요
AI가 추천만 하던 시절엔 수락률로 충분했지만 이제 AI가 직접 결정하고 실행하니까 얼마나 자주 승인받았나 대신 그 결정이 실제로 맞았는지 사업과 고객에 어떤 영향을 줬는지를 봐야 한다는 이야기예요
각 부서가 자기 할 일은 다 해도 부서 사이 연결이 끊기면 고객은 회사가 나를 잊었다고 느끼게 돼요
Meta의 Robyn, Google의 Meridian 같은 오픈소스 마케팅 믹스 모델링 도구를 AI 에이전트에게 시키면 데이터 과학자 없이도 누구나 실행할 수 있게 됐어요
광고 예산을 실제로 집행하는 부분은 확률적으로 답이 매번 바뀌는 LLM이 아니라 정해진 규칙대로 움직이는 시스템에 맡겨야 안전하다는 이야기예요
리니어 TV가 안 되는 진짜 이유는 시청자가 사라져서가 아니라 소규모 에이전시가 감당하기엔 운영이 너무 복잡하고 비싸졌기 때문이에요
Nielsen이 스페인어 시청자, 동시 시청, 스트리밍 데이터 지연 문제를 손봐서 시청률 측정치를 더 정확하게 만들려는 거예요
ChatGPT는 써보게 만드는 힘이 세고 Gemini는 계속 쓰게 만드는 힘이 세고 Claude는 돈 내게 만드는 힘이 센 것으로 나타났어요
TV 켜자마자 보이는 홈화면 광고를 이제 여러 제조사에 한 번에 걸 수 있게 표준 규격이 나왔어요
챗봇을 앞세운 AI 비서는 중소기업 고객들이 오히려 거부감을 느껴서, 이제는 AI를 뒤에 숨기고 사람이 확인하는 방식이 대세가 되고 있어요
Amazon은 눈치도 못 채고 5개월간 Claude 프로젝트에 180만 달러를 썼는데, 개인 AI 에이전트는 모델을 잘 골라 쓰면 하루 6달러로도 돌아간다는 이야기예요
똑같은 GPU 클러스터인데 작업을 배치하는 순서만 바꿨더니 활용률이 최대 33%p, 우선순위 반영 산출량이 최대 105% 올라간 거예요
OpenAI가 기업 고객 데이터를 저장하지 않으면서도 여러 대화에 걸친 악용 패턴을 잡아내는 Private Safety Processing을 준비 중이에요
작은 초안 모델이 먼저 답을 예측하고 큰 모델이 한 번에 검증하는 방식으로 AI 응답 속도를 GPU에서 최대 3.18배, 온디바이스에서 최대 2.87배까지 끌어올렸어요
음성인식 AI가 실제 소리를 듣고 받아쓰는 게 아니라 어떤 벤치마크인지 눈치채고 정답을 외워서 쓰는 경우가 많다는 걸 밝혀낸 연구예요
OpenAI의 새 비전 모델 Sol이 객체 탐지와 계수는 크게 좋아졌지만 OCR과 데이터 추출은 오히려 이전 모델보다 못하고, 속도와 비용 면에서는 Gemini 3.5 Flash가 여전히 더 유리…
영국 냉동식품 마트 Iceland가 CCTV에 생성형 AI를 붙여서 도난이나 미결제 같은 수상한 행동을 실시간으로 잡아내 손실을 크게 줄였어요
미디어 스타트업 Every가 편집장의 30000건 교정 이력을 학습시켜 그의 편집 취향을 흉내내는 AI 에이전트를 만들었어요
코딩 몰라도 LLM 에이전트에게 시키면 터미널 화면 대신 진짜 앱처럼 보이는 개인용 도구를 만들 수 있게 됐어요
AI 프로젝트가 실패하는 진짜 이유는 최신 모델이 아니라 업계 도메인 지식을 얼마나 반영했는지에 달려 있다는 이야기예요