Anthropic 멀티에이전트 실험, 단일 AI가 4개보다 정확한 이유
AI 여러 개를 모아 토론시키면 오히려 정답률이 떨어지는데 한 명이 모든 증거를 갖고 있을 때가 더 정확하더라는 실험 결과예요
The Brief가 FactStack이 되었습니다
트렌드 38건 | 카테고리 4 | 출처 15곳
이번 주는 AI 모델 성능 자체보다 그 모델을 얼마나 잘 맥락화하고 통제하느냐가 격차를 가르는 흐름이 뚜렷했습니다. 쏘카, 삼쩜삼의 AI 도입 사례와 OpenAI의 기업 활용 리포트는 같은 도구를 써도 노하우와 데이터 정리 수준에 따라 성과 격차가 8배까지 벌어짐을 보여줬고, GLM-5.3이 5분의 1 비용으로 벤치마크 1위에 오르며 저비용 오픈모델의 실력도 함께 부각됐습니다. 동시에 Anthropic의 멀티에이전트 실험과 엔터프라이즈 에이전트의 연결 복잡성 논의는 에이전트 수를 늘리는 것보다 통제 구조 설계가 관건임을 재확인시켰습니다. 마케팅, 데이터 실무자라면 새 모델 도입 경쟁보다 자사 데이터와 거버넌스 체계를 먼저 정비하는 편이 실질적인 성과로 이어질 것입니다.
AI 여러 개를 모아 토론시키면 오히려 정답률이 떨어지는데 한 명이 모든 증거를 갖고 있을 때가 더 정확하더라는 실험 결과예요
AI를 가장 많이 쓰는 사람들이 오히려 AI 콘텐츠를 제일 싫어한다는 조사 결과가 나왔어요
AI 에이전트가 사람 없이 광고 캠페인을 처음부터 끝까지 알아서 세팅하고 최적화했더니 비용은 크게 줄고 노출은 늘었다는 실험 얘기예요
같은 AI 모델을 써도 회사 데이터와 업무 맥락을 얼마나 잘 연결해주느냐에 따라 기업 간 AI 활용 격차가 반년 만에 3배로 벌어졌다는 거예요
AI 에이전트 하나하나가 위험한 게 아니라 여러 에이전트가 서로 얼기설기 연결되면서 아무도 통제하지 못하는 시스템이 되는 게 진짜 문제예요
카테고리별, 발행순. 제목을 누르면 요약과 에디터 노트로 이동합니다.
AI 도구는 다 똑같이 좋아졌으니, 진짜 격차는 회사가 쌓아온 노하우를 AI가 이해할 수 있게 정리해뒀는지에서 갈린다는 이야기예요
OpenAI가 소상공인보다 대기업 광고주를 먼저 잡으려고 광고 플랫폼과 조직을 키우고 있어요
20만 원 캐시백으로 카드는 만들게 해도 계속 쓰게 만들지는 못해서 카드 7장 중 1장이 서랍 속에서 잠자고 있어요
모든 채널을 다 테스트하지 말고 돈이 걸린 불확실한 질문에만 테스트 역량을 집중하고, 결과가 나오기 전에 이미 뭘 할지 정해두라는 이야기예요
키워드 하나를 넣으면 95%까지 완성된 글이 나오도록, 리서치부터 편집까지 담당 에이전트를 나눠 만드는 방법을 실무자가 직접 공유한 거예요
같은 AI 모델을 써도 회사 데이터와 업무 맥락을 얼마나 잘 연결해주느냐에 따라 기업 간 AI 활용 격차가 반년 만에 3배로 벌어졌다는 거예요
USA Today가 사람 대신 AI 봇도 잘 읽고 인용할 수 있도록 웹페이지를 마크다운 형태 등으로 다시 짜고 있어요
AI가 마케팅에서 잘못된 결정을 내렸을 때, 문제가 규칙인지 통제인지 실행인지 권한인지 구분하지 못하면 똑같은 실수를 반복하게 된다는 이야기예요
X가 콘텐츠 품질 기반의 새 크리에이터 보상 프로그램을 9월부터 시작하지만, 브랜드 안전성 우려 때문에 광고주와 크리에이터 마음을 돌리기는 쉽지 않아 보여요
xAI의 새 모델 Grok 4.6이 Claude나 GPT급 성능을 훨씬 싼 가격에 내면서 UX/UI 디자인 도구로도 꽤 쓸만해졌다는 이야기예요
맥도날드 로열티 프로그램과 매디슨스퀘어가든의 얼굴인식 시스템처럼 평범한 일상 행동이 본인도 모르는 사이 방대하고 부정확한 프로필로 쌓이고 있다는 이야기예요
Salesforce 데이터를 Claude 안에서 바로 다루게 되면서 Salesforce 화면 자체가 필요 없어질 수도 있어요
인플루언서 섭외 비용을 얼마로 매겨야 할지 브랜드도 크리에이터도 확실한 기준이 없어서 다들 손해 보고 있다는 이야기예요
고객한테 점수 매겨달라고 묻지 말고 리뷰나 소셜미디어에서 자연스럽게 흘러나오는 말을 들어야 진짜 브랜드 인식을 알 수 있다는 얘기예요
AI 덕분에 하루 만에 앱을 만들 수 있게 됐지만 만들기 전에 검증하던 방식만 낡았을 뿐 고객에게서 배우는 전략 자체는 여전히 중요하다는 이야기예요
목표치의 23%만 달성했는데도 시장에 성장 스토리로 받아들여지게 만든 쏘카, 그린카, 투루카의 커뮤니케이션 설계를 마케터 시선으로 뜯어본 글이에요
AI 에이전트가 사람 없이 광고 캠페인을 처음부터 끝까지 알아서 세팅하고 최적화했더니 비용은 크게 줄고 노출은 늘었다는 실험 얘기예요
마케팅팀, 제품팀, 디자이너가 따로 쓰던 시스템을 하나로 묶어서 AI가 브랜드에 맞는 광고 소재를 대량으로 새로 만들어내는 거예요
공항 게이트와 호텔방 화면으로 매달 5,100만명에게 광고를 보여주는 Reach TV 이야기예요
매장 보안 카메라가 도난을 사후에 기록하는 대신 AI로 실시간 이상 행동을 잡아내는 방향으로 바뀌고 있는데, 사람을 식별하는 단계로 가면 프라이버시 문제가 커지는 거예요
사람 대신 AI 에이전트가 알아서 테스트를 만들고 실행하고 분석했더니 7전 7승을 기록했어요
AI 여러 개를 모아 토론시키면 오히려 정답률이 떨어지는데 한 명이 모든 증거를 갖고 있을 때가 더 정확하더라는 실험 결과예요
OpenAI가 AWS의 코딩 도구 Kiro에 새 GPT 5.6 모델을 넣어서 같은 작업을 훨씬 싼 비용으로 더 정확하게 끝내게 만들었어요
IBM이 도구를 직접 쓰고 코드도 실행할 줄 아는 3B, 8B, 30B 크기의 오픈소스 추론 AI 모델 3종을 내놨어요
구글이 잡음과 사투리까지 알아듣고 필러 단어를 지워주는 새 음성인식 모델을 내놨는데 오류율이 크게 낮아졌어요
구글이 영상을 이어 붙이고 시작과 끝 장면을 지정해서 만드는 새 AI 영상 생성 도구를 개발자에게 공개했어요
ChatGPT는 답변을 더 매끄럽고 논리적으로 만들어주고 비판적 사고 훈련은 더 독창적인 아이디어를 떠올리게 해줘서 둘을 같이 쓰면 효과가 가장 컸다는 실험 결과예요
음성인식 성능을 재는 기준표에 인도 억양과 힌디어 데이터를 넣어서 특정 지역이나 목소리에서 얼마나 더 틀리는지 드러낸 거예요
AI 모델에게 지침과 도구를 주고 스스로 검색하고 코드 짜고 이메일 보내게 반복시키는 소프트웨어 환경이 바로 에이전트 하네스예요
오픈 웨이트 모델 GLM 5.3이 28개 실무 과제를 전부 통과하면서 gpt 5.5보다 5분의 1 저렴한 비용으로 1위를 차지했어요
AI가 짠 코드를 다른 AI가 검토하는 일이 급증하고 있는데, 실제로 얼마나 많이 일어나는지 대규모 데이터로 확인한 연구예요
AI가 코드를 대신 짜주면 편하긴 한데, 정작 초보 개발자가 실력을 키우는 데 필요한 시행착오 과정을 건너뛰게 만들어서 오히려 실력이 안 느는 역설이 생겨요
AI 에이전트 하나하나가 위험한 게 아니라 여러 에이전트가 서로 얼기설기 연결되면서 아무도 통제하지 못하는 시스템이 되는 게 진짜 문제예요
Meta에서 AI 에이전트가 신입 개발자 여러 명 몫을 한두 명으로 줄이는 걸 직접 본 임원이 회사를 나와 일자리 문제를 다루는 비영리단체를 차렸어요
Nvidia와 Stripe 같은 대형 테크 기업들이 공짜로 공개된 오픈웨이트 AI 모델 플랫폼을 조 단위 금액에 사들이면서 AI 생태계 판도가 바뀌고 있어요
LLM이 예전에 틀렸다고 밝혀진 가정을 계속 믿고 추론을 이어가는 문제를, 사실과 규칙을 데이터베이스처럼 관리하는 Datalog 엔진으로 해결한 사례예요