Datadog MCP Server란, Code Execution으로 AI 에이전트 비용 줄이는 방법
한마디로
AI 에이전트가 로그, 메트릭, 트레이스를 오갈 때 대화창 대신 코드로 처리해서 토큰 비용 줄이고 정답률 높이는 기능이에요
한눈에
Datadog MCP Server는 AI 에이전트가 로그, 메트릭, 트레이스 같은 관측 데이터를 조회하도록 도구를 제공하는 서버입니다. 이번에 정식 출시된 Code Execution은 에이전트가 여러 API 호출 결과를 대화창에 일일이 담는 대신 샌드박스 코드로 병렬 처리, 조인, 필터링까지 끝내고 필요한 증거만 모델에 돌려주는 방식이에요. 그 결과 4개 모델 평균으로 입력 토큰 73.2%, 도구 호출 39.6%가 줄었고 정답률도 모든 모델에서 7.7에서 21.8퍼센트포인트 개선됐습니다.
AS-IS: 대화창에 다 담는 방식의 비용
기존 MCP 툴 방식에서는 에이전트가 조사를 한 걸음 뗄 때마다 모델과 주고받아야 했어요. 툴을 고르고, 응답을 확인하고, 다음에 뭘 호출할지 결정하고, 그 결과를 다시 대화창으로 끌고 오는 식이죠. 지연 시간 문제 하나를 조사할 때도 메트릭에서 시작해 트레이스로 옮겨가고 배포 구간을 비교한 뒤 수천 건의 로그를 몇 개 패턴으로 줄이는 식의 멀티시그널 조사가 흔한데, 이런 경우 모델은 툴 스키마와 원본 응답, 중간 단계 처리에 컨텍스트를 계속 소모하게 됩니다.
이번 발표: Code Execution의 처리 구조
Code Execution은 샌드박스 JavaScript 환경에서 동작하는 execute_code, search_datadog_sdk 두 개의 MCP 툴로 구성돼요. 에이전트는 이 환경 안에서 여러 Datadog API를 독립적으로 병렬 호출하고, 한 결과로 다음 쿼리를 만들고, 서로 다른 API 응답을 정규화해서 공통 필드로 조인하거나 대량 응답을 필터링, 집계한 뒤에야 대화창으로 결과를 넘길 수 있습니다. 예를 들어 같은 1시간 구간의 로그와 스팬에서 에러를 조회하는 경우, 코드가 두 쿼리를 병렬 실행하고 서비스별로 그룹핑해 조인한 다음 양쪽 결과셋에 모두 등장하는 서비스만 모델 컨텍스트로 넘기는 식이에요. API 오퍼레이션은 Datadog TypeScript 클라이언트 SDK를 기반으로 하기 때문에 생성된 코드가 다른 Datadog 연동과 같은 클라이언트, 요청 형태를 씁니다.
테스트 결과와 보안 구조
Datadog은 메트릭, 로그, 트레이스, Error Tracking, 멀티소스 조사를 포함한 25개 관측 작업을 GPT-5.6 Terra, GPT-5.6 Sol, Claude Sonnet 5, Claude Opus 4.8 네 모델로 각각 세 번씩 테스트했습니다. Core 툴셋 대비 Code Execution은 모든 모델에서 정답률이 7.7에서 21.8퍼센트포인트 올랐고, 네 모델 평균으로 입력 토큰 73.2%, 도구 호출 39.6%가 줄었어요. 보안 측면에서는 생성된 JavaScript 코드가 격리된 샌드박스에서 실행되며 호출자의 자격증명에는 접근하지 못합니다. 코드가 dd.* 메서드를 호출하면 신뢰된 MCP 서비스가 대신 요청을 처리해 기존 Datadog 권한과 Code Execution 정책을 검증하고 응답을 정제한 뒤 샌드박스로 돌려주는 구조라, 코드는 데이터를 다룰 뿐 자격증명은 한 번도 직접 취급하지 않습니다.
실무 적용 포인트
실무에서 Code Execution을 쓰려면 Datadog MCP Server를 AI 클라이언트에 연결하고 code-exec 툴셋을 활성화하면 됩니다. 이후 여러 종류의 관측 데이터를 상호 연관 지어야 하는 질문을 던지면 에이전트가 코드 실행으로 데이터를 모으고 연관 짓고 답변 근거를 함께 돌려줘요. 체크리스트로 보면 다음을 확인하면 좋습니다.
- 멀티시그널 조사(로그+트레이스+메트릭 교차)가 잦은 팀인가
- 기존 Core 툴셋 대비 토큰 비용, 정답률 개선치를 자체 워크로드로 검증했는가
- code-exec 툴셋 활성화와 권한 정책을 사전에 점검했는가
자주 묻는 질문
mcp 란 무엇인가요
MCP는 AI 에이전트가 외부 도구나 데이터 소스에 접근하도록 정의된 인터페이스 규격이에요. Datadog MCP Server는 이 규격을 통해 에이전트가 로그, 메트릭, 트레이스, 모니터, 대시보드 같은 Datadog 데이터를 조회하는 툴을 제공합니다.
ai 에이전트 활용 사례로 어떤 게 있나요
이번 사례는 관측 데이터를 조사하는 AI 에이전트가 여러 API 결과를 코드로 조인, 필터링해서 답변 정확도를 높인 경우예요. 예를 들어 배포 이후 에러율이 바뀐 서비스를 찾고 그와 함께 바뀐 트레이스 패턴을 보여달라는 식의 질문을 처리할 수 있습니다.
ai 에이전트 성능 비교는 어떻게 했나요
Datadog은 GPT-5.6 Terra, GPT-5.6 Sol, Claude Sonnet 5, Claude Opus 4.8 네 모델로 25개 관측 작업을 각각 세 번씩 테스트해 Core 툴셋과 Code Execution의 정답률, 토큰 사용량을 비교했습니다. 모든 모델에서 Code Execution이 정답률을 높이고 토큰과 도구 호출 수를 줄이는 결과가 나왔어요.
도입은 어떻게 하나요
Datadog MCP Server를 AI 클라이언트에 연결한 뒤 code-exec 툴셋을 활성화하면 됩니다. Datadog을 처음 쓰는 경우 14일 무료 체험으로 Code Execution을 테스트해볼 수 있어요.
에디터 노트
토큰과 도구 호출을 동시에 줄이면서 정답률까지 올렸다는 벤치마크는 AI 에이전트 아키텍처 설계에서 참고할 만한 구체적 사례예요. 다만 25개 작업, 4개 모델이라는 한정된 테스트 범위인 만큼 모든 관측 워크로드에 동일한 개선 폭이 재현될지는 각 팀이 자체 환경에서 검증해봐야 합니다.
참고 출처 | 원문 보기
태그
- Datadog MCP Server
- 데이터독 MCP 서버
- Code Execution
- 코드 실행 기능
- AI 에이전트
- AI 에이전트
- MCP
- 모델 컨텍스트 프로토콜
이 노트는 자동 검증을 거쳐 발행되었습니다. 오류 제보는 편집팀이 즉시 확인합니다.
관련 마테크
- Snowflake Observe MCP, CLI란, AI 에이전트가 텔레메트리 직접 조회하는 방법Snowflake의 Observe가 AI 에이전트용 MCP 서버와 CLI를 새로 내놔서 사람 없이도 운영 데이터를 직접 조회하고 대응하게 됐어요
- Segment CDP 사례로 보는 AI 에이전트 성능, 데이터 인프라가 좌우하는 이유AI 에이전트가 똑똑해도 마케팅, 고객지원, 영업 데이터가 흩어져 있으면 고객은 같은 얘기를 계속 반복해야 해요
- HubSpot AI 에이전트 개편, CRM 마케팅 자동화는 이렇게 바뀝니다HubSpot이 Breeze Assistant 중심으로 CRM 전체를 AI 에이전트 조합 방식으로 다시 짰어요
- Databricks Genie와 Amazon Quick 재고 보충 자동화 사례, 수요예측부터 발주까지 무인 파이프라인 구축법수요 급증을 예측하고 공급업체 선택과 발주까지 사람 개입 없이 처리하는 자동화 구조를 Databricks와 Amazon Quick으로 만든 사례예요