Google DeepMind
Gemini agentic video understanding, 영상 분석 비용 66% 절감
한마디로
Gemini가 영상을 처음부터 끝까지 다 보는 대신 필요한 장면만 골라서 보는 방식으로 바꿔서 비용과 정확도를 동시에 잡았어요
무슨 내용인가
Google DeepMind가 Gemini 3.7 Flash, 3.6 Flash, 3.5 Flash-Lite 세 모델에 agentic video understanding 기능을 새로 도입했습니다. 기존에는 초당 1프레임(기본값) 고정 속도로 영상을 처리했는데, 이 방식 대신 모델이 스스로 목표에 맞춰 어느 구간을 어떤 속도로, 프레임인지 오디오인지 자막인지 어떤 방식으로 볼지 판단하는 agentic loop 구조를 씁니다. 표준 벤치마크 기준으로 분석 비용은 최대 66%, 토큰 소비량은 최대 88% 줄었고 정확도는 최대 7% 올랐다고 하는데요, 특히 10분짜리 사용법 영상부터 90분 강의, 몇 시간짜리 녹화본까지 긴 영상에서 효과가 크게 나타났습니다. Google AI Studio와 Gemini Enterprise Agent Platform에서 Gemini API로 오늘부터 쓸 수 있고, API 설정에서 processing을
에디터 노트 | FactStack
초당 1프레임 고정 방식이 그동안 영상 AI 비용의 발목을 잡았던 걸 생각하면, 모델이 스스로 어디를 볼지 판단하게 만든 이번 변화는 방향 자체는 맞습니다. 다만 비용 66%, 토큰 88% 절감 수치는 표준 벤치마크 기준이라 실제 업무 영상, 특히 자막 없고 화질 낮은 CCTV나 사용자 생성 영상에서는 그 수준이 나오기 어려울 가능성이 큽니다. 실무 관점에서는 90분 강의나 몇 시간짜리 녹화본처럼 긴 영상을 다루는 미디어팀, 이커머스 상품 영상 QA팀이 먼저 파일럿을 돌려서 자사 콘텐츠 유형별 실제 절감률을 검증하는 게 순서고, 에이전트가 스킵한 구간에 중요한 정보가 있었는지 확인하는 리뷰 프로세스도 같이 설계해야 정확도 향상 효과를 신뢰할 수 있습니다.
실무 시사점
긴 영상 콘텐츠를 다루는 마케팅, 미디어 업무에서 영상 검색이나 이상 탐지, 특정 장면 자동 편집 같은 작업의 처리 비용과 속도를 크게 낮출 수 있음을 시사합니다
태그
용어 풀이
- Gemini
- Google이 만든 멀티모달 AI 모델 시리즈예요
- agentic video understanding
- AI가 스스로 영상에서 필요한 구간과 방식을 골라 분석하는 새 기능이에요
- Google DeepMind
- Google의 AI 연구개발 조직이에요
- AI 영상 분석
- AI가 영상 속 장면, 소리, 자막을 이해하고 처리하는 작업이에요
공유
이 주의 다른 소식 - 2026년 8월 31일 - 9월 6일 트렌드 32건주간 라운드업 보기 →