Google DeepMind
Gemini 3.8 TTS 출시, 음성 2000개와 보이스 복제 지원
한마디로
구글이 30초 음성 샘플만으로 목소리를 복제하고 100개 넘는 언어로 캐릭터 목소리까지 새로 만들 수 있는 새 음성 생성 AI 모델 두 종을 내놨어요
무슨 내용인가
구글 딥마인드가 Gemini 3.8 Flash TTS와 Gemini 3.8 Flash-Lite TTS를 공개했습니다. Flash TTS는 자연어 프롬프트로 완전히 새로운 캐릭터 목소리를 만들고 연기 지시, 억양, 대화 끼어들기까지 세밀하게 조정할 수 있는 모델이고요, Flash-Lite TTS는 대량 더빙이나 음성 에이전트처럼 비용 효율이 중요한 대규모 작업에 최적화됐습니다. 30개였던 기본 음성 라이브러리가 2000개 이상으로 확장됐고, 30초 음성 샘플로 자신의 목소리를 복제하는 기능도 생겼는데요, 동의 확인 절차와 SynthID 워터마킹, C2PA 인증서로 보호 장치를 뒀습니다. Hume AI의 Voice Design Benchmark에서 종합 1위(71.4점), 억양 모델링 부문 1위(60.8점)를 기록했고, Figma, HeyGen, Wondercraft 등과 파트너십을 맺어 더빙과 로컬라이제이션, 음성 에이전트 구축을 지원합니다.
에디터 노트 | FactStack
음성 라이브러리가 30개에서 2000개로 늘어난 것보다 실무적으로 더 큰 변화는 30초 샘플로 목소리를 복제한다는 부분입니다. 다국어 더빙과 음성 에이전트를 각각 성우 섭외해서 만들던 과정을 한 번의 녹음으로 대체할 수 있으니, 로컬라이제이션 비용 구조 자체가 바뀔 거예요. 다만 동의 절차와 SynthID, C2PA 인증서를 강조하는 건 역설적으로 이 기술이 얼마나 쉽게 오남용될 수 있는지를 구글 스스로 인정한 셈이고, 국내에서 브랜드 보이스나 임직원 목소리를 복제해 쓰려면 초상권과 유사한 음성권 계약 조항부터 재정비해야 실무 리스크를 줄일 수 있습니다.
실무 시사점
브랜드 보이스를 저비용으로 다국어 콘텐츠와 광고, 음성 에이전트에 일관되게 적용할 수 있는 실무 도구가 될 수 있습니다
태그
용어 풀이
- Gemini
- 구글이 만든 AI 모델 시리즈 이름
- TTS
- 글자를 음성으로 바꿔주는 기술(text-to-speech)
- Google DeepMind
- 구글의 AI 연구 개발 조직
- Voice Cloning
- 짧은 음성 샘플로 특정 사람의 목소리를 복제해 재현하는 기술
공유