Google · blog.google · 2026-08-26

Gemini 3.5 Transcribe — 지능형 음성 전사 모델

Google이 공개한 최신 speech-to-text 모델. 스트리밍 4.0% / 비스트리밍 2.6% WER로 Artificial Analysis 리더보드에 진입. 85개 이상 언어, 두 API(Live / Interactions) 이원 구조. Rambler·Antigravity·macOS Gemini 앱·Chrome(예정)에 이미 탑재.


읽기 전에

이 글이 답하는 핵심 질문 1개

Google의 새 STT 모델 Gemini 3.5 Transcribe는 기존 Chirp 3 대비 무엇이 달라졌고, 개발자·기업·일반 사용자 각 층위에서 지금 무엇을 할 수 있는가?

멘탈 모델 3줄

선행 개념(모르면 막히는 것만)

권장 읽기 순서(8분)

  1. Executive Summary → 숫자(WER)와 배포 표면 먼저.
  2. 완역 §Get more precise… → 6가지 능력의 실제 청구서.
  3. 완역 §Experience smart transcription → 이미 붙어 있는 5개 표면(Gboard·AI Studio·Antigravity·macOS·Chrome).
  4. 팩트체크 → 어느 주장이 독립 검증됐고 어느 것은 Google 자체 측정인지.

읽고 확인할 질문 3개

  1. 스트리밍 vs 비스트리밍 WER 숫자 차이는 얼마이고, 왜 그 방향(스트리밍이 더 나쁨)이 자연스러운가?
  2. Chirp 3 → 3.5 Transcribe에서 "지연이 70% 줄었다"의 근거 지표는 무엇인가?
  3. 화자 3명 초과 분리 기능의 정확한 지위는? ("지원됨"인가 "실험적"인가)

Executive Summary

이 모델이 하는 일 — 한 문단

Gemini 3.5 Transcribe는 원시 오디오를 곧바로 정리된 형태의 텍스트로 바꾸는 speech-to-text 모델이다. 잡음·전문 용어·비유창성(disfluency) 정리에서 취약했던 기존 STT와 달리, 자기 정정·필러 제거·자동 포맷을 모델 내부에서 수행한다. Google은 이를 두 개의 API 트랙(gemini-3.5-transcribe-live 실시간 스트리밍, gemini-3.5-transcribe 사전 녹음)으로 노출하며, Gemini API·AI Studio·Antigravity·Gemini Enterprise Agent Platform에서 public preview로 사용 가능하다.

Gemini 3.5 Transcribe 로고 (파란 배경 위 텍스트와 Gemini 스파크)
원문 히어로 이미지 — "Gemini 3.5 Transcribe" 브랜딩 (Google Blog, 2026-08-26).

주요 주장 전수

4.0% / 2.6%

Artificial Analysis 측정 평균 WER. 스트리밍 4.0%, 비스트리밍 2.6%. Google 발표 & AA 리더보드(#5).

85+

자동 감지·전사되는 언어 수. 지역 억양·방언 처리 포함.

≤3명

사전 녹음 화자 분리 정확도 담보 범위. 3명 초과는 실험적.

−70%

Chirp 3 대비 "최종 전사까지 걸리는 시간" 개선(스트리밍). Artificial Analysis 측정.

5.50% / 5.04%

FLEURS 다국어 벤치마크 상위 언어군 WER. 스트리밍/비스트리밍 각각. Chirp 3 대비 개선.

7사

초기 파트너 개발자 플랫폼: Agora · Fishjam · LangChain · LiveKit · Pipecat · Vercel · Vision Agents.

배포 표면(이미 붙어 있는 것)

FLEURS 결과 그래프

FLEURS 벤치마크 스트리밍 음성 인식 정확도 그래프
FLEURS 상위 언어군 평균 WER — 스트리밍 5.50% / 비스트리밍 5.04%. Chirp 3 대비 개선(Google 자체 측정, 원문 그래프).

신뢰도 등급 및 팩트체크 요약

B+

일관·명확 / 자체 벤치 위주. 핵심 숫자(WER 4.0%/2.6%)는 Artificial Analysis라는 독립 리더보드가 확인. FLEURS 5.50%/5.04%와 "지연 70% 개선"은 Google 자체 측정(재현 방법론 미공개). 배포 표면·파트너 목록·API 엔드포인트는 문서에서 즉시 검증 가능. 미래형 주장("Chrome 곧 지원", "3+화자 실험적")은 재검증 필요.


팩트체크

종합 판정

Grade: B+ — 마케팅 자료로 통상 기대 이상. 3.5 Transcribe의 WER 두 숫자는 Google이 지목한 Artificial Analysis 리더보드에서 실제 확인되며, 발표 다음 날 다수 매체(9to5Google · GIGAZINE · BusinessToday · 24/7 Wall St. · Dataconomy)가 같은 팩트를 반복 인용했다. 반면 "70% 지연 개선", "FLEURS 5.50/5.04%"는 Google 자체 측정으로 독립 재현이 아직 없다. 미래형 표현(Chrome 예정, 3+화자 experimental)은 현재 사실이 아니다.

주장별 판정

WER 4.0% (스트리밍) / 2.6% (비스트리밍) — Artificial Analysis 측정.

독립 확인. 24/7 Wall St.는 "Gemini 3.5 Transcribe가 AA-WER에서 2.6%로 #5 진입"을 명시. 9to5Google 및 GIGAZINE도 같은 숫자 인용.

🟡
Chirp 3 대비 "최종 전사까지의 시간이 70% 개선".

부분사실. Google이 스트리밍 지연을 크게 줄였다는 방향성은 AA 리더보드의 "0.40s after speech end" 지표와 부합하지만, 70% 수치의 baseline·측정 방식은 원문 어느 곳에서도 정의되지 않았고 독립 재현이 없다. Chirp 3은 실제로 Vertex AI에서 문서화된 예전 세대 모델이므로 비교 대상 자체는 진짜다.

🟡
FLEURS: 스트리밍 5.50% / 비스트리밍 5.04% WER (상위 언어군, Chirp 3 초과).

부분사실 — Google 자체 측정만 존재. FLEURS는 Google Research가 제안한 공개 다국어 벤치마크로 실체는 있으나, "top languages and locales" 세트의 구체 정의가 원문에 없어 3자 재현 불가.

85개 이상 언어 자동 감지·전사.

사실. Google DeepMind의 Gemini Audio 페이지가 같은 숫자를 명시. BusinessToday·Dataconomy 등도 반복 인용.

화자 분리 3명까지 안정 지원, 3명 초과는 실험적.

사실. 원문이 스스로 "3+ speakers is experimental"로 자격을 낮춰 표시한 부분. 마케팅으로 부풀리지 않은 몇 안 되는 지점.

원문 §Get more precise… 문단 6, "Multi-speaker identification".
Rambler(Android Gboard), macOS Gemini 앱, Antigravity, AI Studio, Enterprise Agent Platform에 이미 탑재.

사실. 9to5Google이 "Gboard Rambler를 powers한다"를 헤드라인으로 확인. Google Antigravity 제품 페이지도 존재.

⚠️
Chrome에서 "곧" 어떤 웹 필드에서든 talk-to-type.

불확실 — 로드맵 문구. 9to5Google도 "coming to Chrome"으로 미래형 인용. 발표일 기준 미출시. 재검증 시점: Chrome 릴리즈 노트 확인 필요.

파트너 개발자 플랫폼 7사 (Agora·Fishjam·LangChain·LiveKit·Pipecat·Vercel·Vision Agents).

사실. 각사 문서에 Gemini Live 통합 페이지 실존.

⚠️
Rambler on Android은 Pixel 11-series에서 동작 (원문엔 없음, 9to5Google 부가 보도).

불확실 — 원문에 기기 명시 없음. 서드파티 매체가 추가한 정보라 Google 공식 지원 매트릭스로 재확인 필요.

검증 노트


원본 (완역)

지능형 전사, Gemini 3.5 Transcribe

정확하고 지능적인 실시간 전사를 위해 설계된 최신 speech-to-text 모델.

오늘, Google은 지능형 음성 인터랙션을 위해 설계된 지금까지 가장 정확한 speech-to-text 모델인 Gemini 3.5 Transcribe를 소개한다. 배경 잡음·복잡한 전문 용어·비유창성(disfluency) 정리에서 힘겨워하는 기존 음성 인식 모델과 달리, Gemini 3.5 Transcribe는 원시 오디오를 곧바로 정확하고 정돈된, 포맷팅까지 마친 텍스트로 변환한다.

Gemini 앱Android 같은 제품 전반에서, Rambler on Android과 macOS용 Gemini 앱의 새 음성 기능을 통해 소비자들이 이미 이 전사 모델의 혜택을 받고 있다. 이제 개발자들은 Google AI Studio의 Gemini APIGemini Enterprise Agent Platform에서 Gemini 3.5 Transcribe로 유사한 기능을 구축할 수 있다.

Google은 음성 에이전트, 실시간 캡션 도구, 통화 후 분석 파이프라인 등 어떤 것을 만들든 개발자 워크플로에 매끄럽게 꽂히도록 3.5 Transcribe를 설계했다. 모델은 두 개의 별도 API로 제공된다:

더 정밀하고 지능적인 전사

Gemini 3.5 Transcribe는 사용자의 자연스러운 말투를 포착해 의도를 더 잘 이해하고 커스텀 어휘를 인식하도록 설계되어, 음성으로 작업을 실행할 수 있다.

영상 — 실시간 언어 전환과 매끄러운 스트리밍 전사 데모. 원본 mp4 다운로드.
영상 — 스마트 전사가 발화 비유창성을 정리하는 데모. 원본 mp4 다운로드.
영상 — 다화자 귀속과 단어 단위 타임스탬프 데모. 원본 mp4 다운로드.

Gemini 3.5 Transcribe의 성능은 이전 전사 모델 Chirp 3 대비 큰 진전이며, 새 기능·향상된 단어 오류율·상당히 개선된 지연을 제공한다. Artificial Analysis 측정 기준으로 최종 전사까지의 시간이 예컨대 70% 개선됐다. 상위 언어·로케일 집합의 FLEURS 벤치마크에서 모델은 정밀한 다국어 성능을 보여, Chirp 3를 상회하며 스트리밍 모드 5.50%, 비스트리밍 5.04% WER를 달성했다.

FLEURS 벤치마크 스트리밍 음성 인식 정확도 그래프
FLEURS 상위 언어군 스트리밍 음성 인식 정확도 그래프 (원문).

스마트 전사와 고급 딕테이션 체험

Google AI Studio의 Gemini API 및 Gemini Enterprise Agent Platform에 더해, 3.5 Transcribe는 Google 전반의 작업을 더 자연스럽고 직관적으로 만들기 위해 표준 speech-to-text 이상으로 나아간다. Gboard·Antigravity·Gemini 앱·Chrome 같은 일상 표면에 문맥 인식을 직접 가져와, 뉘앙스·의도·인라인 편집을 매끄럽게 포착한다.

영상 — macOS Gemini 앱에서 파일 분석·이미지 생성·검색을 음성으로. 원본 mp4 다운로드.
영상 — Android Rambler가 필러를 자동 제거하고 발화를 정리. 원본 mp4 다운로드.
영상 — Antigravity가 스크린 컨텍스트를 활용해 전사 정확도 확보. 원본 mp4 다운로드.

초기 후기

Gemini Live API를 활용해 Agora, Fishjam, LangChain, LiveKit, Pipecat, Vercel, Vision Agents 같은 개발자 플랫폼이 개발자가 손쉽게 고성능 음성 기반 인터페이스를 구축·배포할 수 있게 한다. 이 플랫폼들은 뒷단에서 복잡한 실시간 미디어 스트리밍 인프라를 관리해, 개발자가 오직 사용자 경험 제작에만 집중할 수 있게 해준다.

vivo, Intellitek Health, Lingopal 같은 회사들도 3.5 Transcribe의 인상적인 지연·정확도·광범위한 언어 지원을 부각한 긍정적인 피드백을 공유했다.

vivo 사용 후기 그래픽
vivo 사용 후기 (원문 그래픽).

3.5 Transcribe로 지금 시작하기


원본 링크·인용

원문

Intelligent transcription with Gemini 3.5 Transcribe — Google Blog (2026-08-26)

개발자 문서

파트너 통합

팩트체크 참조


기타

용어

고지

원문 URL: blog.google/innovation-and-ai/models-and-research/gemini-models/gemini-3-5-transcribe/ · 캡처 2026-08-28 · 완역·팩트체크·구조화: zhugehyuk