Gemini 3.5 Transcribe — 지능형 음성 전사 모델
Google이 공개한 최신 speech-to-text 모델. 스트리밍 4.0% / 비스트리밍 2.6% WER로 Artificial Analysis 리더보드에 진입. 85개 이상 언어, 두 API(Live / Interactions) 이원 구조. Rambler·Antigravity·macOS Gemini 앱·Chrome(예정)에 이미 탑재.
이 글이 답하는 핵심 질문 1개
Google의 새 STT 모델 Gemini 3.5 Transcribe는 기존 Chirp 3 대비 무엇이 달라졌고, 개발자·기업·일반 사용자 각 층위에서 지금 무엇을 할 수 있는가?
멘탈 모델 3줄
- 이원 API 구조: 실시간 대화용
gemini-3.5-transcribe-live(Live API) + 사전 녹음용gemini-3.5-transcribe(Interactions API). 지연·정확도 우선순위가 다르므로 유스케이스에 맞춰 골라 쓴다. - STT가 아니라 "정리된 텍스트": 자기 정정("화요일 아니고 수요일"), 필러("음/어") 제거, 자동 포맷팅을 모델이 직접 한다. 후처리 파이프라인 대체.
- 이미 배포 표면 다수 확보: 개발자용 API 외에 Gboard Rambler(Android), macOS Gemini 앱, Antigravity, AI Studio에 탑재. 곧 Chrome 확대.
선행 개념(모르면 막히는 것만)
- WER (Word Error Rate): 오인식률. 낮을수록 좋다. Artificial Analysis(AA)는 독립 벤치마크 집계 사이트.
- FLEURS: 다국어 STT 표준 벤치마크. 여러 언어/지역 평균 WER로 비교.
- Chirp 3: Google Cloud Vertex AI에 있는 이전 세대 다국어 STT 모델. 이 글의 baseline.
- Live API vs Interactions API: Gemini API의 두 계열. Live = 양방향 스트리밍, Interactions = 요청/응답형.
권장 읽기 순서(8분)
- Executive Summary → 숫자(WER)와 배포 표면 먼저.
- 완역 §Get more precise… → 6가지 능력의 실제 청구서.
- 완역 §Experience smart transcription → 이미 붙어 있는 5개 표면(Gboard·AI Studio·Antigravity·macOS·Chrome).
- 팩트체크 → 어느 주장이 독립 검증됐고 어느 것은 Google 자체 측정인지.
읽고 확인할 질문 3개
- 스트리밍 vs 비스트리밍 WER 숫자 차이는 얼마이고, 왜 그 방향(스트리밍이 더 나쁨)이 자연스러운가?
- Chirp 3 → 3.5 Transcribe에서 "지연이 70% 줄었다"의 근거 지표는 무엇인가?
- 화자 3명 초과 분리 기능의 정확한 지위는? ("지원됨"인가 "실험적"인가)
이 모델이 하는 일 — 한 문단
Gemini 3.5 Transcribe는 원시 오디오를 곧바로 정리된 형태의 텍스트로 바꾸는 speech-to-text 모델이다. 잡음·전문 용어·비유창성(disfluency) 정리에서 취약했던 기존 STT와 달리, 자기 정정·필러 제거·자동 포맷을 모델 내부에서 수행한다. Google은 이를 두 개의 API 트랙(gemini-3.5-transcribe-live 실시간 스트리밍, gemini-3.5-transcribe 사전 녹음)으로 노출하며, Gemini API·AI Studio·Antigravity·Gemini Enterprise Agent Platform에서 public preview로 사용 가능하다.

주요 주장 전수
Artificial Analysis 측정 평균 WER. 스트리밍 4.0%, 비스트리밍 2.6%. Google 발표 & AA 리더보드(#5).
자동 감지·전사되는 언어 수. 지역 억양·방언 처리 포함.
사전 녹음 화자 분리 정확도 담보 범위. 3명 초과는 실험적.
Chirp 3 대비 "최종 전사까지 걸리는 시간" 개선(스트리밍). Artificial Analysis 측정.
FLEURS 다국어 벤치마크 상위 언어군 WER. 스트리밍/비스트리밍 각각. Chirp 3 대비 개선.
초기 파트너 개발자 플랫폼: Agora · Fishjam · LangChain · LiveKit · Pipecat · Vercel · Vision Agents.
배포 표면(이미 붙어 있는 것)
- 개발자: Gemini API via Google AI Studio, Google Antigravity (public preview).
- 기업: Gemini Enterprise Agent Platform (public preview), Gemini Enterprise for Customer Experience 곧 지원.
- 일반 사용자: Rambler on Android (선정 국가·언어), macOS Gemini 앱(영어), Chrome(예정).
FLEURS 결과 그래프

신뢰도 등급 및 팩트체크 요약
일관·명확 / 자체 벤치 위주. 핵심 숫자(WER 4.0%/2.6%)는 Artificial Analysis라는 독립 리더보드가 확인. FLEURS 5.50%/5.04%와 "지연 70% 개선"은 Google 자체 측정(재현 방법론 미공개). 배포 표면·파트너 목록·API 엔드포인트는 문서에서 즉시 검증 가능. 미래형 주장("Chrome 곧 지원", "3+화자 실험적")은 재검증 필요.
종합 판정
Grade: B+ — 마케팅 자료로 통상 기대 이상. 3.5 Transcribe의 WER 두 숫자는 Google이 지목한 Artificial Analysis 리더보드에서 실제 확인되며, 발표 다음 날 다수 매체(9to5Google · GIGAZINE · BusinessToday · 24/7 Wall St. · Dataconomy)가 같은 팩트를 반복 인용했다. 반면 "70% 지연 개선", "FLEURS 5.50/5.04%"는 Google 자체 측정으로 독립 재현이 아직 없다. 미래형 표현(Chrome 예정, 3+화자 experimental)은 현재 사실이 아니다.
주장별 판정
독립 확인. 24/7 Wall St.는 "Gemini 3.5 Transcribe가 AA-WER에서 2.6%로 #5 진입"을 명시. 9to5Google 및 GIGAZINE도 같은 숫자 인용.
부분사실. Google이 스트리밍 지연을 크게 줄였다는 방향성은 AA 리더보드의 "0.40s after speech end" 지표와 부합하지만, 70% 수치의 baseline·측정 방식은 원문 어느 곳에서도 정의되지 않았고 독립 재현이 없다. Chirp 3은 실제로 Vertex AI에서 문서화된 예전 세대 모델이므로 비교 대상 자체는 진짜다.
부분사실 — Google 자체 측정만 존재. FLEURS는 Google Research가 제안한 공개 다국어 벤치마크로 실체는 있으나, "top languages and locales" 세트의 구체 정의가 원문에 없어 3자 재현 불가.
사실. Google DeepMind의 Gemini Audio 페이지가 같은 숫자를 명시. BusinessToday·Dataconomy 등도 반복 인용.
사실. 원문이 스스로 "3+ speakers is experimental"로 자격을 낮춰 표시한 부분. 마케팅으로 부풀리지 않은 몇 안 되는 지점.
사실. 9to5Google이 "Gboard Rambler를 powers한다"를 헤드라인으로 확인. Google Antigravity 제품 페이지도 존재.
불확실 — 로드맵 문구. 9to5Google도 "coming to Chrome"으로 미래형 인용. 발표일 기준 미출시. 재검증 시점: Chrome 릴리즈 노트 확인 필요.
불확실 — 원문에 기기 명시 없음. 서드파티 매체가 추가한 정보라 Google 공식 지원 매트릭스로 재확인 필요.
검증 노트
- 실제 접근한 URL: blog.google 원문 · 9to5google.com · gigazine.net · deepmind.google · docs.cloud.google.com · arxiv.org · 247wallst.com · antigravity.google · aistudio.google.com · ai.google.dev.
- Google 자체 벤치(FLEURS 5.50/5.04% · 70% latency 개선)는 방법론 공개 시점에서 재검증 예정. 현재는 회사 발표로 표기.
- 미래형 주장(Chrome 확장, 3+화자 정식화, CX 제품 통합)은 발표일 기준 계획. "지금 사실"로 소비하지 말 것.
지능형 전사, Gemini 3.5 Transcribe
정확하고 지능적인 실시간 전사를 위해 설계된 최신 speech-to-text 모델.
오늘, Google은 지능형 음성 인터랙션을 위해 설계된 지금까지 가장 정확한 speech-to-text 모델인 Gemini 3.5 Transcribe를 소개한다. 배경 잡음·복잡한 전문 용어·비유창성(disfluency) 정리에서 힘겨워하는 기존 음성 인식 모델과 달리, Gemini 3.5 Transcribe는 원시 오디오를 곧바로 정확하고 정돈된, 포맷팅까지 마친 텍스트로 변환한다.
Gemini 앱과 Android 같은 제품 전반에서, Rambler on Android과 macOS용 Gemini 앱의 새 음성 기능을 통해 소비자들이 이미 이 전사 모델의 혜택을 받고 있다. 이제 개발자들은 Google AI Studio의 Gemini API와 Gemini Enterprise Agent Platform에서 Gemini 3.5 Transcribe로 유사한 기능을 구축할 수 있다.
Google은 음성 에이전트, 실시간 캡션 도구, 통화 후 분석 파이프라인 등 어떤 것을 만들든 개발자 워크플로에 매끄럽게 꽂히도록 3.5 Transcribe를 설계했다. 모델은 두 개의 별도 API로 제공된다:
- 실시간 스트리밍: 인터랙티브 음성 앱을 위한 서브초 지연의 연속 양방향 스트리밍을 Live API에서
gemini-3.5-transcribe-live로 제공. - 사전 녹음 오디오 처리: 녹음 오디오·회의·통화 로그 등을 화자 귀속과 단어 단위 타임스탬프로 전사하는 Interactions API의
gemini-3.5-transcribe.
더 정밀하고 지능적인 전사
Gemini 3.5 Transcribe는 사용자의 자연스러운 말투를 포착해 의도를 더 잘 이해하고 커스텀 어휘를 인식하도록 설계되어, 음성으로 작업을 실행할 수 있다.
- 스마트 전사: 자기 정정("화요일 만나자—아니, 수요일")을 매끄럽게 처리하고, 필러("음"·"어")를 제거하며, 텍스트를 자동 포맷한다.
- 함수 호출(Function calling): 이미지 생성·파일 분석 같은 복잡한 작업을 함수 호출로 다른 Gemini 모델에 위임할 수 있다. 현재 Gemini macOS 앱에서 사용 가능.
- 더 정밀한 전사: Artificial Analysis의 측정에서 스트리밍 사용 사례 WER 4.0%, 비스트리밍 2.6%를 달성. 잡음 있는 실사용 환경에서도 우편번호·주문 ID 같은 알파숫자 개체를 정확히 포착.
- 커스텀 어휘: 사용자가 제공한 어휘에 매끄럽게 적응해 전문 용어·고유 철자 인식.
- 글로벌 언어 지원: 85개 이상 언어 자동 감지·전사, 지역 억양과 다양한 방언 처리.
- 다화자 식별: 사전 녹음 오디오에서 최대 3명까지 타임스탬프와 함께 발화 귀속(3명 초과는 실험적).
Gemini 3.5 Transcribe의 성능은 이전 전사 모델 Chirp 3 대비 큰 진전이며, 새 기능·향상된 단어 오류율·상당히 개선된 지연을 제공한다. Artificial Analysis 측정 기준으로 최종 전사까지의 시간이 예컨대 70% 개선됐다. 상위 언어·로케일 집합의 FLEURS 벤치마크에서 모델은 정밀한 다국어 성능을 보여, Chirp 3를 상회하며 스트리밍 모드 5.50%, 비스트리밍 5.04% WER를 달성했다.

스마트 전사와 고급 딕테이션 체험
Google AI Studio의 Gemini API 및 Gemini Enterprise Agent Platform에 더해, 3.5 Transcribe는 Google 전반의 작업을 더 자연스럽고 직관적으로 만들기 위해 표준 speech-to-text 이상으로 나아간다. Gboard·Antigravity·Gemini 앱·Chrome 같은 일상 표면에 문맥 인식을 직접 가져와, 뉘앙스·의도·인라인 편집을 매끄럽게 포착한다.
- Android의 Gboard: 새 Rambler 기능을 통해 3.5 Transcribe가 음성 사고를 잘 포맷된 텍스트로 변환하며 필러를 걸러낸다. 음성으로 편집·오탈자 정정·문체 변경도 가능.
- Google Antigravity: 3.5 Transcribe가 사용자 허가 하에 스크린 컨텍스트와 채팅 기록을 짝지어 파일명·에이전트 사고·활성 문서 전반의 정확한 전사 정확도를 보장.
- Google AI Studio: Build 모드에서 3.5 Transcribe에 접근해 즉석에서 음성으로 앱을 vibe-code 가능.
- macOS Gemini 앱: 자유로운 자연 발화를 정돈된 포맷 텍스트로 전사할 뿐 아니라 스크린 컨텍스트와 매끄럽게 결합하는 음성 명령을 활성화. 배경에서 다른 Gemini 모델이 무거운 작업을 처리하도록 호출해, 로컬 파일 요약·앱 간 텍스트 재활용·커서 위치 이미지 생성을 오직 음성으로 처리.
- Chrome (곧): 웹 페이지의 어떤 필드든 말로 입력할 수 있어, 답장 초안·게시물 작성·Chrome 내 Gemini 프롬프트를 목소리로 더 자연스럽게.
초기 후기
Gemini Live API를 활용해 Agora, Fishjam, LangChain, LiveKit, Pipecat, Vercel, Vision Agents 같은 개발자 플랫폼이 개발자가 손쉽게 고성능 음성 기반 인터페이스를 구축·배포할 수 있게 한다. 이 플랫폼들은 뒷단에서 복잡한 실시간 미디어 스트리밍 인프라를 관리해, 개발자가 오직 사용자 경험 제작에만 집중할 수 있게 해준다.
vivo, Intellitek Health, Lingopal 같은 회사들도 3.5 Transcribe의 인상적인 지연·정확도·광범위한 언어 지원을 부각한 긍정적인 피드백을 공유했다.

3.5 Transcribe로 지금 시작하기
- 개발자: Gemini API via Google AI Studio 및 Google Antigravity에서 public preview.
- 기업: Gemini Enterprise Agent Platform에서 public preview, Gemini Enterprise for Customer Experience는 곧 지원.
- 모든 사용자: macOS Gemini 앱(영어), Android Rambler는 선정 국가·언어, Chrome은 곧.
원문
Intelligent transcription with Gemini 3.5 Transcribe — Google Blog (2026-08-26)
개발자 문서
- Gemini API Live — Live Transcribe
- Gemini API — Transcribe (Interactions)
- AI Studio — Live 모델 프리셋
- AI Studio — 신규 채팅 프리셋
파트너 통합
- Agora — Gemini ASR
- Fishjam — Gemini Live integration
- LangChain — Trace Gemini Live
- LiveKit — STT Gemini
- Pipecat — STT Google
- Vercel — AI Gateway STT
- Vision Agents — Gemini STT
관련 Google
- Gemini macOS 앱 — 자연스러운 음성 대화
- Android — Gemini Intelligence / Rambler
- Google Antigravity 제품 페이지
- Gemini Enterprise for CX
팩트체크 참조
용어
- WER (Word Error Rate) — 단어 오류율. STT 표준 지표. 낮을수록 좋다.
- Artificial Analysis (AA) — 독립 벤치마크 집계 사이트. AA-WER 리더보드가 STT 순위의 사실상 표준.
- FLEURS — Google Research 제안 다국어 STT 벤치. 100+ 언어의 병렬 음성 데이터셋.
- Chirp 3 — Google Cloud의 이전 세대 다국어 STT/TTS 모델. Vertex AI · Speech-to-Text V2 API로 접근.
- Function calling — LLM이 다른 함수/모델에 작업을 위임하는 인터페이스. 여기선 STT 모델이 이미지 생성·파일 분석 요청을 다른 Gemini 모델에 넘긴다.
고지
- 이 문서는 원문을 한국어로 완역·구조화한 학습용 자료다. 원문의 저작권은 Google에 있다.
- 원문 영상 6종은 저작권상 재호스팅하지 않는다. 각
의 mp4 링크로 원본 접근. - FLEURS 5.50/5.04% · 지연 70% 개선은 Google 자체 측정 결과이며 독립 재현 아직 없다.
- 미래형 발표(Chrome talk-to-type, CX 제품 통합, 3+화자 정식 지원)는 재검증 시점 도래 시 갱신 필요.
원문 URL: blog.google/innovation-and-ai/models-and-research/gemini-models/gemini-3-5-transcribe/ · 캡처 2026-08-28 · 완역·팩트체크·구조화: zhugehyuk