| 일 | 월 | 화 | 수 | 목 | 금 | 토 |
|---|---|---|---|---|---|---|
| 1 | 2 | 3 | 4 | 5 | ||
| 6 | 7 | 8 | 9 | 10 | 11 | 12 |
| 13 | 14 | 15 | 16 | 17 | 18 | 19 |
| 20 | 21 | 22 | 23 | 24 | 25 | 26 |
| 27 | 28 | 29 | 30 |
- 허깅페이스
- Ai
- AI모델
- Coding
- openrouter
- gemini
- 로컬llm
- OpenAI
- ai모델비교
- google antigravity
- AI 에이전트
- vlm
- 바이브
- llm
- 바이브코딩
- 나 혼자 산다
- 피지컬ai
- Gemma4
- djai
- AI에이전트
- 바이브 코딩
- 오픈소스ai
- 코딩
- ViBe
- AntiGravity
- GitHub
- ai studio
- Anthropic
- ChatGPT
- Today
- Total
DigitalJoy AI 님의 블로그
Gemini 3.5 Transcribe 완벽 정리: 출시일·기능·API·사용법까지 (2026년 8월) 본문

Gemini 3.5 Transcribe 완벽 정리: 출시일·기능·API·사용법까지 (2026년 8월)
한 줄 요약
Gemini 3.5 Transcribe는 2026년 8월 26일 GA(일반 제공)된 구글의 전용 음성→텍스트(STT) 모델로, Gemini 3 Pro 기반에 불필요한 추임새·화자 자기 교정을 자동으로 제거하고, 85개 이상 언어를 지원하며, 비스트리밍 기준 WER 2.6%의 정확도를 보인다. Intelligent transcription with Gemini 3.5 Transcribe
1. 도입: 왜 지금 Gemini 3.5 Transcribe인가
음성 인식 시장은 오랫동안 OpenAI Whisper와 Google Cloud Speech-to-Text가 양분해 왔다. 그런데 2026년 8월, 구글이 Gemini 3 Pro를 기반으로 재설계한 전용 전사 모델 두 개를 동시에 GA로 내놓았다. 바로 gemini-3.5-transcribe(사전 녹음용)와 gemini-3.5-transcribe-live(실시간 스트리밍용)다. Release notes | Gemini API
기존 Gemini 2.5 Flash나 3.0 계열로도 오디오 전사가 가능했지만, 긴 회의록에서 중요한 대화가 조용히 누락되거나(Do not use Gemini 2.5 models for audio transcription), 범용 모델이다 보니 전사에 특화된 기능(화자 분리, 타임스탬프, 커스텀 어휘)이 부족했다. 3.5 Transcribe는 이런 한계를 의식적으로 깬 "전문화 모델"이다.
이 글에서는 검색 결과에서 직접 확인한 사실만을 바탕으로, Gemini 3.5 Transcribe의 핵심 기능·정확도·가격·실전 사용법·한계까지 정리한다.
2. Gemini 3.5 Transcribe란?
2-1. 모델 구성
Gemini 3.5 Transcribe는 하나의 이름이지만 실제로는 두 개의 엔드포인트로 제공된다. X @rohanpaul_ai
| 엔드포인트 | 용도 | 최대 입력 | 주요 특징 |
|---|---|---|---|
gemini-3.5-transcribe |
사전 녹음된 오디오 | 최대 1시간 | 타임스탬프, 최대 3명 화자 식별, 커스텀 어휘 |
gemini-3.5-transcribe-live |
실시간 스트리밍 | 연속 스트림 | 낮은 지연시간, 구어체 정제 |
두 모델 모두 Gemini 3 Pro를 기반으로 학습되었으며, DeepMind의 모델 카드에서도 이 점이 명시되어 있다. Gemini 3.5 Audio (Live Translate) - Model Card
2-2. 기존 모델과 다른 점
- 추임새·자기 교정 제거: "어…", "그게 아니라", "음" 같은 filler와 화자가 말을 고치는 과정을 모델이 스스로 편집해, 최종 텍스트는 마치 처음부터 깔끔하게 쓴 문장처럼 나온다. Ars Technica
- 서식 있는 텍스트 출력: 단순한 텍스트가 아니라 문단·구두점·목록이 정리된 형태로 반환된다.
- 전용 모델: 범용 LLM이 아니라 STT에 최적화돼 있어, 토큰 소비와 지연시간 모두에서 이점이 있다.
3. 핵심 기능과 정확도
3-1. WER(단어 오류율) 성능
서드파티 벤치마크로 유명한 Artificial Analysis의 AA-WER 측정에 따르면, Gemini 3.5 Transcribe는 다음과 같은 정확도를 기록했다. Artificial Analysis Speech-to-Text Leaderboard
- 비스트리밍(사전 녹음): WER 2.6% (AA-WER 기준 5위)
- 스트리밍(실시간): WER 4.0%
Investing.com의 보도 역시 같은 수치를 인용하며, "배경 소음, 전문 용어, 화자 교정을 처리한다"고 설명했다. kr.investing.com
다만 Reddit의 speechtech 커뮤니티에서 12개 이상 API를 비교한 사용자는 "현재 가장 나은 모델은 GPT-4o-transcribe이고, 그 뒤를 Eleven Labs, Whisper-large, Gemini 계열이 따른다"고 평가했다. Reddit r/speechtech 즉, 절대적 1위는 아니지만 최상위권에는 확실히 진입했다는 뜻이다.
3-2. 다국어·화자 분리
구글 공식 블로그에 따르면, 3.5 Transcribe는 85개 이상의 언어를 자동 감지해 전사하며, 지역 악센트와 다양한 방언도 처리한다. blog.google 사전 녹음 모델의 경우 타임스탬프와 함께 최대 3명의 화자를 식별(speaker diarization)할 수 있다.
3-3. 커스텀 어휘(Custom Vocabulary)
전문 용어, 제품명, 인명, 회사명처럼 일반 사전에 없는 단어를 미리 등록하면 인식률이 크게 올라간다. 9to5Google은 이 기능을 "Custom vocabulary"라고 소개하며 Chrome·Gboard·AI Studio 전반에서 지원된다고 전했다. 9to5Google
4. 어디서 쓸 수 있나? 제품 통합 현황
4-1. Google AI Studio
AI Studio의 Build 모드에서 gemini-3.5-transcribe를 바로 선택할 수 있다. 구글은 "AI Studio에서 3.5 Transcribe를 활용해 음성으로 앱을 즉석에서 코딩하는(vibe coding) 시나리오"를 소개했다. blog.google
4-2. Android Gboard Rambler
Gboard의 새 기능인 Rambler는 3.5 Transcribe를 기반으로, 사용자가 떠들듯 말하는 내용을 필터링해서 잘 정리된 텍스트로 변환한다. blog.google 블로그·메모·카카오톡 긴 메시지 작성에 특히 유용하다.
4-3. macOS Gemini 앱 & Chrome
macOS용 Gemini 앱에 통합되었으며, Chrome에서는 Fn 키를 길게 누르고 말하기만 하면 어떤 앱·웹이든 입력창에 정제된 텍스트가 들어간다. filler words 제거, 화자 자기 교정 반영, 구두점 자동 삽입이 모두 포함된다. Threads @testingcatalog
4-4. API (Gemini Developer API / Vertex AI)
개발자는 REST API를 통해 직접 호출할 수 있으며, Vertex AI 상의 Gemini Enterprise Agent Platform에서도 동일 모델을 제공한다.
5. 가격: 얼마나 드는가
2026년 8월 기준으로 확인된 요금은 다음과 같다.
5-1. Gemini Developer API
공식 가격 문서에 따르면, 3.5 Transcribe는 시간당 100만 오디오 토큰당 1달러, 또는 요청당 14달러(1,000건 기준) 수준이며, 분당 환산액은 약 $0.0368/분이다. Gemini Developer API pricing 참고로 오디오 토큰은 초당 약 25개로 환산된다.
5-2. Vertex AI (Enterprise)
Vertex AI 기준으로는 오디오 입력이 100만 토큰당 $3.50, 텍스트 출력이 100만 토큰당 $21.00이며, 오디오 1분당 약 $0.009 수준으로 계산된다. Agent Platform Pricing 기업 환경에서 대량 전사를 돌릴 때는 Whisper 대비 비용 경쟁력이 있을 수 있다.
6. 실전 사용 예시
예시 1: 1시간 회의록 정리
gemini-3.5-transcribe 엔드포인트에 1시간 분량의 MP3를 업로드하면, 타임스탬프와 화자 3명까지 분리된 마크다운을 받을 수 있다. 개발자 포럼에서는 "3.5시간짜리 시의회 회의 요약도 가능하다"는 사례가 공유됐다. Hacker News
예시 2: 블로그 초안 작성
Android Gboard Rambler를 켜고 10분간 생각을 말로 풀어낸다. "그니까… 그게 아니라…" 같은 부분이 모두 빠지고, 문장 부호가 찍힌 블로그 초안이 구글 독스에 바로 들어간다.
예시 3: 영어 강의 자막 제작
85개 언어 자동 감지 기능을 활용해, 영어 강의 오디오를 넣으면 영어 텍스트가 나오고, 이후 Gemini 3.5 Flash로 한국어 번역을 돌리면 SRT 자막 파이프라인이 완성된다.
7. 주의점과 한계
7-1. 화자 분리 상한
사전 녹음 모델의 화자 식별은 최대 3명까지다. 4명 이상의 패널 토론, 큰 회의실 녹음에서는 화자 라벨이 뒤섞일 수 있다.
7-2. 비모국어 악센트·언어 전환
DeepMind 모델 카드는 "비원어민 악센트, 유사한 언어 쌍, 빠른 언어 전환 상황에서는 언어 감지가 흔들릴 수 있다"고 명시하고 있다. DeepMind Model Card 한·중·일이 섞인 대화나, 한국어 안에서도 영어 전문 용어가 많은 기술 회의에서는 결과물을 한 번 더 점검하는 편이 안전하다.
7-3. "침묵 누락" 이슈의 역사
이전 세대인 Gemini 2.5에서는 오디오의 중요한 대화가 조용히 빠지는 현상이 보고된 바 있다. AI Wow 3.5 Transcribe는 전용 모델로 재학습되며 이 점이 개선되었을 것으로 보이지만, 장시간 녹음에서는 여전히 중간중간 샘플링 결과를 확인하는 습관이 필요하다.
7-4. GPT-4o-transcribe와의 격차
Reddit 벤치마크와 AssemblyAI 비교 테스트 모두에서, 현재 절대적 1위는 OpenAI의 GPT-4o-transcribe로 평가된다. AssemblyAI Blog "정확도만 놓고 보면 GPT-4o-transcribe가 아직 한 수 위"라는 점을 염두에 두고, 구글 생태계 통합·비용·지연시간 등 다른 장점으로 비교해야 한다.
8. 마무리
Gemini 3.5 Transcribe는 "범용 LLM으로 오디오를 억지로 전사하던 시대"를 끝내기 위해 구글이 내놓은 첫 전용 STT 모델이다. 비스트리밍 WER 2.6%, 85개 이상 언어, 화자 분리, 커스텀 어휘, Gboard Rambler와 Chrome 통합까지, 스펙만 보면 2026년 8월 시점에서 가장 완성도 높은 음성 인식 파이프라인 중 하나다.
다만 절대 정확도 1위는 아직 GPT-4o-transcribe에게 내주었고, 화자 분리 상한·다국어 악센트 처리 등에서 한계도 분명하다. 자신의 워크플로우가 구글 생태계(AI Studio·Gboard·Chrome·Vertex AI) 안에 꽂혀 있는지, 아니면 최상위 정확도 하나가 더 중요한지에 따라 선택지가 갈릴 것이다.
FAQ
Q1. Gemini 3.5 Transcribe는 무료인가? A. AI Studio 플레이그라운드에서는 무료 할당 범위 내에서 테스트할 수 있지만, API 호출 기준 Developer API는 약 $0.0368/분, Vertex AI는 약 $0.009/분의 요금이 부과된다.
Q2. Whisper보다 정확한가? A. Artificial Analysis AA-WER 기준 비스트리밍 2.6%로 최상위권이지만, 커뮤니티 벤치마크에서는 GPT-4o-transcribe가 1위로 평가된다. Whisper-large도 여전히 강력한 경쟁자다.
Q3. 한국어는 잘 인식하나? A. 85개 이상 언어 지원에 한국어가 포함되며, 지역 악센트·방언도 처리한다고 공식 문서에 명시되어 있다. 다만 영어 전문 용어가 많은 분야에서는 커스텀 어휘 등록을 권장한다.
Q4. 최대 몇 시간까지 한 번에 전사 가능한가? A. gemini-3.5-transcribe 엔드포인트 기준 최대 1시간이다. 그 이상은 분할 업로드해야 한다.
Q5. 화자 분리는 몇 명까지 가능한가? A. 공식 기준 최대 3명이다. 4명 이상 환경에서는 별도 화자 분리 도구와의 병행을 고려해야 한다.
Q6. 실시간 회의 중계에도 쓸 수 있나? A. gemini-3.5-transcribe-live 엔드포인트가 실시간 스트리밍용으로 제공되며, WER 4.0%를 기록한다. Google Meet의 실시간 전사 기능도 이 계열 오디오 모델을 사용한다.

'AI' 카테고리의 다른 글
| 구글 북스 인기무료 1위 '도시의 초인'을 제미나이 노트북으로 읽는 법 — 줄거리·캐릭터·오디오북까지 한 번에 (0) | 2026.08.30 |
|---|---|
| 8월 허깅페이스 인기 모델, 로컬로 돌릴까 API로 쓸까 — GPU 없는 편집자의 현실적 선택 (0) | 2026.08.29 |
| 지푸AI, GLM-5.3-Flash 오픈웨이트 공개… 320B 파라미터에 MIT 라이선스, 'Ox Alpha'의 정체 드러나다 (0) | 2026.08.27 |
| 제미나이 무료 사용 이벤트 2026 총정리: 대학생 1년 무료부터 4개월 체험까지 (0) | 2026.08.27 |
| OpenRouter, Stripe 품으로… 80억 달러 인수·신규 모델·할인 총정리 (2026년 8월) (0) | 2026.08.27 |