ทันเอไอ

Global AI & tech news, in your language · every story source-checked

🌐Follow
← Back to news
LINE Facebook X
AI 모델 및 연구Verified

구글, 85개 이상 언어 지원하는 음성 텍스트 변환 모델 ‘Gemini 3.5 Transcribe’ 공개

화자 분리 및 말더듬·추임새 정리를 지원해 가독성을 높인 신규 음성 인식 모델

📅 2026년 8월 28일 오전 12:54
구글, 85개 이상 언어 지원하는 음성 텍스트 변환 모델 ‘Gemini 3.5 Transcribe’ 공개

구글이 2026년 8월 26일 85개 이상의 언어를 지원하는 음성-텍스트 변환(Speech-to-text) 모델 ‘Gemini 3.5 Transcribe’를 공식 발표했다. 이 모델은 실시간 전사 및 녹음된 오디오 파일 변환을 모두 지원하도록 설계됐다.

핵심 기능은 화자 분리(Speaker Diarization)와 스마트 전사(Smart Transcription)다. 단순한 받아쓰기를 넘어 말더듬, 불필요한 추임새, 두서없는 문장 등을 정제하여 읽기 쉬운 텍스트로 자연스럽게 다듬어준다.

Gemini 3.5 Transcribe는 구글이 Google I/O 2026에서 공개하고 Pixel 11에 최초 탑재한 Android 기능 ‘Rambler’를 구동하는 기반 모델이기도 하다. 단순한 축어적 전사를 넘어 일상 구어를 바로 활용 가능한 텍스트로 전환하는 데 초점을 맞췄다.

개발자는 Google AI Studio 및 Gemini Enterprise Agent Platform의 Gemini API를 통해 해당 모델을 사용할 수 있다. Live API는 실시간 스트리밍 전사를 지원하며, Interactions API는 사전 녹음된 오디오 파일 처리에 활용된다.

Why it matters
85개 이상의 언어를 지원하여 회의록 작성, 인터뷰, 자막 생성 등 다양한 작업에 폭넓게 활용될 수 있다. 다만 실제 사용 환경에서의 태국어 전사 품질은 추가적인 검증이 필요하다.
#กูเกิล#Gemini 3.5#ถอดเสียง#ปัญญาประดิษฐ์
Sources (rewritten & summarized from): Blognone · blog.google · google.dev · datanorth.ai · google.dev · mlq.ai

Comments

Loading comments…

No sign-up needed · comments are auto-filtered and moderated