blog.google 3日前

Intelligent transcription with Gemini 3.5 Transcribe

Googleが新しい音声認識モデル「Gemini 3.5 Transcribe」を発表。リアルタイムストリーミング用と録音済み音声処理用の2系統APIを提供し、フィラー除去や自己修正の整形、カスタム語彙対応、85言語以上の自動検出、最大3話者の識別が可能。従来モデルChirp 3比で単語誤り率と応答速度が大幅改善(文字起こし完了までの時間が70%短縮)。Gboard、Antigravity、Gemini app(macOS)、AI Studio、Chrome(近日)などGoogle製品群に順次統合される。

Googleが新しい音声認識モデル「Gemini 3.5 Transcribe」を発表。リアルタイムストリーミング用と録音済み音声処理用の2系統APIを提供し、フィラー除去や自己修正の整形、カスタム語彙対応、85言語以上の自動検出、最大3話者の識別が可能。従来モデルChirp 3比で単語誤り率と応答速度が大幅改善(文字起こし完了までの時間が70%短縮)。Gboard、Antigravity、Gemini app(macOS)、AI Studio、Chrome(近日)などGoogle製品群に順次統合される。
↗ 元記事を開く