HN 日本語サマリー

← 一覧へ戻る
AI・機械学習

Gemini 3.5 Transcribe: インテリジェントな音声認識モデル

Gemini-3.5-Transcribe (blog.google)

40 pointsby k929410 コメント

要約

Googleは、高精度でリアルタイムな音声認識を実現する新しいモデル「Gemini 3.5 Transcribe」を発表しました。このモデルは、背景ノイズや専門用語、言い淀みなどを処理し、生音声を正確で整形されたテキストに変換します。開発者はGemini APIを通じてこの機能を活用でき、音声エージェントやリアルタイムキャプションなどのアプリケーションを構築できるようになります。

全文翻訳

インテリジェントな文字起こし Gemini 3.5 Transcribe 2026年8月26日 | x.com Facebook LinkedIn Mail リンクをコピー 私たちの最新の音声テキスト変換モデルは、正確でインテリジェントなリアルタイム文字起こしのために設計されています。 Diego Melendo Casado エンジニアリング担当シニアディレクター、Gemini Audio Luke Leonhard チーフオブスタッフ、Gemini Audio、Gemini Audioチームを代表して 共有 x.com Facebook LinkedIn Mail リンクをコピー お使いのブラウザはオーディオ要素をサポートしていません。記事を聞く [[duration]] 分 このコンテンツはGoogle AIによって生成されています。生成AIは実験的なものです 音声スピード 音声スピード 0.75倍 1倍 1.5倍 2倍 本日、私たちはGemini 3.5 Transcribeを発表します。これは、インテリジェントな音声対話のために設計された、これまでで最も高精度な音声テキスト変換モデルです。背景ノイズ、複雑な専門用語、言い淀みのクリーンアップに苦労する従来の音声認識モデルとは異なり、Gemini 3.5 Transcribeは生の音声を直接、正確で洗練されたフォーマット済みのテキストに変換します。GeminiアプリやAndroidなどの当社の製品全体で、消費者はすでにRambler on AndroidやmacOSのGeminiアプリなどの新しい音声機能で、この文字起こしモデルから恩恵を受けています。現在、開発者はGoogle AI StudioのGemini APIやGemini Enterprise Agent PlatformでGemini 3.5 Transcribeを使用して同様の機能を構築できます。私たちは3.5 Transcribeを、音声エージェント、リアルタイムキャプションツール、または通話後分析パイプラインを構築しているかどうかにかかわらず、開発ワークフローにシームレスに統合できるように構築しました。このモデルは2つの別々のAPIで利用可能です。リアルタイムストリーミング:Live API(gemini-3.5-transcribe-liveを使用)を介して、インタラクティブな音声アプリのために、サブ秒のレイテンシで継続的かつ双方向のストリーミングを提供します。録音済みオーディオ処理:話者属性と単語レベルのタイムスタンプを付けて、会議、通話ログなどの録音済みオーディオを文字起こしします(Interactions API、gemini-3.5-transcribeを使用)。より正確でインテリジェントな文字起こしを実現 Gemini 3.5 Transcribeは、自然な話し方を捉え、意図をより良く理解し、カスタム語彙を認識するように設計されているため、音声でタスクを実行できます。スマート文字起こし:自己修正(例:「火曜日に会いましょう—いいえ、水曜日に」)、フィラーワード(「えー」や「あのー」)の削除、テキストの自動フォーマットをシームレスに処理します。関数呼び出し:モデルは、関数呼び出しを介して他のGeminiモデルにタスク(画像生成やファイル分析など)を委任できます。現在、Gemini macOSアプリで利用可能です。より正確な文字起こし:Artificial Analysisの測定によると、ストリーミングの場合は4.0%、非ストリーミングのユースケースの場合は2.6%の平均単語エラー率(WER)を達成しています。ノイズの多い実際の環境で強力なパフォーマンスを示し、郵便番号や注文IDなどの英数字エンティティを正確にキャプチャします。カスタム語彙:提供されたカスタム語彙に文字起こしをシームレスに適応させることで、専門用語や固有のスペルを認識します。グローバル言語サポート:85以上の言語を自動的に検出し、文字起こしし、地域的なアクセントや多様な方言をシームレスに処理します。複数話者識別:最大3人の話者に対して、タイムスタンプ付きで録音済みオーディオの音声を正確に帰属させます(3人以上の話者サポートは実験段階です)。Gemini 3.5 Transcribeは、ライブ言語切り替えとシームレスなストリーミング文字起こしを処理します。Gemini 3.5 Transcribeがスマート文字起こし機能で音声の言い淀みをクリーンアップする様子をご覧ください。3.5 Transcribeは、複数話者属性と単語レベルのタイムスタンプ付きで文字起こしを提供します。Gemini 3.5 Transcribeのパフォーマンスは、以前の文字起こしモデルChirp 3から大幅に進歩しており、新しい機能、改善された単語エラー率、および大幅に改善されたレイテンシを提供します。Artificial Analysisの測定によると、例えば最終的な文字起こしまでの時間は70%改善されています。トップ言語とロケールのセットにわたるFLEURSベンチマークでは、モデルは正確な多言語パフォーマンスを提供し、Chirp 3を上回り、ストリーミングモードで5.50%のWER、非ストリーミングユースケースで5.04%のWERを達成しています。スマート文字起こしと高度なディクテーションを体験してくださいGoogle AI StudioのGemini APIおよびGemini Enterprise Agent Platformに加えて、3.5 Transcribeは標準の音声テキスト変換を超えて、Google全体での作業をより自然で直感的にします。文脈を理解する機能をGboard、Antigravity、Geminiアプリ、Chromeなどの日常的なインターフェースに直接取り込むことで、ニュアンス、意図、インライン編集を容易にキャプチャします。AndroidのGboardでは、新しいRambler機能を通じて、3.5 Transcribeは話された考えを整形されたテキストに変換し、フィラーワードをフィルタリングします。音声を使用して編集、スペルミス修正、書き方の変更もできます。Google Antigravityでは、3.5 Transcribeは画面コンテキストとチャット履歴を、許可を得てペアリングし、ファイル名、エージェントの思考、アクティブなドキュメント全体で正確な文字起こし精度を保証します。Google AI Studioでは、Buildモードで3.5 Transcribeにアクセスして、その場で音声でアプリをコーディングできます。macOSのGeminiアプリでは、3.5 Transcribeは自由な自然なスピーチをクリーンなフォーマット済みテキストに文字起こしするだけでなく、画面コンテキストとシームレスにペアリングして複雑なワークフローを強化する音声コマンドも有効にします。バックグラウンドで他のGeminiモデルを呼び出して重い処理を任せることで、モデルはファイル要約、アプリ間でのテキストの再利用、またはカーソルでの画像生成などを、音声だけで簡単に行えるようにします。Chromeでも近日中に利用可能になり、あらゆるWebフィールドで話して入力できるようになります。これにより、返信のディクテーション、投稿の下書き、またはChromeでGeminiにプロンプトを入力することが、より自然に、より簡単になります。Gemini 3.5 Transcribeを使用すると、macOSのGeminiアプリでファイル分析、画像生成、検索を音声だけで行うことができます。AndroidのRamblerでGemini 3.5 Transcribeがフィラーワードを自動的に削除し、音声を聞き取りやすくする方法をご覧ください。Gemini 3.5 Transcribeは、Google Antigravityで画面コンテキストを活用し、正確な文字起こし精度を保証します。初期レビューを読むGemini Live APIを活用することで、Agora、Fishjam、LangChain、LiveKit、Pipecat、Vercel、Vision Agentsなどの開発者プラットフォームは、開発者が高性能な音声駆動インターフェースを容易に構築およびデプロイできるようになります。これらのプラットフォームは、複雑なリアルタイムメディアストリーミングインフラストラクチャをバックグラウンドで管理し、開発者はユーザーエクスペリエンスの作成に完全に集中できます。vivo、Intellitek Health、Lingopalなどの企業も3.5 Transcribeについて肯定的なフィードバックを共有しており、その印象的なレイテンシ、精度、および広範な言語サポートを強調しています。今すぐ3.5 Transcribeの使用を開始してください開発者向け:Google AI StudioおよびGoogle Antigravityを介したGemini APIでパブリックプレビュー中です。エンタープライズ向け:Gemini Enterprise Agent Platformを介したパブリックプレビュー中で、Gemini Enterprise for Customer Experienceでも近日中に提供予定です。すべての人向け:macOSのGeminiアプリ(英語)、一部の国と地域でのAndroidのRambler、および近日中にChromeで利用可能です。Googleからの最新ニュースをメールで受け取る製品アップデート、イベント情報、特別オファーなどのニュースレターに登録してください。完了しました。あと1ステップです。確認メールをチェックして登録を完了してください。別のアドレスで登録することもできます。お客様の情報はGoogleのプライバシーポリシーに従って使用されます。いつでもオプトアウトできます。投稿先: