AI・機械学習
Gemini 3.8 text-to-speech が挨拶
Gemini 3.8 text-to-speech says hello (blog.google)
要約
Googleは、より表現力豊かでカスタマイズ可能な新しいテキスト読み上げ(TTS)モデル、Gemini 3.8 Flash TTSとGemini 3.8 Flash-Lite TTSを発表しました。これらのモデルは、自然言語プロンプトを使用してカスタムボイスを作成したり、既存のボイスを再現したりでき、セリフごとに詳細な制御が可能です。オーディオブック、ポッドキャスト、ボイスエージェントなど、様々な用途での高品質な音声生成を支援し、ウォーターマーキングなどの安全機能も組み込まれています。
全文翻訳
Gemini 3.8 text-to-speech が挨拶
2026年9月23日
Gemini 3.8 Flash TTSとGemini 3.8 Flash-Lite TTSは、これまでにないほど表現力豊かな音声生成モデルです。Google AI Studio、Gemini API、Gemini Enterprise、Gemini Notebook、Google Vidsで、カスタムキャラクターボイスやシーンダイアログを直接生成できます。
Leland Rechis
グループプロダクトマネージャー
Alan Cowen
リサーチサイエンスディレクター(Gemini Audioチームを代表して)
「Gemini 3.8 text-to-speech が挨拶」をチェックして、新しいモデルの仕組みをご覧ください。自然言語プロンプトを使って、ゼロからカスタムボイスを作成したり、既存のボイスを再現したりできます。話速、感情、さらにはリアルな会話音まで、セリフごとに直接制御できます。高品質なオーディオブック、ポッドキャスト、または大規模なリアルタイムボイスエージェントにこれらのモデルを使用してください。生成された音声の安全性を確保するため、ウォーターマーキングなどの安全機能が組み込まれています。
サマリーはGoogle AIによって生成されました。生成AIは実験的なものです。
Googleは、ゼロからリアルなボイスを作成・カスタマイズできる新しいAIツールをローンチしました。これらのボイスは、アクセントや感情のトーンまで、希望する通りに聞こえるように直接制御できます。まるで本物の人間が話しているかのようなオーディオブック、ゲーム、ポッドキャストの作成に最適です。さらに、これらのボイスが責任を持って使用されることを保証するための安全機能も追加されました。
サマリーはGoogle AIによって生成されました。生成AIは実験的なものです。
他のスタイルを探る:
箇条書き
基本的な解説
本日、Geminiファミリーに2つの新しいテキスト読み上げモデルを導入し、音声生成を静的なプリセットからダイナミックなクリエイティブスタジオへと変革します。これらのモデルにより、クリエイター、開発者、企業は、よりリッチで表現力豊かな音声体験を作成できるようになり、Gemini NotebookやGoogle Vidsなどの製品におけるユーザー体験も向上します。
Gemini 3.8 Flash TTS:深いクリエイティブディレクションとキャラクターデザインのために構築されています。自然言語プロンプトを使用して、ゲーム、没入型オーディオブック、ポッドキャスト、インタラクティブメディア全体でキャラクターに命を吹き込む、全く新しいボイスをゼロから作成できます。演技の指示、話速、方言の切り替え、バックチャネリング(相槌など)に対する詳細な制御により、パフォーマンスをセリフごとに直接指示できます。
Gemini 3.8 Flash-Lite TTS:大量かつコスト効率の高いスケーリングのために構築されています。大量の吹き替え、音声コンテンツ作成、表現力豊かなボイスエージェント向けに最適化されており、トーン、話速、表現のニュアンスを細かく制御できます。
これらのモデルは、3.5 Live Translate、3.5 Transcribe、3.8 Live、3.8 Live Extended Thinkingに続く、急速に成長しているGemini Audioファミリーを補完します。
独自のボイスを作成・カスタマイズする
30個のオリジナルボイスから無限のライブラリへとスケールアップします。全く新しいキャラクターボイスが必要な場合でも、一貫したブランドアンバサダーが必要な場合でも、当社の3.8 Flash TTSモデルは、フルボーカルスタジオを支えます。これにより、あらゆる瞬間に表現力豊かで自然なサウンドのボイスを作成・使用できるようになり、開発者や企業はカスタム音声体験を簡単に構築できるようになります。
生成ボイスデザイン:Gemini 3.8 Flash TTSを使用すると、100以上の言語と方言で、役割、アクセント、ボイス特性をカスタマイズし、自然言語プロンプトを使用して、ドラマチックで火を噴くドラゴンに命を吹き込む場合でも、独特の地域的なリズムを持つカリスマ的なナレーターを作成する場合でも、オーダーメイドのボイスをゼロから作成できます。Gemini 3.8 Flash TTSがメルボルンのハイエナジーDJボイスを生成する方法を聞いてください。Gemini 3.8 Flash TTSが超単調なロボットボイスを生成する方法を聞いてください。Gemini 3.8 Flash TTSが日本のドラゴンに命を吹き込む方法を聞いてください。
広範なボイスライブラリ:メキシコスペイン語、ケベックスフランス語、スコットランド英語などの地域バリエーションを含む、幅広い言語をカバーする2,000以上の制作準備完了ボイスにアクセスできます。
ボイスレプリケーション:30秒の音声サンプル(自分の声または使用権のある声)から一貫したボーカルプロファイルを再現します。組み込みの同意検証、SynthIDウォーターマーキング、C2PA認証により、開発者とボイスタレントの両方を保護します。
保存とスケーリング:設計したカスタムボイスを保存・管理し、継続的なプロジェクト全体で一貫したパフォーマンスと最小限のドリフトを保証します。
ボイスリミキシング:近日公開予定。ボイスライブラリからボイスを選択し、音色、ピッチ、話速、アクセントを微調整します。プロンプトを使用して特性を調整します(例:「微妙なアメリカ南部風アクセントを追加」または「デリバリーを柔らかくする」)。
パフォーマンスをセリフごとに指示する
ボイスを選択したら、両方のTTSモデルで各セリフのデリバリーを正確に制御できます。
パフォーマンスをセリフごとに指示:独自のステージディレクションを記述するか、Geminiに自然なスクリプトキューからデリバリーを指示させます。穏やかなカスタマーサービスエージェントから、ささやくようなサスペンスシーンまで。
Gemini 3.8 Flash TTSがインタラクティブボイスエージェントのために自然で非常に表現力豊かな会話を可能にする方法をご覧ください。Gemini 3.8 Flash TTSが詳細なスクリプト制御を使用して、深く魅力的な没入型音声体験を構築する方法をご覧ください。
長編生成:話者のドリフトを最小限に抑えながら、数時間にわたる連続音声全体で高品質なボイス、自然な話速、キャラクターの音色を維持します。ポッドキャストやオーディオブックに最適です。
ネイティブ2スピーカーシーンステージング:ポッドキャストやドラマのストーリーテリングのために、単一のスクリプトからマルチターン会話をシームレスに指示します。自然な会話のターンテイクを維持しながら、両方のボイスを明確に分離します。
スクリプト化されたボイスバーストとバックチャネリング:非言語的な合図(<笑い>、<ため息>、<息をのむ>など)やアクティブリスニングの挿入(|うん|や|ええ|など)を使用して、正確なコメディのタイミングとリアクションビートのために、リアルな会話のテクスチャを追加します。
Gemini 3.8 Flash TTSが自然言語プロンプトをオーダーメイドのボイスペルソナにゼロから変換する方法をご覧ください。Gemini 3.8 Flash TTSがクリエイターにカスタムシーンをデザインさせて、アニメーションダイアログに命を吹き込ませる方法をご覧ください。Gemini 3.8 Flash TTSがスクリプトを完全にパフォーマンスされたダイアログシーンに変換し、クリエイターがボーカルデリバリーと自然なターンテイクを指示できるようにする方法をご覧ください。
グローバルスケール向けに構築された表現力豊かな高品質音声生成を実現
Gemini 3.8 Flash TTSは、Hume AIのVoice Design Benchmarkで総合1位(71.4)を獲得し、アクセントモデリングでも60.8でトップを記録するなど、主要なボイスカスタマイズ機能を提供しています。
Gemini 3.8 Flash TTSとGemini 3.8 Flash-Lite TTSは、信頼性を犠牲にすることなく、真に表現力豊かなパフォーマンスを可能にし、Hume AIのOverall Quality Indexでもそれぞれ1位と2位を獲得しています。このモデルは、Gemini 3.1 Flash TTSと比較して、長編コンテンツやデュアルスピーカーのスクリーンプレイ制御など、幅広いユースケースで大幅な改善を示しています。
Voice Arenaでのブラインドヒューマンプリファレンス評価では、Gemini 3.8 FlashおよびFlash-Lite TTSは、日本語、ブラジルポルトガル語、ベトナム語、現代標準アラビア語(MSA)、メキシコスペイン語、ヒンディー語を含む主要なグローバル言語で競合他社の中でトップクラスのポジションを獲得しています。100以上の言語をサポートするこれらのモデルは、クリエイター、開発者、企業が世界中で高品質な多言語音声体験を構築することを可能にします。
信頼、同意、透明性をもって構築する
ボイス作成およびレプリケーション機能は、ボイスタレントを保護し、アイデンティティを尊重し、コンテンツの透明性を確保するための厳格なセーフガードを備えて構築されています。ボイスレプリケーションの場合、システムは同意検証を利用します。ボイスを作成する前に、ユーザーは参照話者と一致するボイス所有者からの音声同意録音を提供する必要があります。
より広範には、Gemini Audioモデルによって生成されたすべての音声クリップはSynthIDでウォーターマークが付けられます。この知覚できないウォーターマークは音声出力に直接織り込まれており、AI生成音声が検出可能であることを保証し、誤情報の防止に役立ちます。安全性と責任へのアプローチの詳細については、モデルカードを参照してください。
Google AI Studioの新しいオーディオプレイグラウンドを試す
本日より、開発者はGoogle AI Studioでこれらの新しい音声生成機能を体験できます。ボイスデザインワークスペースのように構築されており、プロンプトを使用して