HN 日本語サマリー

← 一覧へ戻る
AI・機械学習

Gemini 3.8 Live および 3.8 Live Extended Thinking のご紹介

Gemini 3.8 Live and 3.8 Live Extended Thinking (blog.google)

121 pointsby leumon78 コメント

要約

Googleは、より自然でインテリジェントな音声対話を実現するAIモデル、Gemini 3.8 Liveと3.8 Live Extended Thinkingを発表しました。これらのモデルは、複雑な推論、リアルタイムの視覚的コンテキスト処理、会話を中断しないバックグラウンドでのタスク実行に優れており、Google製品や開発者向けのコラボレーション体験を向上させます。

全文翻訳

Gemini 3.8 Live および 3.8 Live Extended Thinking のご紹介 2026年9月15日 Gemini 3.8 Live と Gemini 3.8 Live Extended Thinking は、これまでにない最も高度なライブ対話モデルです。知性と並列推論における大幅なアップグレードにより、より直感的に共同作業を行い、音声を使用して複雑なタスクを実行できるようになりました。 Tom Ouyang プリンシパルエンジニア Malini Jaganathan テクニカルスタッフ、Gemini Audio Team を代表して 音声要素はブラウザでサポートされていません。 AI生成の要約を聞く 私たちは、音声対話をより自然で流暢、かつインテリジェントにするために、Gemini 3.8 Live と Gemini 3.8 Live Extended Thinking をリリースします。これらのモデルは、複雑な推論、リアルタイムの視覚的コンテキスト、および会話を中断することなくバックグラウンドでタスクを実行することを処理します。これらの機能は、Gemini API、Google Workspace、および Gemini アプリを通じて本日より利用可能です。 要約は Google AI によって生成されました。生成AIは実験的なものです。 よりスマートな音声AIを実現する「Gemini 3.8 Live および 3.8 Live Extended Thinking のご紹介」をチェックしてください。Gemini 3.8 Live は、リアルタイムの視覚および言語サポートを備えた、高速で流暢な会話を提供します。3.8 Live Extended Thinking を使用すると、会話を流暢に保ちながら複雑なタスクを処理できます。これらのモデルはバックグラウンドでツールを管理するため、会話を続けることができます。これらの新機能は、Google Workspace、Search、および Gemini アプリで試すことができます。 要約は Google AI によって生成されました。生成AIは実験的なものです。 Google は、デバイスとの会話をはるかに自然に感じさせる2つの新しいAIモデルをリリースしました。それらは、割り込みを処理し、言語を切り替え、作業中に思考プロセスを説明することさえできます。複雑な問題を解決する場合でも、単にチャットする場合でも、AIは実際にあなたを聞き、一緒に考えているように感じられます。これは、AIを実際の会話パートナーのように感じさせるための大きな一歩です。 要約は Google AI によって生成されました。生成AIは実験的なものです。 他のスタイルを探す: 一般的な要約、箇条書き、基本的な説明 本日、私たちは、音声エージェントをより効果的に有効にし、AIとの会話をより直感的でインテリジェントに感じさせるために、ニアリアルタイム推論の進歩をもたらす2つの新しいモデルを発表します。 Gemini 3.8 Live: 会話インテリジェンスと流暢な対話および視覚的グラウンディングを組み合わせ、スケーラビリティとコスト効率のために構築されています。 Gemini 3.8 Live Extended Thinking: 高度な複雑なタスクのために構築されており、知性と複数ステップの推論が増加しています。 開発者や企業にとって、これらのモデルは信頼性が高く、本番環境に対応した音声エージェントのビルディングブロックを提供します。また、Gemini アプリ、Google Workspace、および Search 全体で Gemini との会話をより流暢で共同作業に適したものにし、音声のみを使用して複雑なタスクに取り組むのに役立ちます。 より流暢でインテリジェントな会話を体験する Gemini 3.8 Live Extended Thinking は、エンタープライズグレードのタスク完了とインテリジェンスを提供し、Artificial Analysis の Speech to Speech Quality Index (82.6) で総合1位を獲得し、τ-Voice で 68.6%、Sierra の τ-Voice-banking ベンチマークで 35.1% を達成して、エージェントタスク完了でリードしています。また、Big Bench Audio で 97.7% を記録し、強力な推論能力を提供しながら、他の最先端モデルと比較して非常に競争力のある価格帯を維持しています。 Gemini 3.8 Live は、ユーザーから高い評価を得ており、Speech Agent Arena で2位を獲得しています。このパフォーマンスに加えて、コスト効率も高く、開発者や企業にスケーラビリティのために構築された、有能で効率的なモデルを提供します。ServiceNow の EVA-Bench(音声エージェントを評価するためのベンチマーク)では、当社のモデルは、精度と会話品質のバランスをうまく取ることで、複雑なワークフローのパレートフロンティアを押し上げています。注: これは Gemini Enterprise Agent Platform の Live API で実行されました。 Gemini 3.8 Live は、ニアリアルタイムで視覚入力を処理し、より役立つ応答のために会話をコンテキストで豊かにします。会話中に97のサポート言語を自動的に検出し、切り替えます。タスクがバックグラウンドで完了する間、モデルはリクエストを認識し、チャットを続けることができるように、会話を継続しながらツールとAPI呼び出しをバックグラウンドで実行します。 Gemini 3.8 Live は、視覚的コンテキストを使用してライブ質問に回答し、リアルタイムで従業員のオンボーディングをガイドします。 Gemini 3.8 Live が、視覚的コンテキスト、推論、および自然な会話フローを使用して、ニアリアルタイムでチェスをプレイする様子をご覧ください。 より深い推論を必要とするタスクの場合、3.8 Live Extended Thinking は同時に推論し、話します。これは、複雑なワークフローのための知性を高め、中断のない会話フローを維持します。「確認させてください…」のような早期の音声合図を使用してプロンプトを自然に認識し、ライブ進捗状況のナレーションを使用して、進行中の複数ステップのバックグラウンドタスクをユーザーに案内します。 Gemini 3.8 Live Extended Thinking が、生のスケッチとニアリアルタイムの音声フィードバックを機能的なReactコンポーネントに変換する様子をご覧ください。 Gemini 3.8 Live Extended Thinking が、自然なライブ会話を中断することなく、複数ステップの予約と非同期関数呼び出しを調整する様子をご覧ください。 Gemini 3.8 Live が、自然な音声を通じて、オンザフライで完全な事業計画とカスタムマーケティングツールキットを構築する様子をご覧ください。 Google Workspace および Search 全体で、当社の Live モデルは、特に最も複雑なタスクに取り組む際に、より直感的で共同作業に適したエクスペリエンスを提供します。Google Workspace の Docs Live、Gmail Live、および Keep Live で Gemini 3.8 Live Extended Thinking を試してください。Search Live 内で、Gemini 3.8 Live によって強化されたステップバイステップのリアルタイムトラブルシューティングヘルプを入手してください。 開発者およびエンタープライズ音声エコシステムの強化 Gemini Live API を使用することで、Agora、Fishjam、LangChain、LiveKit、Pipecat、Vercel、Vision Agents などの開発者プラットフォームにより、開発者は高性能な音声駆動インターフェイスを簡単に構築およびデプロイできます。これらのプラットフォームは、バックグラウンドで複雑なリアルタイムメディアストリーミングインフラストラクチャを管理するため、開発者はユーザーエクスペリエンスの作成に完全に集中できます。 また、Salesforce、Genspark、Lumeris といった企業とも提携しており、それらの企業は 3.8 Live および 3.8 Live Extended Thinking の印象的なレイテンシ、流暢さ、およびツール呼び出し機能を高く評価しています。 SynthID ウォーターマーキングによる透明性の確保 当社のAI製品によって生成されたすべての音声は、SynthID でウォーターマークが付けられます。この知覚できないウォーターマークは、音声出力に直接織り込まれており、AI生成コンテンツが検出可能であることを保証し、誤情報の拡散を防ぐのに役立ちます。安全性と責任に対する当社の取り組みの詳細については、モデルカードを確認してください。 最新の Gemini Audio モデルの使用を開始する: 3.8 Live は本日より展開されます: 開発者向け: Gemini API および Google AI Studio 企業向け: Gemini Enterprise でプライベートプレビュー、および Gemini Enterprise for Customer Experience にて近日提供予定 すべての方へ: Search Live 3.8 Live Extended Thinking は本日より展開されます: 開発者向け: Gemini API および Google AI Studio 企業向け: Gemini Enterprise でプライベートプレビュー、および Gemini Enterprise for Customer Experience および Google Workspace ビジネス顧客向けに近日提供予定 すべての方へ: Gemini Live および Workspace の Docs では Google AI Pro および Ultra 加入者向け、Gmail および Keep ではすべての Google AI 加入者向け Google からの最新ニュースをメールで受け取る 製品アップデート、イベント情報、特別オファーなどのニュースレターに登録してください。 完了しました。あと1ステップです。受信トレイを確認して、登録を確定してください。別のアドレスで登録することもできます。お客様の情報は Google のプライバシーポリシーに従って使用されます。いつでもオプトアウトできます。 投稿先: