AI・機械学習
Grok Voice Transcribe 2.0
Grok Voice Transcribe 2.0 (x.ai)
要約
SpaceXAIは、精度が向上しコスト効率も優れた最新の音声認識モデル「Grok Voice Transcribe 2.0」を発表しました。このモデルは、実際の環境での評価において、既存のモデルと比較して2倍の精度を持ちながら価格は据え置きです。特に、電話音声や複数の話者が混在するノイズの多い状況での精度が大幅に向上しており、既存のAPI連携ではコード変更なしで利用可能です。
全文翻訳
ニュースに戻る
2026年9月18日
Grok Voice Transcribe 2.0を発表
SpaceXAIの最新音声認識モデル、比類なき精度とコスト効率を実現
ライブで試す
ドキュメントを見る
本日、私たちは最新の音声認識モデルであるGrok Voice Transcribe 2.0をリリースします。実際の評価において、Grok Voice Transcribe 2.0は現在利用可能な音声認識モデルの中で最も精度の高いものの一つであり、価格据え置きでGrok Voice Transcribe 1.0の2倍の精度を誇ります。Grok Voice Transcribe 2.0は、Grok Voiceの基盤となるオーディオモデル上に構築されています。Grok Voiceは既に、1日あたり数万件のカスタマーサポート通話に電力を供給し、数百万時間分のビデオナレーションを文字起こしし、Tesla車両のGrokアシスタントを含む物理的な製品で音声エージェントを実行しています。このモデルは、多様な環境で録音された、ライブでノイズが多く多言語の音声データセットでトレーニングされ、ポストトレーニングで洗練されています。その結果、実際の環境での音声認識において最も精度の高いモデルの一つとなっています。
精度
ほとんどの音声認識モデルは、クリーンで単一話者の音声に対しては良好な性能を発揮します。しかし、実際の音声はより困難です。不安定な電話回線、競合する声、現地のアクセント、電話番号やメールアドレスの読み上げなどがあります。私たちは、あらゆる条件と環境における最も困難な音声に対応するために、Grok Voice Transcribe 2.0を開発しました。公開されているArtificial Analysisのリーダーボードでは、Grok Voice Transcribe 2.0は32のストリーミングモデルの中で精度で第1位にランクされています。
精度 vs 価格
上方向と右方向が良いことを示します。
ストリーミング
バッチ
2%
3%
4%
5%
6%
7%
8%
$0
$3
$6
$9
$12
$15
$18
単語エラー率 (%)
• 良い方向→
価格 ($ / 1,000分)
• 良い方向→
Grok Voice Transcribe 2.0
Grok Voice Transcribe 1.0
Muse Voice Transcribe
Scribe v2 Realtime
GPT Live Transcribe
Gemini 3.5 Transcribe Live
Universal-3.5 Realtime Pro
Chirp 3 Streaming
Azure STT Real-time
Nova-3 Realtime
Flux
出典: Artificial Analysis 社内評価
公開ベンチマークに加えて、私たちは本番トラフィックから抽出した4つの社内データセットで単語エラー率を測定しています。これらは、カスタマーサポート通話からの電話音声、Grokとの会話、アカウントコードやメールアドレスなどの音声認証情報、そして短い多言語音声コマンドです。Grok Voice Transcribe 2.0は、これら4つすべてにおいてGrok Voice Transcribe 1.0を改善しており、電話音声においてはテストした全てのモデルをリードしています。
電話音声 (8 kHz)
カスタマーサポート通話 ・英語
会話
Grokとの会話 ・英語
認証情報
電話番号、メールアドレス、住所 ・英語
短いフレーズ
音声アシスタントの指示 ・19言語
多言語
Grok Voice Transcribe 2.0は数十言語を文字起こしし、自動的に言語を検出し、単一パスで録音中の言語切り替えにも対応します。多言語精度は、Grok Voice Transcribe 1.0からの最大の改善点です。
文字起こし精度
単語エラー率 (%)
低いほど良い
Grok Voice Transcribe 2.0
Grok Voice Transcribe 1.0
ElevenLabs Scribe v2
Deepgram Nova-3
短いフレーズ(車内コマンドなど)は、モデルが言語を特定するためのコンテキストがほとんどありません。私たちの短いフレーズデータセットでは、単語エラー率が20.6%から6.8%に低下します。
機能
Grok Voice Transcribe 2.0は、高度な設定と制御をサポートしています。既存の音声認識API連携では、コード変更なしで精度の向上が得られます。
バッチおよびストリーミング。
録音されたファイルやURLを文字起こしするか、リアルタイムで音声ストリームを文字起こしします。
単語レベルのタイムスタンプ。
各単語には正確な開始/終了時刻と信頼度スコアが付与されます。
話者ダイアライゼーション。
トランスクリプト内の各話者を、追加費用なしでラベル付けします。
マルチチャンネル文字起こし。
最大8チャンネルを個別に文字起こしします。
重要語句バイアス。
製品名や医療用語など、リクエストごとに最大100個のドメイン用語を渡すことができます。
テキストフォーマット。
数字、日付、通貨、電話番号、メールアドレスは、書かれた形式で返されます。
フィラーワード除去。
「えー」「あのー」などのフィラーワードをトランスクリプトから除外します。
スマートターン検出。
音声エージェントのために、話者のターン終了を検出します。
Grok Voiceの活用事例
Atlassian Loom
Atlassian Loomは、画面録画の記録と共有に広く使用されています。Atlassianは、Grok Voice Transcribe 2.0が既存のソリューションよりも高精度であると判断し、現在全てのビデオの文字起こしに使用しています。高精度なトランスクリプトは、新しいAIワークフローを開きます。Loomでアクションプランを記録し、そのトランスクリプトをCursorにパイプすると、コードの更新が直接行われます。「私たちは、仕事を前進させる最良の方法は、一度コンテキストをキャプチャし、それがどこにでも流れるようにすることだと常に信じてきました。GrokがLoomの音声認識を強化し、Cursorがそれをコードに変換することで、コンテキストからコードへのループを閉じています。つまり、意図したことを記録すれば、仕事が完了するのです。これはAI支援開発の進むべき道のりの一端を示しています。」Sanchan Saxena, SVP of Teamwork Collection, Atlassian
価格
Grok Voice Transcribe 2.0の価格は、Grok Voice Transcribe 1.0と同じです。バッチ文字起こしはオーディオ1時間あたり0.10ドル、ストリーミングはオーディオ1時間あたり0.20ドルで、ダイアライゼーション、タイムスタンプ、重要語句はすべて含まれます。
バッチ
USD / オーディオ時間
ストリーミング
USD / オーディオ時間
Grok Voice Transcribe 2.0
Grok Voice Transcribe 2.0
Grok Voice Transcribe 1.0
Grok Voice Transcribe 1.0
Grok Voice Transcribe 2.0は、まもなく音声認識APIのデフォルトになります。Grok Voice Transcribe 1.0は数週間以内に廃止される予定です。移行期間中にこれを使用し続けるには、grok-voice-transcribe-1.0をピン留めしてください。
Grok Voice Transcribeで開発を開始する
ライブで試す
ドキュメントを見る