HN 日本語サマリー

← 一覧へ戻る
AI・機械学習

Canto: 現実世界のために構築された音声モデル

Canto: A speech model built for the real world (wisprflow.ai)

17 pointsby sleepypandas5 コメント

要約

Wispr AI Labは、現実世界の様々な困難な条件下で優れた性能を発揮する新しいリアルタイム音声認識モデル「Canto」を発表しました。Cantoは、GoogleやOpenAIなどの競合モデルと比較して、実世界の音声データにおいて最も低い単語誤り率(WER)を達成しました。このモデルは、スーパーバイズドファインチューニングと強化学習を組み合わせた手法で訓練されており、今後の音声認識技術の発展に貢献することが期待されています。

全文翻訳

17.09.2026 • Research • 10 min Canto: 現実世界のために構築された音声モデル Wispr AI Lab 音声認識モデルは、制御された条件下で録音されたクリーンな音声の書き起こしにおいて、驚くほど優れた性能を発揮するようになりました。しかし、実際のディクテーションがそのような条件下で行われることは稀です。何百万人もの人々がWispr Flowを使用して、友人へのメッセージ、メールの作成、コーディング、デスクでのアイデアの検討、会議の合間、通勤中、そして賑やかなオフィスなど、様々な状況で音声入力を行っています。彼らはラップトップのマイク、イヤホン、ヘッドセットを通して話し、しばしば他の声、音楽、または交通騒音などが背景にあります。 本日、Wispr Advanced Interfaces Labは、当社の最新のリアルタイムディクテーション用音声モデルであるCantoを発表します。実世界のディクテーションの評価において、Cantoはテストした全てのモデルの中で最も低い単語誤り率を達成しました。CantoをGoogle、OpenAI、AssemblyAI、Deepgramのモデルと比較しました。 Cantoは、Wispr Advanced Interfaces Labにおける、より広範な研究開発プログラムの最初のモデルです。この記事では、その性能、困難な現実世界の条件に対処するためにどのように訓練されたか、そして次に何が来るかを形作っている研究について共有します。「本日、Wispr Advanced Interfaces Labは、当社の最新のリアルタイムディクテーション用音声モデルであるCantoを発表します。」 Ariya Rastrow CSO, Wispr Flow 現実世界の条件下でのCantoの評価 Cantoを現実世界の条件下でテストするために、私たちは2,300人以上のユニークな話者からの10時間分の英語のWispr Flowディクテーションで構成される評価セットを作成しました。これは、アプリケーションとユースケース全体からランダムにサンプリングされたものです。私たちは、話者の特性に対する過学習を避けるために、トレーニングセットとテストセットで表現される話者の間に厳格な分離を維持することに注意しました。各サンプルは、Wisprのデータ共有設定にオプトインしたユーザーからのものであり、これにより、モデルの評価と改善のために匿名でデータが使用されることが許可されます。この設定に関する詳細は、当社のデータコントロールドキュメントで入手できます。 Cantoは、比較したモデルの中で最も低い単語誤り率(WER)を達成しました。WERは、人間が書き起こした参照と比較した単語の置換、省略、挿入を測定します(低いほど良い)。 アプリケーションとユースケース全体からランダムにサンプリングされた10時間分のWispr Flowディクテーションにおける単語誤り率。 最も困難な条件下でのパフォーマンス モデルはランダムにサンプリングされたデータで良好なパフォーマンスを示しましたが、私たちは最も困難な状況でのパフォーマンスを研究することにも関心がありました。私たちは、ディクテーションが失敗する可能性が最も高い条件を特徴とする、3時間分のチャレンジ評価セットを別途構築しました。 このセットには、近くでの会話、音楽、交通、風、低い録音音量、ささやき声や遠距離からの音声の影響を受けたオーディオが含まれています。また、モデルに曖昧さを解決するための周囲のコンテキストと言語をほとんど与えない短いディクテーションも含まれています。フルチャレンジセットでは、CantoはGemini 3.1 Proに次ぐ2位でした。Gemini 3.1 Proは、リアルタイム低遅延アプリケーションには適さない、はるかに大規模なフロンティアサイズのマルチモーダルモデルです。評価したリアルタイム文字起こしモデルの中では、Cantoが最も低いWERを達成しました。 最も困難な現実世界の条件下で文字起こしモデルをストレステストするために組み立てられた3時間分のオーディオチャレンジデータセットにおける単語誤り率。 私たちはさらにこのデータセットを調査し、モデルがどのように異なる動作をするかを理解しました。Gemini 3.1 Proは、ノイズの多いオーディオで最も低いWERを達成しました。Cantoは、低音量の音声と短いディクテーションで同率の最低WERでした。短いディクテーションは、比較全体で最も高いエラー率を生成しました。発話が数語しかない場合、単一の間違いはWERに大きな影響を与え、モデルは曖昧さを解決するための言語的コンテキストも少なくなります。 オーディオチャレンジセットの3つのサブセットにわたる単語誤り率。ノイズの多いオーディオは、有意なバックグラウンドノイズ(例:交通、風、競合するバックグラウンドスピーチ)がある低SNRディクテーションによって定義されました。低音量のサンプルは、ささやき声または遠距離からの音声で構成されていました。短いディクテーションは、周囲のコンテキストがほとんどない1〜2語のサンプルでした。 公開ベンチマークでのパフォーマンス比較 また、Cantoを3つの公開英語データセット(LibriSpeech、FLEURS、Common Voice)でも評価しました。CantoはLibriSpeechで同率の最低WERでした。FLEURSとCommon Voiceでも競争力を維持しましたが、どちらの評価でもリードすることはありませんでした。 当社の評価で使用された英語サブセット(FLEURS、LibriSpeech、Common Voice)における単語誤り率。モデルはコンテキストプロンプティングなしで評価されました。これらの公開データセットは、有用で再現可能な比較を提供しますが、それらは主に読み上げ音声を含んでいます。LibriSpeechはオーディオブックから抽出され、FLEURSとCommon Voiceは主に準備された文章を読む人々の音声で構成されています。それらは、人々が自発的に話し、一時停止し、考えを修正し、しばしば非常に少ない言語的コンテキストしか提供しない、日常の「実世界の」ディクテーションとは異なる分布を捉えています。この対比は、私たちがCantoを公開データセットと実際のWispr使用の両方で評価する理由を説明するのに役立ちます。 スーパーバイズドファインチューニングと強化学習によるCantoのポストトレーニング Cantoは、数百万時間もの音声とテキストで事前学習されたモデルから始まります。その後、Cantoを2段階でトレーニングします。まず、参照トランスクリプトとペアになったオーディオをモデルに提示します。モデルは、各トランスクリプトの単語を一度に1ステップずつ予測することを学習します。この段階は、スーパーバイズドファインチューニングと呼ばれ、文字起こしタスクを実行する方法を教えます。次に、完了したトランスクリプトの品質を比較するようにモデルをトレーニングします。同じオーディオに対して、モデルはいくつかの可能なトランスクリプションを生成します。それらのスコアを基準と比較し、そのスコアを使用して、将来のトレーニングでより良いトランスクリプションをより可能性が高くなるようにします。これは、強化学習、またはRLとして知られています。 違いは、モデルがフィードバックをどのように受け取るかという点にあります。スーパーバイズドファインチューニングは、各ステップで期待される単語を提供します。強化学習は、完了したトランスクリプション(モデルによって生成された)を評価します。これにより、認識エラーの削減など、私たちが気にかけている結果を中心にトレーニングすることができます。当社の方法では、Group Relative Policy Optimization(GRPO)を使用します。中心的な考え方は単純です。各グループ内の候補トランスクリプトを比較し、それらの相対スコアから学習します。各オーディオ例について、トレーニング中のモデルからいくつかの候補トランスクリプトをサンプリングします。これらをロールアウトと呼びます。各ロールアウトは報酬を受け取ります。これは、トレーニング目標をどの程度満たしているかを測定する数値スコアです。 GRPOは、各候補の報酬を、同じオーディオに対する他の候補の報酬と比較します。アドバンテージと呼ばれる結果の相対スコアは、その候補がグループよりも良かったか悪かったかを示します。これらのアドバンテージがトレーニングの更新を導きます。 シーケンスレベルのトレーニングは、音声認識において長い歴史があります。研究者は以前、最小単語誤り率トレーニングとポリシーグラディエント法を使用してASRシステムを最適化してきました。GRPOは最近DeepSeekMathで導入され、自己回帰音声認識への直接的な応用は、GRPOをASRおよび音声ドメイン適応に適用する最近の研究でようやく現れ始めています。「私たちは、音声ロールアウトを大規模に生成およびスコアリングできるインフラストラクチャを構築し、特定の動作や障害モードを中心にトレーニング環境を構築できるようにしました。」 Wisprにとって、RLの価値は単に集計エラー率が低いだけではありません。私たちは、音声ロールアウトを大規模に生成およびスコアリングできるインフラストラクチャを構築し、特定の動作や障害モードを中心にトレーニング環境を構築できるようにしました。このシステムは現在、コンテキスト音声認識、パーソナライゼーション、話者分離、および困難なオーディオ条件に関する実験をサポートしています。リリースされたCantoモデルのトレーニングを超えて説明されている研究は、すでに次世代モデルに情報を提供しています。 修正からの学習 名前や語彙の使用は、音声モデルが再トレーニングできるよりも速く変化します。「Claude」のような単語は、かつては「cloud」の珍しい代替語でした。その使用法が変わるにつれて、実用的なジ