HN 日本語サマリー

← 一覧へ戻る
AI・機械学習

超音波によるサイレントスピーチ

Silent speech with ultrasound (alephneuro.com)

85 pointsby chrwn18 コメント

要約

本研究では、顎の下に超音波プローブを設置し、舌の動きを捉えることでサイレントスピーチ(声を出さずに話すこと)をテキストに変換するシステムを開発しました。50時間のデータセットで学習させた初期段階のシステムながら、15.6%の単語誤り率(WER)を達成し、新しい話者への汎化能力も示しています。この技術は、周囲に配慮しながらコンピューターとプライベートに会話するための新しいインターフェースとなる可能性を秘めています。

全文翻訳

超音波によるサイレントスピーチ Vadims Casecnikovs✉, Gimran Abdullin, Raffi Hotter, Lev Chizhov 2026年7月7日 比較のために、リップリーディングは100万時間のデータセットで12.5%の単語誤り率を達成します。私たちは、50時間のデータセットで学習され、わずか1ヶ月で実施された初期の調査であるにもかかわらず、私たちのシステムが既存の方法に迫っていることに興奮しています。 私たちは顎の後ろに超音波プローブを設置し、舌のこのようなビデオをキャプチャします。 そして、それを単語に変換します。ここに簡単なデモがあります。 数日前、このモデルが新しい話者にも汎化することを発見しました(アメリカ英語の発音である限り🇺🇸🦅11)。東ヨーロッパの友人たちはあまり乗り気ではありませんでした。友人たちは、プローブを持ってきて、すぐにシステムを使い始めることができました。これほど少ないデータでこれが機能するとは予想していませんでした。 サイレントスピーチ スピーチはタイピングの約4倍の速さであり、コンピューターとコミュニケーションする最も速い方法の1つです。AIが自然言語の理解に長けるようになるにつれて、私たちはSFが常に想像してきたように、単に話しかけるだけでコンピューターと対話できるようになり始めています。Wispr FlowやChatGPTの音声のようなツールで、その始まりが見られます。 しかし、通常の会話には1つの大きな制限があります。ほとんどの場合、私たちは他の人の近くにいます。コーヒーショップや地下鉄で同僚や見知らぬ人の隣に座っており、コンピューターとの会話を他の人に聞かれたくありません。 イヤホンがリスニングをプライベートにしたように、サイレントスピーチはスピーキングをプライベートにすることができます。 サイレントスピーチを検出するには、EMG、レーダー、リップリーディングなど、いくつかの方法があります。22Andy Matuschakは、ここでそして彼のPatreonで素晴らしい簡単なレビューをしています。超音波の特別な点は、画像で舌を直接、きれいに見ることができることです。EMGやレーダーのようなノイズの多い間接的な測定から推測する必要はありません。そして、それは原理的には、誰かがサイレントスピーチをしているとさえ分からないような、不可視のサイレントスピーチを可能にします。 さらに、舌はスピーチに関する多くの情報を持っています。舌は、約10〜14の視覚的に区別可能な唇の形と比較して、40の英語の音素全体で約34の異なる音素クラスを形成します。33/t/と/d/や/s/と/z/のような一部の音素ペアは、調音ではなく調音の違いが主ですが、超音波が検出できる舌の根元の微妙な違いを生み出します。 口の底から舌に伝播する顎下超音波パルス。回転するにはドラッグしてください。 データとインフラ 私たちは、サイレントスピーチを伴う超音波舌画像で独自のデータセットを収集しました。 良いモデルをトレーニングするには、データは2つの条件を満たす必要があります。(1) 超音波記録は実際に舌を示す必要があり、(2) 人は実際に言うべきテキストを言う必要があります。どちらも驚くほど困難でした。人々は疲れ、不明瞭に話し、プローブを正しく保持しませんでした。 データ収集を設定する際、最初の質問は、人々はサイレントに話すべきか、それとも声を出して話すべきかでした。 最終的にはサイレントスピーチのデコードを気にしますが、音声スピーチは人々が正しく単語を言ったかどうかを簡単に確認できます。舌の記録を見て、サイレントスピーチと音声スピーチが似た舌の動きを示すことに気づきました。これにより、音声超音波スピーチデータを収集し、オーディオを使用してデータを品質チェックし、それでもサイレントスピーチに汎化するモデルをトレーニングできると信じるようになりました。 音声データの品質チェックのために、人々には声を出して話してもらい、オーディオを文字起こしして、読むべき文章と一致するかどうかを確認しました。また、リアルタイム超音波品質分類器を使用して、プローブの位置決め不良やカップリング不良を検出し、スーパーバイザーがリアルタイムダッシュボードでセッションを監視するようにしました。 私たちは、合成生成された短い物語を声に出して読む人々の50時間のデータを収集しました。 物語は、個々のフレーズよりも読みやすく、より自然なスピーチを生み出すため、物語を使用しました。人々は読書のフローを維持できますが、私たちはデータに含まれるものを制御できます。広範な語彙、異なる文構造、記事や短縮形のような難しいケースです。 トレーニング タスクは説明するのは簡単ですが、解決するのは困難です。舌の超音波ビデオが与えられた場合、話されたテキストを予測します。 すべてをゼロからトレーニングする代わりに、すでに有用なことを知っているモデルから始めました。ビデオにはResNet-18 2+1d、音声デコードにはWhisper Baseを使用しました。 Whisperは強力な音声認識モデルです。そのデコーダーは、音声埋め込みをテキストに変換できる事前学習済みモデルとして有用であることがわかりました。私たちのビデオ埋め込みをWhisperの埋め込み空間に転送するだけで済みました。そのために、舌ビデオエンコーダーの埋め込みを、対応する音声のWhisperエンコーダー出力の埋め込みにできるだけ近づけるようにトレーニングしました。 データセットはまだ限られていたため、最小のWhisperデコーダーを使用しました。初期のトレーニングは不安定でした。モデルは崩壊するか、言語の事前知識に過度に依存しました。しかし、約20,000サンプル後、私たちは望むような間違いを見始めました。「アコースティック」の代わりに「ア・キー・スティック」、「ハード」の代わりに「ハート」、その他いくつかです。 これらのエラーは、それまで見た多くの正解よりも励みになりました。それらは、モデルが単に可能性のある単語シーケンスを予測するのではなく、信号自体から汎化し、音素構造を学習し始めていることを示唆していました。 より多くのデータを収集し、より多くのアブレーションを実行し、より良いモデルをトレーニングし、後処理を改善する(複数の候補出力を生成する、ビームサーチを使用する、文長認識を組み込む、またはLLMをジャッジとして使用するなど)ことで、内部のオープンボキャブラリークロススピーカー検証セットで15.6%の単語誤り率(WER)を達成しました。44サイレントスピーチの数値は、タスクが論文ごとに大きく異なるため、混乱しやすいです。多くの低WERシステムは、固定コマンドセット、表示されるリップビデオ、または埋め込みセンサーを使用します。私たちが発見した最も近い超音波のみのクロススピーカーベースラインは、TaLで83.8%のWERを報告しています。私たちのシステムは、舌の超音波のみで約50時間のデータから15.6%のWERを達成しています。 単語誤り率は、データセットが増えるにつれて(15kサンプルで102%から50kで15.6%へ)低下し続け、まだ平坦化の兆候は見られません。 将来 これはまだ初期のプロトタイプであり、消費者向け製品ではありません。2つの最大のハードウェアの課題は、超音波プローブのサイズと重量を削減し、超音波ゲルをハイドロゲルなどのより実用的なカップリング材料に置き換えることです。どちらも解決可能だと考えており、プローブが最終的に軽量なウェアラブルまたは粘着パッチになることを可能にします。 約50時間のデータと1ヶ月で構築されたシステムで、すでに話者間で汎化するオープンボキャブラリー文字起こしが見られます。現在のバージョンは、アメリカ以外のアクセントにはまだ苦労しています。しかし、より多くのデータ、より良いモデル、そしてより小さな超音波ハードウェアは、これを研究デモから人々が実際に日常生活で使用できるものへと移行させるはずです。 謝辞 データ収集の監督とデータ品質の維持に協力してくれたEvanとAngelina、そして顎の下のプローブに物語を読み上げてくれたすべての人々に感謝します。 また、データ収集が破綻しないようにしてくれたCharlie Wang、データ収集のセットアップをしてくれたCynthia Kwan、アニメーションのヘルプをしてくれたThomas Ribeiro、ビデオ撮影のために一晩中いてくれたAlex Pokras、データキュレーションパイプラインのセットアップを手伝ってくれたClaire Wang、多くのプローブを作成してくれたMustafa Toumi、インフラストラクチャのセットアップを手伝ってくれたArtem Brustovetskii、製品、デモ、モデルアーキテクチャに関する素晴らしいアイデアを提供してくれたGalen Mead、そしてビデオとローンチの多くを監督してくれたDonald Jewkesにも感謝します。