科学・技術
読唇術で人々が見ているものを明らかにする研究
Study reveals what people see when they read lips (news.ku.edu)
要約
カンザス大学の研究者たちは、ネットワーク科学を用いて読唇術の誤りがなぜ起こるのかを解明しました。英語の単語の約3分の1は、発話時に少なくとも他の1つの単語と視覚的に似ていることが判明しました。この研究結果は、読唇術のトレーニング改善や、AIによる読唇・文字起こし能力の向上に貢献する可能性があります。
全文翻訳
読唇術で人々が見ているものを明らかにする研究
KUの研究者たちは、英語の単語の約3分の1が発話時に少なくとも他の1つの単語のように見えることを発見しました。
クレジット: Adobe Stock
火曜日、2026年6月30日
著者 Brendan M. Lynch
共有
メールで共有
LinkedInで共有
Facebookで共有
Twitterで共有
ローレンス — カンザス大学の新しい研究は、ネットワーク科学を用いて、人々が読唇術で間違いを犯す理由を判断しています。
KUの音声言語聴覚学の教授であるMichael Vitevitch氏と彼の共著者たちは、英語の約20,000語の視覚的なマップを作成し、なぜ一部の単語が他の単語よりも読唇が難しいのかをよりよく理解することを目指しました。
結果はJournal of the Acoustical Society of Americaに掲載されています。発見は、読唇術のトレーニングを改善し、人工知能が読唇を行い、文字起こしやその他のデジタルサービスを提供する能力を高める可能性があります。
「この研究で私たちが調べたのは、人々が基本的にどのように読唇しているか、どれくらい正確か、そして特にどのような種類の間違いを犯すかということです」とVitevitch氏は述べています。「以前の研究の多くは、人々の正確度に焦点を当てており、必ずしもエラー自体の特性を見ていたわけではありません。あなたが犯す間違いからは多くのことを学ぶことができます。それが私たちが採用したアプローチでした。」
読唇術に関する以前の研究はエラーを調査していましたが、その研究の多くは、言語の音である「音素」に焦点を当て、参加者が単語の音にどれだけ近いかに焦点を当てていた音声言語研究者によって行われていました。
Vitevitch氏は異なるアプローチを取りました。「私たちは視覚的な特性に焦点を当てました」と彼は言います。「人々が単語の音をどれだけ理解しているかを見る代わりに、私たちは視覚的な特性、つまり『ビゼム』(音素の視覚的等価物)をどれだけ理解しているかを見ました。私たちは、音を聞くことなく、唇、顎、口から得られるものに焦点を当てました。見ているものから情報を得ようとしているだけです。」
「その音はどのように見えますか?それが発話されるとき。それがどのように聞こえるかは気にしません。発話されるときにどのように見えるかを気にします」と彼は言います。「時々、単語は似たように聞こえ、似たように見えます。例えば、『kit』、『cat』、『cut』などです。他の時は、単語は似たように聞こえませんが、それでも似たように見えます。例えば、『vet』、『fit』、『fuzz』などです。どちらの場合も、私の顔を見ているだけでは、一方の単語ともう一方の単語を区別することはできません。」
単語マップの分析を通じて、研究者たちは次のように判断しました。
人々は、より一般的に使用される単語に単語を誤認する可能性が高い。
発話されるとき、英語の単語の約3分の1は、少なくとも他の1つの単語のように見えます。
単語に多くの視覚的な類似単語がある場合、読唇は一貫して困難になります。
読唇の間違いはランダムには起こりません。視覚的に似た単語が視覚ネットワークの同じ領域を占めている場合に、より起こりやすくなります。
「驚きの一つは、人々がこれにそれほど得意ではないということです」とVitevitch氏は述べています。「私たちは得意だと思っていますが、実際にはそうではありません。ほとんどのエラーは、視覚的な特性が1つか2つ、つまりビゼムが1つか2つずれていることを示しています。かなりの部分を理解していますが、おそらく十分ではありません。」
Vitevitch氏によると、研究者たちの視覚マップは、単語が風景全体にどのように分布しているかを理解することを可能にしました。マップでは、単語は似て見えるときに近く、視覚的に似ていない単語は遠くに配置されました。「特定の領域は、予想よりも圧縮されている場合があります」と彼は言います。「風景は、私たちが予期していなかった方法で伸び縮みします。その伸び縮みは、読唇しようとするときの正確さに影響を与えます。それは、そうでなければ持っているよりも多くの競合相手を与えますか?それとも、それらをより遠くに移動させて、知覚的に区別しやすくしますか?」
KUの研究者は、彼のグループが読唇トレーニングに進むことを望んでいると述べました。「アイデアは、人々が時間の経過とともにエラーを追跡した場合、それらのエラーはターゲット単語に向かって縮小し始めるということです」とVitevitch氏は述べています。「遠く離れているのではなく、人々は必要な情報を拾い上げ、より正確な推測をするようになります。」
この研究の追加の応用は、自動文字起こしのトレーニングにあります。「Zoomのようなシステムは、すでに音声を文字起こしするのにかなりの仕事をしています」とVitevitch氏は述べています。「音声だけでなく、話者の顔からの視覚情報も使用した場合、それらはより良くなるでしょうか?コンピューターはパターンを見つけるのが非常に得意であり、時には人間が使用するのと同じパターンを使用します。私たちはコンピューターをより人間らしい方法で物事を行うように訓練できるかもしれません。」
Vitevitch氏は、彼のグループがこの作業をさまざまな方法でフォローアップし続けると述べました。「私たちは人々がどのようにこれを行っているかを引き続き探求し、機械学習アプリケーションに進む可能性があり、音声理解を支援する必要がある人々を助ける方法を見つけます。」
Vitevitch氏の共著者には、KUの大学院生であるMaia Flynn氏とReid Kelly氏、そしてカリフォルニア州立大学フレズノ校のLorin Lachs氏がいました。
火曜日、2026年6月30日
著者 Brendan M. Lynch
メディア連絡先
Brendan M. Lynch
KUニュースサービス
785-864-8855
brendan@ku.edu
共有
メールで共有
LinkedInで共有
Facebookで共有
Twitterで共有