HN 日本語サマリー

← 一覧へ戻る
AI・機械学習

オーディオARの台頭(2024年)

The Rise of Audio AR (2024) (dbreunig.com)

34 pointsby dbreunig23 コメント

要約

かつて期待されたVR/ARのブームが落ち着く中、スマートヘッドホン、音声認識・生成技術、AI言語モデル、そしてコンテキストデータの進化により、「オーディオ拡張現実(Audio AR: AAR)」が静かに台頭している。AARは、ユーザーの視線を奪うことなく、適切な情報を適切なタイミングで提供することを目指しており、テクノロジーとのインタラクション方法に大きな変化をもたらす可能性を秘めている。過去の試み(Microsoft Soundscape, FourSquare MarsBot)の課題を踏まえ、現在の技術的進歩がAARの普及を後押ししている。

全文翻訳

2024年4月10日 オーディオAR AR AI データ UX オーディオARの台頭 適切な情報、適切なタイミングで、見ることなく 写真:Justin Lynham しばらくの間、バーチャルリアリティ(VR)と拡張現実(AR)は次なる大きなものとして称賛されていました。Metaは年間数十億ドルをOculusの研究開発に費やし、最終的には会社の名前を変更してその注力を示しました。MicrosoftのHoloLensは多くの注目を集め、Magic Leapはテックプレスや投資家の寵児となり、Sonyは数百万台のPSVRを出荷し、Appleも何か大きなものに取り組んでいると噂されていました。しかし、その熱狂は実現しませんでした。Oculusはまだキラーアプリを見つけられておらず、AppleのVision Proをどう活用すべきか誰も正確には分かっていません。ChatGPTが登場し、AIはすぐに次の大きなものとなり、VR/ARは後回しにされました。最近のMetaでさえ、ARよりもLLaMAについて話すことの方が多いようです。しかし、静かに、異なる種類のAR、すなわちオーディオ拡張現実(AAR)のためのピースが組み合わさってきています。スマートヘッドホンの台頭、音声認識と生成の向上、AI言語モデル、そしてより良いコンテキストデータのおかげで、AARはゆっくりと確実に私たちの日常生活に浸透していくことになります。AARは、私たちの集中力を変えることなく、適切な情報、適切なタイミングで提供します。これは、私たちがテクノロジーとインタラクトする方法における記念碑的な変化であり、あなたが思うよりも早く訪れます。 オーディオARのパイオニア オーディオARの概念は全く新しいものではありません。MicrosoftのSoundscapeとFourSquareのMarsBotは、オーディオAR体験を提供する初期の試みでした。MicrosoftのSoundscapeは、主に視覚障害者向けのアクセシビリティツールとして開発されました。ユーザーが街を歩くと、空間オーディオのピンが、ランドロマットからレストランまで、周囲の関心のある場所を通知しました。これは、空間オーディオと位置情報に基づいたアラートを使用して現実を拡張する可能性を示しました。しかし、密集した都市環境では、圧倒的な騒音の洪水を作り出しました。そして郊外では、有用であるにはあまりにもまばらでした。FourSquareのMarsBotは、よりパーソナライズされた、データ駆動型のアプローチを取りました。それは、FourSquareの広範な場所データベース、その評価、レビューを活用して、ユーザーが興味を持つ可能性のある場所を予測・推奨しました。しかし、MarsBotはニューヨーク市のような高密度環境でのみ繁栄しました。それは実験であり、オーディオファーストのARアプリであることの意味について素晴らしい考えを持っていましたが、決して定着しませんでした。それは、無関係なアラートをフィルタリングするためにユーザーの注意を引きすぎ、真にパッシブであることに苦労しました。 これらのアプリやそれに類する実験は、重要な基盤を築き、オーディオARが単純なターンバイターンナビゲーション以上のものに使用できることを示しました。Soundscapeは、空間オーディオと位置情報に基づいた通知が道案内(ウェイファインディング)に役立つことを示しました。MarsBotは、パーソナライズされたデータを使用し、より人間的な通知を実験しました。しかし、私のような非常に特定の種類のオタクだけがそれに気づいたようです。それらのアイデアは、適切なイネーブルリングテクノロジーが登場するのを待って、数年間休眠状態にありました。 イネーブルリングテクノロジーの登場 近年、新しい世代のオーディオARアプリケーションを可能にするいくつかの重要なテクノロジーが登場しました。 AppleのAirPodsのようなスマートワイヤレスヘッドホンは、大規模な普及を見ており、多くの人の耳に常に利用可能でハンズフリーのオーディオインターフェースを提供しています。これらは高品質のサウンドを提供し、開発者に音量から頭の動き、生体認証まで、さまざまなコントロールとセンサーデータへのアクセスを提供します。内蔵マイクとシンプルなコントロールにより、アシスタントやオーディオアプリを簡単にトリガーできます。 音声認識は、ノイズキャンセリング、言語モデル、エッジコンピューティングの向上により、大きな進歩を遂げました。仮想アシスタントとの会話は、人間との会話とほとんど同じくらい自然に感じられるようになりました。スピーチを修正することなく、カジュアルに話すことができます。スピーチからテキストへの変換は、ネットワーク接続なしで、高速かつ正確になりました。テキストからスピーチへのエンジンは、現在、リアルなイントネーションと抑揚を備えた人間のような声を生成できます。最新のモデルは、特に短いやり取りでは、本物の人間と区別するのが難しいです。これにより、動的なコンテンツの流暢な生成が可能になります。 大規模言語モデル(LLM)は、オープンエンドの会話に従事し、フォローアップの質問に答え、ユーザーの代わりにアクションを実行することさえできます。これらは、不完全で一貫性のない音声コマンドをプログラム可能なアクションに変換し、画面なしでより複雑なインターフェースを可能にします。さらに、LLMは、どのコンテンツをいつ表示するかを決定するエンジンとして使用できます。 豊富な位置情報とコンテキストデータにより、オーディオARアプリはユーザーの環境と現在の状況を深く理解できます。これには、詳細な場所データ、リアルタイムの天気と交通情報、カレンダーとメッセージングデータなどが含まれます。このデータなしでは、適切なビットの情報を正確なタイミングで提供することは不可能です。 これらすべてを組み合わせることで、ユーザーが日常を過ごす中で、高度にコンテキスト化されパーソナライズされたオーディオコンテンツとインタラクションを提供できるようになりました。課題は、イネーブルリングテクノロジーの構築からUXの構築へと移りました。 解決すべき問題 オーディオARアプリケーションのコアUXの課題は、適切な情報を適切なタイミングで提供することです。あまりにも多くの無関係な情報があると、圧倒されてしまいます。少なすぎると、体験はあまり有用ではありません。そのスイートスポットは、非常に狭い範囲です。 この課題を説明するために、まずうまく機能するオーディオARアプリとユースケースの出発点を確立しましょう。オーディオツアーです。 数週間前、私はゲント(ベルギー)でのOverture Maps Foundationの会議(場所データのアクセス改善といえば…)に出張しました。翌朝、少し時間があったので、街のオーディオツアーをVoiceMapで試してみました。他のツアーがどれほど優れているかは分かりませんが、このツアーは完璧でした。あまりにも良かったので、オーディオARの可能性を示唆しました。 Voice Mapのツアーは、スマートフォンのGPSを使用して、特定のウェイポイントに関連付けられたオーディオの説明をトリガーすることで機能します。歩いていると、ナレーターが次の目的地を優しく案内し、次のツアーセグメントが始まる場所のランドマークを提供します。Voice Mapは、クリエイターがコンテンツを特定のルートセグメントに合わせるのを助け、(この場合)散歩中にリラックスした、しかしシームレスな体験を実現しました。カフェに立ち寄って少し休憩すると、次のキューはトリガーされず、オーディオは一時停止します。外に出ると、コンテンツが再開されます。インターフェースは私のヘッドホンと私の場所、それだけでした。しかし、ゲームデザインの用語を借りれば、私はレールに乗っていました。コンテンツと通知は、私がツアーを購入して開始したため完璧でした。Voice Appは、私がどこへ行くのか、そして私が望む情報を知っていました。 ゲントの小さな範囲では、それは完璧なオーディオAR体験でした。街全体をコンテンツとキューでカバーし、どこへでも歩けるようにするには何が必要だろうかと考え始めました。しかし、それでも、以前歩いた道をたどっている場合や、しばらく邪魔されたくない場合は、ツアーをオフにするでしょう。コンテンツカバレッジがあっても、キューはすぐに複雑になり、現在の場所以上のものが必要になります。時間帯、私のカレンダー、私の過去の場所の履歴など、すべてがコンテンツをどのように表示すべきかに影響します。 常にオンでアンビエントな体験を作成し、プロアクティブに関連情報を提供するというのは、かなりの課題です。 ツアーの後、MarsBotがまだ利用可能かどうかを調べました。利用可能ではありませんが、FourSquareの創設者でありMarsBotの作成者であるDenis Crowleyは、BeeBotという新しい会社で再び挑戦しています。BeeBotはLLMを活用してコンテンツ作成を支援し、オーディオ通知をプッシュするタイミングを決定します。Crowleyは最近、Alex KantrowitzのBig Technology Podcastでインタビューを受けました。MarsBotやSoundscapeと同様に、CrowleyのアプローチであるBeeBotは、ユーザーにコンテンツを「プッシュ」することです。これは間違いなくオーディオARのハードモードです。どのコンテンツをプッシュするかを決定するだけでなく、いつプッシュするかを決定する必要があります。 オーディオARへの参入において、Metaは逆のアプローチを取っています。写真:Phil