AI・機械学習
Inertia-1: 統一モーション基盤モデルへのオープンな探求
Inertia-1: An Open Exploration to a Unified Motion Foundation Model (yang-ai-lab.github.io)
要約
Inertia-1は、人間の動きを理解するための統一された基盤モデルを目指す研究プロジェクトです。このモデルは、手首の加速度計データで事前学習された後、体の他の部位や異なるセンサー、さらには低いサンプリングレートでも、様々なタスク(活動認識、歩行分析、長期的な健康予測など)に汎用的に適用できることが示されています。これにより、モーションデータの断片化された分野を統合し、より効率的でロバストなモーション分析が可能になります。
全文翻訳
配置転移
手首から全身へ
手首のみで事前学習されたモデルが、見たこともない腰、足首、胸などの配置に転移します。
マルチストリーム
1つのセンサーが複数になる
追加のセンサーや配置を融合させると、精度が向上します。ストリームは冗長ではなく補完的です。
レートロバスト
1 Hzから20 Hzまで安定
事前学習された表現は、低いサンプリングレートでも強力なままですが、より細かいレートは微妙な健康信号を助けます。
タスクユニバーサル
1つのモデル、すべてのタスク
同じバックボーンが、活動認識、歩行分析、長期的な疾患予測を可能にします。
健康インサイト
動きが健康として読み取られる
受動的な動きは、長期的な健康マーカーを運び、日常の動きを臨床結果に結びつけます。
デバイスアグノスティック
デバイスとセンサー間で機能する
新しいデバイスやセンサーモダリティに対してロバストなので、ウェアラブルに搭載されているものに接続できます。
Inertia-1
統一モーション基盤モデルへのオープンな探求
お問い合わせ
大きなアイデア
1つの一般的なモーションモデルへ
動きは普遍的ですが、それに対応するモデルはそうではありませんでした。Inertia-1は、モーションモデルの全景を1つの屋根の下に集めます。
01断片化された分野
データセットは、サンプリングレート、ウィンドウ長、センサーモダリティ、体の配置、さらには信号フォーマットといった基本的な点で意見が一致せず、各タスクには独自のカスタムモデルが用意されています。発見は、ある設定から次の設定へとほとんど持ち越されません。
02統一された探求
Inertia-1は、モーションモデルのデータ、センシング、目的、スケールといったライフサイクル全体を、孤立した個別のものとしてではなく、単一の制御された空間内で研究します。
03一般的な表現
その成果:配置、デバイス、タスクを超えて適応する1つの表現。同じバックボーンが、トレーニングされた設定をはるかに超えて機能します。
頭
胸
背中
腕
手首
手
腰
太もも
膝
すね
足首
加速度計
ジャイロスコープ
磁力計
三軸
ENMO
0.2 Hz
1 Hz
5 Hz
20 Hz
10秒ウィンドウ
30秒ウィンドウ
60秒ウィンドウ
2時間ウィンドウ
周波数領域
時間領域
活動認識
歩行検出
縦断的健康
頭
胸
背中
腕
手首
手
腰
太もも
膝
すね
足首
加速度計
ジャイロスコープ
磁力計
三軸
ENMO
0.2 Hz
1 Hz
5 Hz
20 Hz
10秒ウィンドウ
30秒ウィンドウ
60秒ウィンドウ
2時間ウィンドウ
周波数領域
時間領域
活動認識
歩行検出
縦断的健康
私たちが発見したこと
ベンチマークを超えて、Inertia-1は、モーションモデルが実際に現実世界で機能するかどうかを決定する選択肢を明らかにします。
手首で学習する。どこでも使用する。
詳細はこちら
戻る
手首で一度事前学習してから、モデルをどこにでも向けます。トレーニング中に見たことのない体の配置や、ジャイロスコープや磁力計などのセンサータイプでも、モデルは機能します。体の新しい場所ごとに再トレーニングする必要はありません。
手首の加速度計
その他のセンサー
・ジャイロ、磁力計
その他の配置
融合表現
より高い精度
・よりクリーンなモーションクラスター
より多くのストリームを追加する。より多くの信号を得る。
詳細はこちら
戻る
より多くのストリーム(追加の配置、ジャイロスコープ、磁力計)を積み重ねると、学習された表現はより正確でクリーンになり、活動はよりタイトなクラスターに分離されます。ストリームは補完的です。それぞれが他のストリームが見逃す何かを捉えています。
知っておくべきこと
センシング設計は一次的な選択肢です
どのように動きをキャプチャするかが、モデルがそれを使って何ができるかを形作ります。研究からの実用的な経験則をいくつか紹介します。
サンプリングレート
事前学習されたモデルは、活動認識では1 Hzという低いレートでも強力なままです。より細かい健康信号は、より高いサンプリングレートの恩恵を受けます。
ウィンドウ長
30〜60秒のウィンドウは、ほとんどのタスクでスイートスポットに当たります。コンテキストを捉えるのに十分長く、シャープさを保つのに十分短い。
すべての3軸を維持する
完全な三軸入力は、ベクトル大きさの要約を折りたたんだものよりも一貫して優れています。追加の軸は、保持する価値のある信号を運びます。
時間領域にとどまる
時間領域モデリングは、周波数領域再構築よりも歩行と健康のキューをより良く保持します。
仕組み
1つのパイプライン、生信号から実世界の洞察まで
一般的な表現は、3つのクリーンなステップでまとまります。
01スケールで事前学習する
ラベル不要の自己教師あり学習で、惑星規模の加速度計データ(世界中のコホートで1800万時間以上)から学習します。
02設定を超えて転移する
同じ表現を、軽いチューニング、または全くチューニングなしで、新しい配置、デバイス、サンプリングレートに適応させます。
03タスクを超えて展開する
フィットネストラッキングから臨床スクリーニングまで、1つのバックボーンから、活動、移動性、健康アプリケーションをパワーアップします。
機能
動きから意味へ
同じ表現が、モーション理解の全スペクトルをカバーします。
活動と行動
多様な集団全体で、最先端の精度で日常の活動や行動パターンを認識します。
歩行と移動性
移動性の低下や神経学的状態を示す、歩行凍結のような微妙な歩行変化を検出します。
健康と疾患
受動的な動きから長期的な健康マーカーを抽出し、日常の動きを臨床結果に結びつけます。
人間の動きのための1つの一般的なモデル
Inertia-1は、統一されたモーション基盤モデルへの最初の一歩であり、モーションデータ、新しいタスク、またはこの分野の将来に関心のある協力者へのオープンな招待状です。
論文を読む
お問い合わせ