HN 日本語サマリー

← 一覧へ戻る
AI・機械学習

時系列予測の不合理な難しさ

The unreasonable difficulty of time series forecasting (suzyahyah.github.io)

106 pointsby suzyahyah42 コメント

要約

時系列予測は、他のシーケンス学習タスクや独立同分布(IID)の機械学習問題と比較して、なぜこれほど難しいのかを探求する記事です。多くの最新モデルや基盤モデルでさえ、特に季節性が強いデータでは単純な統計モデルやゼロショットモデルに劣る場合があることが示されています。これは、時系列データが単一の実現値の軌跡であり、独立したサンプルではないこと、信号対雑音比が低いこと、実効サンプルサイズが小さいこと、そして分布シフトの影響を強く受けることに起因すると分析されています。

全文翻訳

プレビュー 最近、時系列予測問題が他のシーケンス学習タスクや独立同分布(IID)の機械学習問題と比較して、なぜそれほど難しいのかについて考えてきました。まず、予測問題の難しさを示すための動機付けとなるベースラインをいくつか示します。 統計モデル(Naive、AutoARIMA、Theta、MSTL、Seasonal-Naive)、線形/トランスフォーマーニューラルモデル(DLinear、NLinear、PatchTST)、勾配ブースティングツリー(LightGBM)、ゼロショット基盤モデル(Chronos、TimesFM、TTM)、そして「AI」LLMに数値シーケンスの継続を促したもの(Claude Opus、Haiku)を、ベンチマークデータセットであるm4_hourly、m4_daily、etth、exchange、electricity、bitcoinに対して実行しました。 これらはインタラクティブなプロットです。凡例をクリックすると線が非表示になり、ダブルクリックすると線が孤立します。視覚化のために、履歴セクションは予測ウィンドウの3倍に切り詰められています。 結果 見るべき線はたくさんありますが、ベンチマーク研究の主な教訓は、m4_hourlyのような強い安定した季節性を持つ系列では、単純な統計ベースライン(Seasonal-Naive、MSTL)とゼロショット基盤モデルが圧倒的な差で勝利するということです。しかし、洗練されたモデルは多くの時系列タスクで完全に的外れになり、予測が完全に間違った方向にトレンドする可能性があるため、ナイーブな予測因子と大差ないことがよくあります。 おそらく、予測が因果情報(特に為替レートのような実世界のデータでは予測に不可欠)を考慮していない、といった直感を持っているでしょう。しかし、それらの「特徴」があっても、人々は市場で簡単に儲けているわけではありません。また、多くのML問題では、因果的要因に関する完全な情報がなくても、合理的な、あるいは少なくともランダムウォークよりも優れた予測を行うことができます。したがって、この記事では予測問題の本質と、それが古典的な機械学習よりもはるかに難しい理由を調査します。 何が起こっているのか? なぜ時系列(予測)は難しいのか 問題定義 予測とは、観測値の履歴シーケンス $y_{1:t}$ に基づいて、確率変数(または変数のセット)の将来の値を推定する行為です。目標は、予測ホライズン $h imes 1$ を将来の時刻 $t + h$ における変数の値を予測する予測関数 $f$ を学習することです。 $\\\hat{y}_{t+h} = f(y_{1:t})$ この問題定義にはいくつかのバリエーションがあります。外生変数を用いて予測する場合、$f(y_{1:t}, x_{1:t})$ となり、予測は系列とともに観測される外部ドライバー $x$(天気、プロモーション、価格)にも条件付けられます。ポイント予測ではなく確率的予測を行う場合は、$p(y_{t+h} imes ext{y}_{1:t})$ となります。複数の系列を扱う場合は、$f(y_{1:t}, v_{1:t}, ext{etc.})$ となります。これは基盤モデルの設定です。 時系列データはデータ生成プロセスから生じ、IIDではない 今日のMLの状況では、複雑な非線形予測因子 $f_ heta: X ightarrow Y$ を学習するための強力で確立されたアルゴリズム(ディープラーニング企業)があります。ここで、$(x, y) imes p(x, y)$ は、最大尤度推定トレーニングによって、トレーニングデータセットに対する期待損失を最小化します。 $\\\min_ heta ext{E}_{(x, y) imes p(x, y)} [ ext{l} (f_ heta (x), y)] ext{ approx } ext{min}_ heta rac{1}{n}\\\sum_{i=1}^n [ ext{l} (f_ heta (x_i), y_i)]$ しかし、時系列は、データ内の信号と予測の関係のために、このセットアップとは根本的に異なります。時系列では、$n$個のサンプルではなく、$t$個の時間ステップにわたる単一の実現値/軌跡を観測しています。対照的に、IID機械学習は、$p$(データ生成分布)から独立した$n$個のサンプルを取得します。時系列データは、データ生成分布ではなく、データ生成プロセスから生じます。そして、重要な含意は、データのシーケンスは個々のIIDデータポイントではなく、パス全体に対する同時確率分布であるということです。 $p(y_1, y_2, ext{..., } y_t) = p(y_1) ext{ prod}_{i=2}^t p(y_i ext{ | } y_{i-1}, y_{i-2}, ext{..., } y_1)$ この因数分解は任意の同時分布に対して成り立ちます。しかし、古典的MLフレームワークのIID仮定の下では、過去からの条件付けがドロップされるため、予測問題は大幅に単純化されます。eq(1)からの多くの学習仮定は成り立たず、時系列は学習に固有の課題をもたらします。 特に、時系列は信号対雑音比が低い(特徴が乏しい) 時系列には「データの不足」がある 時系列は分布シフトの影響をはるかに受けやすい 1. 時系列は信号対雑音比が低い(特徴が乏しい) 機械学習問題との大きな違いは、時系列では信号が乏しいことです $f(y_t ext{ | } y_{<t})$。一方、IID MLでは、答えは豊かな特徴空間にあり、$f(y_n ext{ | } x_n)$ を予測します。興味深いことに、言語モデリングもシーケンシャルな自己回帰予測問題ですが、LLMによって「解決済み」に近いと考えられています。違いは、言語が高い意味内容を持ち、単語(トークン)が文脈と次のトークンの間に高い相互情報量を持つことです。一方、実数値シーケンスは信号がほとんどありません。 2. 時系列には「データの不足」がある これは直感に反する声明かもしれません。なぜなら、様々なソースから、時にはミリ秒単位の測定値で、大量の時系列データを持っているのではないか?テキストや画像ほどインターネット上に時系列データが多くないかもしれませんが、それでも少なくはないように思えます。問題は、高い自己相関が実効サンプルサイズを縮小することです。系列のTタイムステップで相関のあるデータがある場合、TタイムステップはT個の独立した情報を持たないため、実効サンプルサイズはT未満になります。$y_{t+1}$ を予測することを学習しても、$y_t$ よりも多くのことは学んでいません。重要な実効サンプルサイズは、タイムスタンプではなく、サイクルです。つまり、非自己相関予測につながる時系列の実現値です。景気後退につながるパターンを学習していた場合、実効サンプルサイズとして過去$m$回の景気後退しかありません。これはベンチマークから観察できます。m4-hourlyは、それぞれ完全な日次サイクルに寄与する数千の短い系列であり、実効サンプルサイズは単一系列の長さよりもはるかに大きいため、強い季節性を示し学習可能ですが、単一の長い為替レートパスは学習するための独立した例をわずかしか提供しません。 3. 時系列は分布シフトの影響をはるかに受けやすい ML問題では、分布シフトの問題は通常、ある程度の時間が経過してから現れます。時系列の場合、分布シフトの問題は、タスクの時間的性質のために、トレーニング中および推論中にも見られます。特に、予測は補間ではなく外挿です。時間インデックス $t$ はテスト時にのみ値 $> T$ を取り、基盤となるダイナミクスのいかなる変化にも脆弱です。古典的機械学習の設定では、テストポイントも分布外である可能性がありますが、少なくとも保証されているわけではありません。イベント駆動型で継続的にドリフトする系列である為替やビットコインでは、洗練されたモデルはナイーブなモデルより優れていないのは、すべての予測が分布シフトしたシーケンスへの外挿であるためです。 実際に何を学べるのか? 低い信号対雑音比、データの不足、分布シフトはすべて、データ生成プロセス(多くのIIDドローの代わりに1つの依存パス)の結果です。時系列には多くの課題があるため、何を学ぶことができると期待できるでしょうか?単一のプロセスを学習可能にするものは何でしょうか?確率的データ生成プロセスは、実現されたシーケンス(プロセスからのデータサンプリング)からプロセスプロパティを推定することを可能にする3つの主要なプロパティ(定常性、エルゴード性、自己相関)を持たなければなりません。 定常性。プロセスが定常であれば、その同時分布は時間シフトに対して不変です。定常性の厳密な定義は、時系列の部分シーケンスの同時分布が、すべての時間ラグ/シフト(h)で同じであることを意味します。 $p(