AI・機械学習
TabPFNとTabICL対調整済みXGBoost:学習しないモデルが14/14で勝利
TabPFN and TabICL vs. tuned XGBoost: the model that doesn't train won 14/14 (efraingaray.com)
要約
TabPFNとTabICLは、学習せずにテーブルデータ上で予測を行い、調整済みのXGBoostを上回るという主張を持つモデルです。この主張を検証するため、14のデータセットでテストが行われました。その結果、学習しないモデルが14全てのデータセットで勝利し、その優位性は予想以上に長く持続することが示されました。
全文翻訳
モデルベンチマークGPUデータ
TabPFNとTabICL対調整済みXGBoost:学習しないモデルが14テーブル中14で勝利
TabPFNとTabICLの主張は、学習することなくテーブル上で予測を行い、それでも調整済みのブースティングを上回るというものです。私はこれをGrinsztajnベンチマークの14のデータセットで、全員に同じ分割とストップウォッチを使用して測定しました。学習しない方が勝ち、その優位性は32,000行まで持続し、最も引用されているモデルはアカウントなしではダウンロードできなくなりました。
Efrain Garay 2026年8月17日 2026年8月18日
要約を聴く
0:00
再生要約
この主張は数ヶ月前から広まっており、測定可能なほど具体的です。つまり、テーブル基盤モデルは、学習することなくテーブル上で予測を行い、それでも調整済みのブースティングを上回るというものです。それが真実であれば、半世紀の慣習は形を変えます。ハイパーパラメータの検索は必須のステップではなくなり、時には報われない贅沢になります。そこで私は、14のデータセット、4つの競合、そして全員に同じストップウォッチで、自分でテストしました。
お使いのブラウザはHTML5ビデオをサポートしていません。
ナレーション付き33秒:2つのボットがテーブルを巡って競います。片目のボットが見て答え、ギア付きのボットは返信する前に25の組み合わせを試します。すべての数字は測定されたものです。デフォルトではミュートされています:コントロールでオンにしてください。
リールビューアで見る →
これらのモデルは何をするのか
テーブル基盤モデルは、意図的に生成された何百万もの合成テーブルで事前学習されています。新しいテーブルが到着すると、単一の重みも調整しません。トレーニング行をコンテキストとして受け取り、1回のフォワードパスで予測を生成します。これは、言語モデルで既に知られているのと同じインコンテキスト学習のアイデアであり、単語から列に移動したものです。そのため、「トレーニング」という動詞は奇妙に聞こえます。コードはまだfitと呼んでいますが、内部には勾配降下法はなく、カードへのデータのコピーがあります。これも、コストが予期しない場所で発生する理由を説明しています。ツリーモデルとは正反対で、fittingはほぼ無料であり、予測がお金がかかります。
そのように言うと抽象的に聞こえるので、1行の完全な旅程を以下に示します。リクエストが空のセルで到着し、モデルはそれを既に発生したすべてのものと比較し、1回のパスで解決して将来の予測を返します。
私が測定した6つのケースのいずれかを選択して、実際のデータで確認してください。
デフォルトリスク
販売キャンペーン
臨床再入院
再犯
電力需要
分子スクリーニング
?
リクエスト
コンテキスト
単一パス
予測
クレジットカード申請が到着
2 100件の申請が既に処理済み・10列
clf_num/credit.csv
TabICL・調整なし・0.8秒
返済するか?
返済
デフォルト
AUC 0.8528
credit
連絡先がリストに入る
2 100件の通話が既に完了・7列
clf_num/bank-marketing.csv
TabICL・調整なし・0.8秒
電話する価値はあるか?
サインアップ
しない
AUC 0.8699
bank-marketing
患者が退院する
2 100件の過去の退院記録・7列
clf_num/Diabetes130US.csv
TabICL・調整なし・0.8秒
再入院するか?
再入院
しない
AUC 0.6484
Diabetes130US
ケースが評価される
2 100件の過去のケース・11列
clf_cat/compas-two-years.csv
TabICL・調整なし・0.6秒
再犯するか?
再犯
しない
AUC 0.7329
compas-two-years
市場期間が終了する
2 100件の過去の期間・7列
clf_num/electricity.csv
TabICL・調整なし・0.8秒
価格は上がるか下がるか?
上昇
下降
AUC 0.8873
electricity
候補分子が到着する
2 100件の既に分析された分子・419列
clf_num/Bioresponse.csv
TabICL・調整なし・6.0秒
生物学的応答を引き起こすか?
活性
不活性
AUC 0.8667
Bioresponse
?
リクエスト
コンテキスト
単一パス
予測
クレジットカード申請が到着
2 100件の申請が既に処理済み・10列
clf_num/credit.csv
TabICL・調整なし・0.8秒
返済するか?
返済
デフォルト
AUC 0.8528
credit
連絡先がリストに入る
2 100件の通話が既に完了・7列
clf_num/bank-marketing.csv
TabICL・調整なし・0.8秒
電話する価値はあるか?
サインアップ
しない
AUC 0.8699
bank-marketing
患者が退院する
2 100件の過去の退院記録・7列
clf_num/Diabetes130US.csv
TabICL・調整なし・0.8秒
再入院するか?
再入院
しない
AUC 0.6484
Diabetes130US
ケースが評価される
2 100件の過去のケース・11列
clf_cat/compas-two-years.csv
TabICL・調整なし・0.6秒
再犯するか?
再犯
しない
AUC 0.7329
compas-two-years
市場期間が終了する
2 100件の過去の期間・7列
clf_num/electricity.csv
TabICL・調整なし・0.8秒
価格は上がるか下がるか?
上昇
下降
AUC 0.8873
electricity
候補分子が到着する
2 100件の既に分析された分子・419列
clf_num/Bioresponse.csv
TabICL・調整なし・6.0秒
生物学的応答を引き起こすか?
活性
不活性
AUC 0.8667
Bioresponse
銀行で最も繰り返されるケース:誰に貸し付けるかを決定する。
データセット
サイズ
TabICL
TabPFN
調整済みXGB
credit
3000 × 100
0.7667
0.7578
0.7533
heloc
3000 × 22
0.7222
0.7300
0.7078
default-of-credit
3000 × 20
0.6956
0.6967
0.6944
3つのデータセットすべてで基盤モデルが優れています。helocではTabPFNが0.022、TabICLが0.014です。信用リスクにおいて、これは装飾ではありません。
コンテキスト:inria-soda/tabular-benchmarkスイートのclf_num/credit.csv、シード0、分割70/30(層化)で3,000行にトリミング。
sha256 22a759296600c39a56884dafd84eb346be018c537ff096adc8c2ae7e0520f2a9
1000件の連絡先があり、100件の時間しかない場合に、誰に最初に電話するか。
データセット
サイズ
TabICL
TabPFN
調整済みXGB
bank-marketing
3000 × 7
0.7944
0.7967
0.7833
TabPFNがTabICLを上回る唯一のケースです。どちらも調整済みブースティングを上回っています。
コンテキスト:inria-soda/tabular-benchmarkスイートのclf_num/bank-marketing.csv、シード0、分割70/30(層化)で3,000行にトリミング。
sha256 3433fecd416ce949692442882669881746e8a6b24b904a5f808cdcb196443e7e
実際の病院記録:どの患者が再入院するか。
データセット
サイズ
TabICL
TabPFN
調整済みXGB
Diabetes130US
3000 × 7
0.5911
0.5933
0.5900
精度ではほぼ同点ですが、曲線下面積は大きく開きます:0.6484対0.6264。トリアージが使用するリスク順序は、精度が示唆するよりも大幅に改善されます。
コンテキスト:inria-soda/tabular-benchmarkスイートのclf_num/Diabetes130US.csv、シード0、分割70/30(層化)で3,000行にトリミング。
sha256 9be384ad7edbb9a98b509adb9cc08578e63bd87545b05d97d5147aa15b71385a
裁判所におけるアルゴリズムバイアスに関する議論を引き起こしたデータセット。
データセット
サイズ
TabICL
TabPFN
調整済みXGB
compas-two-years
3000 × 11
0.6733
0.6767
0.6700
基盤モデルが勝ちます。より良いモデルであっても、その使用を正当化するわけではないことを言及する価値があります。このデータセットの議論は、精度に関するものではありませんでした。
コンテキスト:inria-soda/tabular-benchmarkスイートのclf_cat/compas-two-years.csv、シード0、分割70/30(層化)で3,000行にトリミング。
sha256 7e0bcef09ae633ad81e26b0a8f8f96dbc4ac3c29b9da0760d38ef2a75adde8d8
電力市場の消費と価格の時系列。
データセット
サイズ
TabICL
TabPFN
調整済みXGB
electricity
3000 × 7
0.8178
0.8111
0.8178
同点。TabICLは調整済みブースティングと小数点以下4桁で一致し、TabPFNはそれ以下です。利点が見られない2つのケースのうちの1つです。
コンテキスト:inria-soda/tabular-benchmarkスイートのclf_num/electricity.csv、シード0、分割70/30(層化)で3,000行にトリミング。
sha256 d6005007c4b1f7ba88cf91cb1f231969cce3e49c98d445338c0ab0342ead5d7e
化学記述子の419列:幅の広いテーブル。
データセット
サイズ
TabICL
TabPFN
調整済みXGB
Bioresponse
3000 × 419
0.7922
0.7567
0.7744
ここでTabPFNは破綻します:0.7567は、調整されていないXGBoostよりも悪く、18.1秒かかります。TabICLは持ちこたえてトップに来ます。テーブルの長さではなく、幅が問題となります。
コンテキスト:inria-soda/tabular-benchmarkスイートのclf_num/Bioresponse.csv、シード0、分割70/30(層化)で3,000行にトリミング。
sha256 bd3d277821eb949df41219363f0386549019249776fccf7a9f08d3bec10b8727
上記のケースのいずれかを選択して、1行の旅を追ってみてください。コンテキストは2,100件のトレーニング行で、時間はTabICLが測定した時間であり、球体の弧は、チャンスから完璧までのそのデータセットの曲線下面積を描いています。