HN 日本語サマリー

← 一覧へ戻る
AI・機械学習

モデルは意図的に「賢くなく」なっている

Models Are Getting Dumber on Purpose (w4g1.dev)

284 pointsby hruvhwe160 コメント

要約

AIモデルは、推論能力を向上させる一方で、事実知識を犠牲にする傾向があります。これは、事実の記憶に多くのパラメータを費やすよりも、推論手順を効率的に学習させる方が、計算コストやモデルの陳腐化の観点から有利であるという意図的な設計判断によるものです。このアプローチは、外部知識ベースやツールとの連携を前提とし、ハルシネーション(幻覚)の抑制にも繋がると期待されています。

全文翻訳

2026-08-17 モデルは意図的に「賢くなく」なっている Walter van der Giessen 推論スコアは上昇し続けている一方で、トークンあたりの計算量は低下しています。GLM-5.2 は AIME 2026 で 99.2% を達成し、トークンあたり約 400億のパラメータがアクティブです。Qwen3.5 は 170億のアクティブパラメータで 91.3% を達成しました。DeepSeek V4-Flash は 130億のアクティブパラメータで動作します。規模で言えば、GPT-4 は 2023 年に約 2800億のアクティブパラメータで動作していたと噂されており、AIME の問題をかろうじて解ける程度でした。小さい方では、Qwen3.5 9B は量子化すると 6GB の VRAM に収まり、Artificial Analysis の知能指数で 100億パラメータ以下の次のベストモデルのスコアを約 2倍にします。もし数学とコードのベンチマークだけを見ていれば、モデルはパラメータあたりで不合理な速さで賢くなっていると結論付けるでしょう。それらのベンチマークでは、その通りです。同じモデルに単純な事実に関する質問をすると、状況は一変します。ツール使用が許可されていない事実記憶のベンチマークである SimpleQA では、現在のトップは Gemini 2.5 Pro で 53% です。つまり、お金で買える最高の記憶力でも、質問の半分を間違えます。小さいモデルはほとんど役に立ちません。Artificial Analysis は、Qwen3.5 4B と 9B の知識ベンチマークにおけるハルシネーション率を 80% から 82% と測定しており、これは、ほとんどの場合、事実を知らないときに、それを作り出していることを意味します。9B に 19世紀のマイナーな数学者の生年を尋ねると、自信に満ちた、もっともらしい、間違った答えが得られます。パラメータ数の減少は無料ではありません。研究室は、世界知識を推論スキルと交換しており、その交換は意図的です。パラメータが何のためにあったのか 事実は場所を取ります。知識容量に関する研究(「言語モデルの物理学」シリーズに最もクリーンな測定値があります)では、パラメータあたり約 2ビットの事実知識とされています。もし、すべてのマイナーな Wikipedia の人物の生年、すべてのオランダの自治体の人口、そしてすべての npm パッケージのすべての関数の引数順序を知っているモデルが欲しいなら、その代償として重み(weights)を支払う必要があり、それがフロンティアモデルが数兆パラメータに成長した大きな理由の一つです。推論は事実よりもはるかに圧縮しやすいです。なぜなら、それは繰り返し適用される比較的少数の手順だからです。問題を部分に分割する、中間状態を追跡する、自分の作業をチェックする、ステップが失敗したときに後退する。検証可能なタスクでの蒸留と強化学習は、それらの手順を小さなモデルに驚くほどうまく転送することが判明しました。Phi-4 は 140億パラメータで、合成された教科書スタイルのデータで重点的にトレーニングされており、数学には強く、トリビアには弱いですが、これはトレーニングデータに何が含まれていたかを正確に示しています。その組み合わせは、かつては合成データアプローチの限界のように見えました。今では設計目標のように見えます。交換で生き残る知識には形があります。これらのモデルはジェネラリストです。ほぼすべてのことについて少しは知っていますが、深く知っていることはほとんどありません。PostgreSQL について尋ねると、それが何であるか、何に役立つか、MVCC がどのように機能するかを大まかに知っていますが、特定のプランナー機能がどのバージョンで追加されたかを尋ねると、捏造された事実に逆戻りします。それが重みに保持するのに適切なレイヤーです。なぜなら、幅広さがあるからこそ、モデルは質問が何についてかを理解し、何を調べるべきかを知り、ソースがもっともらしいかどうかを判断できるからです。深さは取得するのが容易で、保存するのが高価なので、失われる部分です。事実は腐るが、手順は腐らない フロンティアのトレーニング実行には数ヶ月かかり、数億ドルかかります。そして、それが完了した瞬間から、その中の事実は古くなり始めます。ライブラリの API は変更され、価格は変更され、人々は職を変え、2024 年モデルが JavaScript エコシステムについて信じていたことの半分は、モデルが出荷される前に時代遅れになっていました。重みに焼き付けられたすべての事実には賞味期限があり、それを更新する唯一の方法は、別のトレーニング実行です。手順は腐りません。代数は 1970 年も今も同じように機能しており、問題を分解したり、2 つのソース間の矛盾を見つけたりすることも同様です。主に手順で構成され、事実はわずかにロードされているだけのモデルは、知識が豊富なモデルのように古くなりません。トレーニングのカットオフは、世界の現在の状態がそもそも重みに住むことを意図されていなかったため、それほど重要ではありません。これは、このアプローチ全体の最良の議論だと思います。高価で遅い成果物(トレーニング済みモデル)を、毎日変化するもの(真実であること)から切り離します。ハーネスが知識を運ぶ モデルが物事を知らない場合、何か他のものが知っている必要があります。それがハーネスです。知識ベースの検索、ツールの呼び出し、ウェブ検索、ドキュメントのファイルシステム。私は以前、Rust はエージェントのハーネスであり、機械でチェック可能な安価なフィードバックのソースであると書きました。これは反対側からの同じ形です。モデルは推論を提供し、推論するすべてのものは実行時に供給されます。すでにエージェントがこのように機能しているのを見ることができます。コーディングエージェントは、依存関係の API サーフェスを記憶する必要はありません。なぜなら、呼び出す前に node_modules を grep したり、ドキュメントを読んだりするからです。そして、その回答は、トレーニングデータを支配していたバージョンではなく、実際にインストールされているバージョンに基づいています。かつて各フォワードパスの固定コストだった検索は、オンデマンドのルックアップになりました。GPU 上のフロンティアモデル 数年先までこのトレンドを追えば、コンシューマー GPU 1 台で動作する、フロンティア品質の推論、Fable 品質を持つモデルが得られると思います。計算量はほぼそこに到達しています。DeepSeek V4-Flash は、トークンあたり約 130億のアクティブパラメータで推論しており、コンシューマー GPU の範囲内です。収まらないのは、エキスパートに座っている他の 2710億パラメータであり、エキスパートレイヤーは主に事実ストレージです。それが、この取引全体でオプションになる部分です。知識を剥ぎ取ると、総サイズはアクティブサイズに向かって縮小し、4ビット量子化された 20〜40B モデルは、2022 年からゲーム PC に搭載されている 24GB カードに収まります。ただし、それはあまり知らないということになります。ツールなしで単純な事実に関する質問をすると、正しい動作は、知らないと言って調べに行くことです。まともなハーネスと組み合わせれば、それは私が今日フロンティアモデルを使っていることのほとんどであり、トークンごとの請求なし、データがマシンを離れることなくローカルで実行されます。これはハルシネーションをほとんど解決します。私が最も有望だと感じるのは、これがハルシネーションに何をするかです。事実が重みに存在する場合、間違った事実は見つけられず、修正できません。重みを grep することはできませんし、先月からの差分を取ることもできません。1つのエラーを修正することは、他の何かに影響を与える可能性のあるファインチューニングを意味します。モデルは、正しい事実と同じ流暢な自信で間違った事実を述べますが、チェックするアーティファクトはありません。事実がモデルの外に存在する場合、間違った回答にはアドレスがあります。モデルはドキュメントを引用するので、ドキュメントを開くことができます。ドキュメントが間違っている場合、ドキュメントを編集すれば、将来のすべてのクエリが修正を受け取ります。これは、次のトレーニング実行を約 1 年待つよりも優れています。検索はゼロに到達しません。モデルがソースを誤読したり、2つを誤って結合したりする可能性があるためですが、ソース付きの主張はチェック可能であり、重みからの主張はチェック不可能です。知識ベース内の間違った事実は、通常のデータバグであり、私たちがすでにトレース、修正、および回帰テストの書き方を理解している種類です。モデルカードが知識のカットオフをまったくリストしなくなる未来のバージョンがあります。なぜなら、重みに残されたものは、数週間ではなく数年スケールで古くなるからです。モデルは、CPU がプログラムを受け取るのと同じように、実行時に世界の現在の状態を渡されるだけです。