AI・機械学習
LLMが小学5年生以降の教材を見ずに学習した場合、何が起こるか?
What happens when an LLM never sees material beyond fifth grade? (littlelearner-ll.github.io)
要約
LittleLearnerは、小学5年生までの米国公立学校のカリキュラムに限定されたデータセットで学習させた大規模言語モデル(LLM)の研究プロジェクトです。実験の結果、モデルの能力は学習データセットの範囲内に留まり、スケーリングや追加学習を行っても、カリキュラム外の知識や能力を meaningfully に向上させることはできませんでした。この研究は、LLMの能力限界が事前学習データによって設定されることを示唆しています。
全文翻訳
LittleLearnerに話しかける
ブラウザ上で動作するホストされた5Bモデル。チャットが以下にロードされない場合は、新しいタブで開いてください。
知識獲得を研究するための制御されたサンドボックス
現代のLLMはすべてを一度に学習するため、新しいスキルが学習されたのか、単に引き出されたのかを判断するのが困難です。私たちは、トレーニング分布自体を制限します。米国公立学校のカリキュラムにフィルタリングされた88Bトークンのコーパスを使用し、そこからモデルをゼロからトレーニングし、フィルタリングされていない対照群と一致させます。
データセット LittleCurriculum
Common Core基準(K–5)に沿った5段階のフィルタリングパイプラインを通じてFineWeb-Eduから抽出された88Bトークンのコーパスです。5年生以上の概念、事実、語彙は明示的に除外されています。
モデル LittleLearner
LittleCurriculumでゼロからトレーニングされた3つのスケール(0.6B / 1.3B / 5B)のモデルです。解釈可能な知識境界を持つチャット可能なモデルです。それぞれが、クリーンな比較のために一致するUnfiltered対照群を備えています。
発見
獲得ではなく、引き出し
私たちの実験では、スケーリング、ポストトレーニングのSFT+GRPO、およびインコンテキスト学習は、カリキュラムが教えたことを増幅しますが、範囲外のパフォーマンスを意味のあるレベルで向上させるものはありません。これは、事前トレーニングフィルタが効果的な能力の上限を設定することを示しています。
モデルチェックポイント
3つのスケール(0.6B / 1.3B / 5B)のLittleLearner、それぞれにアーキテクチャ、トークン、レシピを共有する一致するUnfiltered対照群があります。Base:事前トレーニング済みモデル。GRPO:MathCAMPSでポストトレーニングされた数学の専門家。応答は数学指向の出力に偏る可能性があります。Chatty:一般的なチャット動作に合わせて調整されたバリアント。
スケール LittleLearner · K–5 チャッティ 一致する対照群 · Unfiltered
能力はカリキュラム内に留まる
標準的な介入は、モデルを事前トレーニングデータが教えたことを超えてプッシュできるか?実験的に制御された境界により、明確に質問できます。私たちの実験では、各介入は範囲内の能力を増幅しますが、範囲外のパフォーマンスを意味のあるレベルで向上させるものはありません。
スケーリング
ポストトレーニング
インコンテキスト学習
スケーリング
モデルサイズのスケーリングは、モデルの制御された知識露出内でのパフォーマンスを向上させ、同じ学習軌道に沿った問題にわずかに拡張しますが、より高度な能力を必要とする問題に対する改善はほとんどありません。
グレード別のMathCAMPS精度、モデルサイズ別
ポストトレーニング
GRPOによるポストトレーニングは、範囲内のK–5能力を大幅に向上させますが、範囲外のK–5能力を回復させることはできません。範囲外のデータでトレーニングした場合でも同様です。
ポストトレーニングはK–5を増幅し、K–5を超えるギャップは増幅しない
インコンテキスト学習
テストしたプロンプトでのインコンテキスト学習は、トレーニング済みの5B LittleLearnerの範囲外のK–5における新しい推論能力を解き放ちません。
プロンプト条件別の精度
何を教えますか?
LittleLearnerのトレーニング露出は明示的に指定されているため、行動的および表現的な変化は、導入する概念に直接関連付けることができます。私たちが興奮している3つの方向性があります。
01 RL & 発見
RLは能力を生み出せるか?先行研究はK–5に限定されているため、RL下で現れる能力はRLプロセス自体に起因すると考えられます。報酬駆動型発見の扱いやすいプロキシ。
02 継続学習
概念が学習される様子を観察する
負の数を導入し、サンプル効率、保持、干渉を測定します。または、境界付近の動作をプローブします。応答するか、棄権するか、幻覚を見るか?
03 教育科学
機械 vs. 子供の学習者
指定された露出により、人間とモデルの制御された比較が可能になります。モデルと子供は、分数学習のために同様の露出を必要とするか、単語問題で同様のエラーを犯すか?
+あなたの番です
あなた自身の質問を持ってきてください
既知の境界線があなたのアイデアをクリーンな実験に変えます!
この研究が有用だと感じた場合
私たちの論文を引用してください:
Copy@misc{littlelearner2026, title={LittleLearner: Language Models Under Pedagogically-Controlled Knowledge Exposure}, author={Fanfei Li and Jana Zeller and Manuel Prada-Corral and Thaddäus Wiedemer and Prasanna Mayilvahanan and Ryan Cotterell and Wieland Brendel}, year={2026}, eprint={2608.13545}, archivePrefix={arXiv}, primaryClass={cs.CL}, url={https://arxiv.org/abs/2608.13545} }