AI・機械学習
モデルを焼く:LLMトレーニングの比喩
Baking a Model: A Metaphor for LLM Training (newsletter.kentbeck.com)
要約
この記事は、大規模言語モデル(LLM)のトレーニングプロセスを、パン生地をこねて焼く「ベーキング」に例えて説明しています。著者は、モデルの構築プロセスを、初期条件を設定し、時間をかけて変化を待つ「プレトレーニング」(コールドプルーフに相当)と、特定の課題に対処するために微調整を行う「ポストトレーニング」(成形と調理に相当)の2つの段階に分けて解説しています。この比喩を通して、モデル構築の複雑さと、その背後にある機械的な仕組みへの魅力を伝えています。
全文翻訳
モデルを焼く:LLMトレーニングの比喩
Kent Beck 2026年8月14日 4612 シェア
高校を卒業してバス停まで歩きながら、Motorola 6800命令セットのマニュアルを眺めていたのを覚えています。ブール式、命令エンコーディング、タイミングテーブルなど、何を見ているのか本当には理解していませんでしたが、その仕組みに夢中になっていました。複雑な機械であり、それを理解すれば力とコントロールを得られる、というものでした。
現在、AIモデルについても同じように感じています。まだ詳細を理解しているとは主張しませんが、その仕組みに魅了されています。私が興味を持っているのは次の両方です。
モデルがどのように機能するか、そして、
モデルを作る機械。
この記事(および今後のフォローアップ)で探求し始めるのは、この後者のトピック、つまりモデルがどのように構築されるかです。
ベーキング
土曜日のフォカッチャ
私はベーキングが大好きです。材料をある形から全く異なる形に変えます。材料自体はそのままでは食べられませんが、それらから作り出すものは美味しいです。ああ、そしてベーキングは初期条件に敏感です。プロセスの早い段階で小さな変更を加えると、後で大きな結果をもたらします。
私はコールドプルーフ(低温長時間発酵)を実験しています。これは、一晩冷蔵庫で酵母に作業させる方法です。
モデルを理解しようとしているうちに、モデルを作成することとのアナロジーがあることに気づきました。少なくとも、現時点での私の理解では(もし何か間違っていたらコメントで訂正してください)。
まず、モデルという言葉の意味について、段階的に物語を明らかにします。単純化しますが、少しずつ複雑さを明らかにしていきます。
ズームアウト
「モデル」とは、人間と会話できるコンピューターシステムのことです(ほら、単純化すると言いました。私に付き合ってくれることを願っています。すぐに終わります)。
実際には、もう少し複雑です。モデルは2つの部分に分かれています。
ユーザーインターフェース:入力と出力のフォーマット、シーケンス、認証などのすべての処理を行います。
モデル本体:魔法が起こる場所です。
ユーザーインターフェースは、従来のプログラミング技術(「従来」が過去2年間で劇的に変化したとしても)を使用して構築されます。しかし、モデル本体(私たちの探求のトピック)は、根本的に異なる技術を使用して構築されます。
モデル
モデルとは、数字の袋です。今日の目的にはそれで十分です(いつか、モデルが有用な言葉を生成する際にそれらの数字がどのように使用されるかについて触れることになるかもしれませんが、そのためにはまず私がそれを少し理解する必要があります)。
これらの数字はどのようにして思いついたのでしょうか?プログラミングでは、結果がプログラムとなる一連のステートメントを配置しますが、AIモデルはトレーニングから生まれます。
トレーニングはプログラミングにいくらか似ています。アーティファクトを変更して将来の動作を修正しますが、同時にいくつかの大きな違いもあります。
トレーニング前とトレーニング後
一度に正しい数字の束を魔法のように推測するわけではありません。いいえ、いいえ。まず、おおよそ正しい数字を取得し、それからさらに良い数字を得るために微調整します。この2つのプロセスは全く異なります。
(私の知る限り、プレトレーニング、ポストトレーニング、そしてミッドトレーニング(これについては何も知りません)がありますが、「トレーニング」というものは、プレ、ミッド、ポストの組み合わせ以外にはありません。語彙が進化することを願っています。)
プレトレーニングは大きなバッチです。チーム全体が初期条件(データと空のモデル)を設定します。データをモデルに何十億回も前後に実行させます。クラッシュした場合に備えて、途中でスナップショットを取得します。プレトレーニングが迷走してしまい、調整や再起動が必要な兆候がないか確認します。プレトレーニングは大きな賭けです。数億ドルと(さらに高価な)数ヶ月の遅延がかかります。
(プレトレーニング担当者の協力方法についてもっと学ぶ必要があります。)
プレトレーニングは、モデルトレーニングのコールドプルーフです。
いくつかの材料を混ぜ合わせます。
それを邪魔できない場所に置きます。
ただ、それが展開されるのを待つだけです。
結果は使用可能ではありませんが、後続のプロセスの前駆体です。
ポストトレーニングは、たくさんの小さなバッチです。人々(「研究者」と呼ばれますが、私のナイーブで率直な bluntness では「モデルエンジニア」と呼びたい)は、生のモデルがうまく対処できない特定の課題を見て、パフォーマンスを向上させる可能性のある微調整を模索します。結果として、現在存在するモデルに適用されるコードとデータの小さなチャンク(生き残った実験)がたくさん生まれます。
ポストトレーニングは、元のモデルを補完します。
十分な補完を適用すると、UI、ユーザー、およびコンピューティングと組み合わされたモデルが、「珍しいフォカッチャのトッピングを5つ教えて」というリクエストに応答できるようになります。
ポストトレーニングは、モデルトレーニングの成形と調理です。可能性のあるものを取り、人間にとって美味しいものにします。(このアナロジーは、ポストトレーニングの協調的、反復的、および可逆的な性質をカバーしていません。ああ、ため息。)
結論
フォローアップ記事では、このプロセス全体に関わるさまざまなチームと役割を探求する予定です。彼らは、インセンティブ、ツール、リズム、短期 vs 長期、機能 vs 未来、背景、文化において、興味深い違いを持っています。
しかし、まず、プロセスの理解を再確認したかったのです。上記で何か間違っていたら教えてください。
ほとんどのチームは戦略の問題を抱えているわけではありません。彼らは適応の問題を抱えています。
あなたの計画は、現実との接触を生き延びることは決してありませんでした。問題は、それがうまくいかなかったときにあなたの組織が曲がるか壊れるかということです。
私はチームが曲がるのを助けます。適応して繁栄するために。
カスタムトークとアドバイザリーエンゲージメントをいくつか予約しています。あなたのチームのメンバーにインタビューし、実際のソフトウェアフローを測定し、真実とそれに対して何をすべきかをお伝えします。
それが合うかどうか興味がありますか?あなたのチームについて教えてください。
4612 シェア 前の記事