AI・機械学習
Show HN: Mini-AGI – 8GB VRAMで学習した動的な継続学習モデル
Show HN: Mini-AGI – Dynamic continual learning model trained on 8GB VRAM (github.com)
要約
開発者は、コンシューマー向けハードウェアで大規模モデルをトレーニングできないという不満から、8GB VRAMで動作する動的な継続学習モデル「Mini-AGI」を開発しました。このモデルは、動的に追加・削除される多数のエキスパートを持つMixture of Experts (MoE) と、単一の連続データストリームでのバッチ1学習を組み合わせることで、パラメータ数をディスク容量に、VRAM容量を小さく抑えることを目指しています。開発はAIアシスタントとの協力を得て進められ、現在7.8B文字のコーパスでの学習が進行中です。
全文翻訳
ミニAGIという、おこがましい名前であることは承知しています、ええ、ええ。
ただ、AGIモデルに必要だと私が考える全ての要素が含まれており、誘惑に耐えられませんでした。
私を石で投げつける前に、まずReadMeに目を通していただけると幸いです。それで、あなたの気分が少しは和らぐことを願っています。
まず、これは実際に動作し、トレーニング実行全体のサンプルをここで見ることができます。
https://raw.githubusercontent.com/volotat/mini-AGI/refs/heads/main/runs/samples.txt
現時点でのスケーリング則のグラフは非常に有望に見えます。
https://github.com/volotat/mini-AGI/blob/main/assets/scaling.png
このモデルは、コンシューマー向けハードウェアでは中規模(1B+スケール)のモデルすらトレーニングできないという深い不満から構築されました。
推論やファインチューニングは確かに可能ですが、私はトレーニング実行中にモデルが何を見るかについて完全に制御したいと考えており、それは一部の企業ではなく、私の興味に完全に沿ったものであるべきです。
しばらく考えて、追求する価値のある2つの興味深いアイデアを思いつきました。
1つは、トレーニング中にモデルに追加および削除される多数のエキスパートを持つMoEで、特定の時点では少数のエキスパートのみが実際に使用されます。
もう1つは、単一の連続データストリームでのバッチ1トレーニングです。
最初のアイデアは、パラメータ数に関してディスク容量のみに制限され、エキスパートは必要に応じてロードおよびアンロードできることを可能にします。
2番目のアイデア(実現可能であることが判明した場合)は、大きなランダム化されたバッチとその対応する勾配を保存する必要がないため、小さなVRAM容量で済むことを可能にします。
Claudeとブレインストーミングを開始し、しばらくすると有望に見えるアプローチが見つかりました。
そして、数週間が経過し、その結果を自分で見ることができます。
明らかに、私はこのプロジェクトの作成プロセスでAIを使用しました。
そして、AIなしではこのようなことを完全に不可能だったと確信しています。
したがって、それは十分に正当化されていると私は思います。
モデルは、私がトレーニング用に選択した7.8B文字のコーパスの最初の部分をまだ処理中です。
そのため、重みはまだ公開されておらず、現在の読み取り速度では、それらが完成するまであと数週間の待ち時間があります。
そして、モデルはデータセットからの連続したインターリーブされたパッセージを、それぞれ32K文字の長さで、単一のストリームとして読み取りました。
あなたや私がするように、まさにそのように。
セットアップは非常にシンプルに見えるので、プロジェクトをgit cloneして実行し、すべてを自分で観察できます。
ご清聴ありがとうございました。