HN 日本語サマリー

← 一覧へ戻る
AI・機械学習

Show HN: NanoEuler – 純粋なC/CUDAでスクラッチからGPT-2スケールモデルを実装

Show HN: NanoEuler – GPT-2 scale model in pure C/CUDA from scratch (github.com)

45 pointsby vforno10 コメント

要約

NanoEulerは、AnthropicでのAI分野でのキャリアを夢見る開発者が、LLMの仕組みを深く理解するために、純粋なC/CUDAでゼロから構築したGPT-2スケールのモデルです。低レベルでの実装を通じて、パラメータとデータ、モデルの成長、GPUの動作、そしてレイヤー最適化の相関関係を理解することを目指しています。シェイクスピアのテキストから学習を開始し、2300万パラメータで意味のあるテキスト生成ができることを示しました。

全文翻訳

皆さん、こんにちは。 AnthropicのFableが禁止された後、私はnanoeulerの開発を始めました。なぜなら、私の野心と夢はAnthropicのAI分野で働くことだからです。nanoeulerを作成するに至った2つの興味深い理由は、(1)LLMとのインターフェースは、LLMがどのように構成されているかを理解することを意味しないということ、そして(2)パラメータとデータ、モデルの成長、GPUの動作、そして一部のレイヤーを最適化する方法の相関関係を理解するために、非常に低レベルのレイヤーでLLMに取り組むことでした。 そこで私は、nanoeulerを徐々に成長させるという研究的な側面から取り組み始めました。シェイクスピア.txtから始めて一歩ずつ進み、2300万パラメータでテキスト生成モデルが何を理解するのかを理解しました。たとえば、nanoeulerはこのパラメータ数で「Name:」が行を開始すること、そしてその行を意味のあるものとして書くことを理解していました。 トレーニングと推論中のモデルと、それが実行すべきことの間にいかなる仲介も使いたくなかったため、すべてをCUDAで書きました。その後、SFTなどの使用は、小規模ながらも、チャットボットのようなLLMを作成するための様々なステップを理解するのに非常に役立ちました。どんなフィードバック、助け、提案も大歓迎です!