HN 日本語サマリー

← 一覧へ戻る
AI・機械学習

Mesh LLM: iroh上での分散AIコンピューティング

Mesh LLM: distributed AI computing on iroh (iroh.computer)

316 pointsby tionis72 コメント

要約

Mesh LLMは、既存のGPUリソースを複数のマシンにわたってプールし、単一のOpenAI互換APIとして提供する分散AIコンピューティングプラットフォームです。モデルをローカルで実行したり、ピアにルーティングしたり、複数のマシンに分割して実行したりできます。iROHのP2Pネットワーキング技術を活用し、中央サーバーなしで安全な通信を実現します。これにより、高価なGPUを購入することなく、より大きなモデルを実行し、チームや世界とコンピューティングリソースを共有できます。

全文翻訳

人々が大規模言語モデルを実行することを想像するとき、彼らはデータセンターを思い描きます。誰か他の人が所有するGPUラック、従量課金制のAPI、そして成功するたびに毎月増え続ける請求書。あなたはプロンプトをブラックボックスに送り、価格、モデル、プライバシーポリシーがすべてサインアップ時と同じままであることを願います。多くのチームにとって、それは悪い取引です。モデルがいつ変更されるか、データがどこに行くか、どのハードウェアがワークロードを実行するかについての制御を放棄します。そして、使用量が増えるにつれて、請求書も増え、「もっと払う」以外に操作するレバーはありません。 Mesh LLMは異なる形状をしています。それは、あなたがすでに持っているGPUとメモリを、追加したいマシン数に応じてプールし、そのすべてを単一のOpenAI互換APIとして公開します。1つのノードを開始します。後でさらに追加します。モデルが目の前のボックスで実行されるか、ピアにルーティングされるか、または複数のマシンに分割されるかをメッシュに決定させます。 問題:AIは高価であり、それは誰か他の人のものです。 人気のあるモデルはモノリスです。ほとんどの人はUIまたはAPIキーを介してそれらにアクセスし、大規模なプロバイダーにすべてを実行するための料金を支払います。それは便利ですが、それは降伏でもあります。モデルがいつ更新されるか、どのメモリで実行されるか、またはどのハードウェアが下にあるかを制御できません。これらのモデルに依存する多くのビジネスやサービスは、その逆を望んでいます:より多くの制御、より多くのプラグイン機能、より低いコスト。彼らはオフィス、クローゼット、デスクの下にGPUを持っています。彼らが欠いているのは、それらのマシンを1つのように機能させる方法です。 Mesh LLM:モデルを自分で実行する ピッチはシンプルです。より大きなGPUを購入せずに、より大きなモデルを実行します。チームとプライベートに、または世界とパブリックにコンピューティングを共有して、エージェントやチャットを強化します。任意のOpenAIクライアントをhttp://localhost:9337/v1に向け、実際の作業がどこで行われるかを気にしないようにします。 舞台裏では、Mesh LLMはirohエンドポイントのメッシュ全体にモデルコンピューティングを分散させます。リクエストは3つの方法で処理できます。 このマシンのGPUでローカルに実行します。 すでにモデルをロードしているピアにルーティングします。 単一のボックスには大きすぎるモデルを、パイプラインとして複数のマシンに分割します。 仕組み アーキテクチャはプラグイン可能です。プラグインはマニフェストで提供するものを宣言し、ランタイムはそれらを起動し、呼び出しをルーティングし、MCP、HTTP、推論、メッシュイベントを介してそれらの機能を公開します。カタログには、ラップトップに収まる5億パラメータモデルから、235BのMixture-of-Experts(MoE)巨大モデルまで、40以上のモデルが含まれています。 巨大モデルの場合、Mesh LLMには分割モード(内部的には「Skippy」)があります。モデルはレイヤー範囲ごとにステージにパーティション化されます:ステージ0から15は1つのノードで、16から31は次のノードで、パイプラインを下にたどります。アクティベーションはステージからステージへと流れるため、いくつかの控えめなマシンでも、単独では保持できないモデルを実行できます。OpenAIクライアントはこれらを一切見ません。それはまだlocalhostに話しかけているだけです。 irohの使用方法 モデルを提供するノードも、リクエストのみを送信するノードも、irohエンドポイントを起動します。そのエンドポイントはノードのID、公開鍵であり、唯一のネットワークサーフェスです。中央サーバーはありません。irohは、どこに配置されていても、任意の2つのノード間の直接的で認証されたQUIC接続を開くために必要なホールパンチング、NATトラバーサル、およびリレーフォールバックを処理します。オープンインターネット全体でそれを機能させ続けるために、Mesh LLMは異なるリージョンに2つのirohリレーを実行するため、直接到達できないノードは常に近くにフォールバックパスを持っています。 プロトコル全体はQUICのALPNネゴシエーションに乗っています。 ALPN | 何を運ぶか ---|--- mesh-llm/1 | メインメッシュ:ゴシップ、ルーティング、HTTPトンネル、プラグインチャネル mesh-llm-control/1 | オーナーコントロールプレーン(設定同期、所有権証明) skippy-stage/2 | 分割モデルのためのレイテンシに敏感なアクティベーション転送 メインmesh-llm/1接続内では、すべてが単一の先頭バイトでタグ付けされた双方向QUICストリームであり、そのストリームの種類を示します。1つの接続は、ゴシップ、推論、ルートクエリ、およびピアライフサイクルイベントを運び、すべてその最初のバイトによってデマルチプレクスされます。 バイト | ストリームタイプ | 説明 ---|---|--- 0x01 | GOSSIP | ピアアナウンス(モデル、GPU、RTT、機能) 0x04 | TUNNEL_HTTP | ピアにプロキシされた推論リクエスト 0x05 | ROUTE_REQUEST | 「どのモデルをホストしていますか?」 0x06 | PEER_DOWN | デッドピア通知 0x07 | PEER_LEAVING | グレースフルシャットダウン 0x08 | PLUGIN_CHANNEL | プラグインRPC 0x0e | DIRECT_PATH_REQUEST | NATトラバーサルのための直接アドレスの共有 これがもたらすもの、それが素晴らしい点です。irohは、公開鍵でアドレス指定された、任意の2つのマシン間の認証済みNATトラバーサルQUICを提供します。したがって、「ピアにルーティングする」と「次のパイプラインステージにアクティベーションをストリーミングする」は、「localhostに話す」と同じプリミティブになりますが、エンドポイントIDが異なります。ネットワーキングは、あなたが考える必要のあるものではなくなります。irohはセキュアなトランスポートを提供します。Mesh LLMは独自のゴシップレイヤーをその上に構築するため、メッシュに誰が参加できるか、どのバージョンが互換性があるか、どのピアを信頼するかを正確に制御します。 開始方法 ユーザーは軽量ソフトウェア(約18MB)をインストールし、パブリックメッシュに参加するか、プライベートデプロイメントを構成できます。システムは、標準のOpenAIクライアントにlocalhost:9337/v1として自身を提示します。irohのSwift SDK上に構築されたモバイルアプリが登場します。ACP(エマージングエージェント標準)を話す予定なので、他のクライアントもメッシュに参加できるようになります。 一貫しているのは、プロジェクト全体を動機づけたのと同じスレッドです:より多くのピアツーピア、より少ないクローズドサーバー、そしてロックインなし。 コードを見る Mesh LLM ウェブサイト Irohは、ダイヤルするだけで機能するデバイス間ネットワーキングライブラリです。必要な機能を取得するために、既製のプロトコルのエコシステムから構成するか、ダムパイプ上のクリーンな抽象化で完全にカスタムに進みます。Irohはオープンソースであり、すでに数十万台のデバイスで本番稼働しています。 開始するには、ドキュメントを確認するか、コードに直接飛び込むか、Discordチャンネルで私たちとチャットしてください。