HN 日本語サマリー

← 一覧へ戻る
AI・機械学習

コンシューマーハードウェア(RTX 4090)でQwen 3.8 Flash Next (125B)を100T/sで実行する

Run Qwen 3.8 Flash Next (125B) on consumer hardware (RTX 4090) at 100T/s (github.com)

81 pointsby snehesht27 コメント

要約

Strataは、NVIDIAまたはAMDのグラフィックカード(12GB以上のVRAM)を搭載した一般的なゲーミングPCで、Qwen 3.8 Flash Next (125B)のような大規模AIモデルを実行できるオープンソースソフトウェアです。このツールは、モデルの実行速度(応答生成で毎秒60トークン、プロンプト読み込みで毎秒2,650トークン)を測定し、必要なシステム要件(GPU、RAM、ディスク容量)とインストール手順を詳しく説明しています。プライバシーを重視し、すべての処理がローカルPC上で完結します。

全文翻訳

Strata 英語 · 简体中文 · 日本語 · Deutsch · Français · Español · Português 120億パラメータのAIモデルを、お使いのPCで実行しましょう NVIDIAまたはAMDのグラフィックカード(12GB以上) · WindowsまたはLinux · 無料でオープンソース Strata(IQ3_S、128Kコンテキスト)でRTX 5070上で実行中のボクセルパゴダガーデンの1ショットプロンプト · フルビデオ(49秒) Strataは、通常のPCでQwen3.8-Flash-Nextを実行します。これは通常サーバーを必要とする、大きくて賢いAIモデルです。チャット、コード作成、画像読み込み、アプリやコーディングエージェントとの連携が可能です。何もPCから外に出ません。 どれくらい速いですか? 2台の一般的なゲーミングPCで測定しました。トークンは約¾単語です。 応答を書き出す:短いチャットで返信が表示される速さ。毎秒60トークンは、あなたが読むよりも速いです。 プロンプトを読み込む:送信した内容(ここでは32Kトークンのドキュメント、コード、またはチャット履歴)を読み込む速さ。 NVIDIA: RTX 5070 (12 GB), Ryzen 5 7600, 64 GB RAM AMD: RX 9070 XT (16 GB), Ryzen 9 3900X, 47 GB RAM サイズ 応答を書き出す プロンプトを読み込む Q2_0 94 トークン/秒 2,650 トークン/秒 IQ2_XS 79 トークン/秒 2,090 トークン/秒 IQ3_XXS 62 トークン/秒 1,750 トークン/秒 IQ3_S 53 トークン/秒 1,620 トークン/秒 Coder 55 トークン/秒 2,180 トークン/秒 サイズ 応答を書き出す プロンプトを読み込む Q2_0 60 トークン/秒 1,160 トークン/秒 IQ2_XS 52 トークン/秒 1,110 トークン/秒 Coder 44 トークン/秒 1,420 トークン/秒 NVIDIA: Q2_0 はエンジン 0.1.36、他の行は 0.1.26(4K応答、32Kプロンプト)を使用。 完全な表は DETAILS.md にあります。 VRAMが多いカードほど高速です:RTX 3090 (24 GB) は毎秒約100〜140トークンを書き出すはずです。 長いチャットと他のカード:各モデルの速度、コミュニティの結果。 Strataは無料です。お使いのPCでうまく動作する場合、コーヒー1杯で作業を継続できます。 必要なもの グラフィックカード NVIDIA GeForce RTX 20、30、40、または50シリーズ、またはAMD Radeon RX 7900 XT / XTX、RX 7800 XT / 7700 XT、RX 9060 XT、RX 9070 / 9070 XT、Radeon AI PRO R9700、またはRX 6800 / 6900シリーズ。 12GB以上のVRAMが必要です。 RAM 32GB以上。 RAMによって、どのモデルが適合するかが決まります。64GBならすべてのサイズが動作します。 ディスク 約80GBの空き容量。 SSDを使用することをお勧めします:最初の起動がはるかに速くなります。 システム Windows 10 / 11 または Linux、およびNVIDIAまたはAMDの最新グラフィックドライバー。 インストーラーが他のすべてを設定します。 2枚または3枚のカードでモデルを共有できます(マルチGPU)。 実験的で、コミュニティメンバーが自身のマシンで記述・テストしています: 古いグラフィックカード(Tesla P40 / V100、GTX 10、Radeon VII / MI50、RX 6700 XT、RX 5500 XT):古いGPU。 Intel Arc、Linuxでソースからビルド:Intel Arc。 AVX2なしの古いプロセッサ:動作しますが、遅いです。古いCPU。 完全なリスト:docs/INSTALL.md。 インストール AIにセットアップさせましょう AIコーディングアシスタント(Claude Code, Cursor, Codex, GitHub Copilotなど)を使用していますか? これを貼り付けてください:このPCにStrataをセットアップしてください:https://github.com/Niko1221/Strata - そのリポジトリのdocs/AI_SETUP.mdに従ってください。 お使いのグラフィックカード、RAM、ディスクをチェックし、適合するモデルを選択します。 その後、インストールして起動し、アプリへの接続方法を教えてくれます。 AIツールは、StrataをMCPサーバー経由でインストール、起動、停止することもできます。 または自分で実行する Strataをダウンロードして解凍します(またはgit cloneします)。 Windows:START-HERE.batをダブルクリックします。 Linux:Strataフォルダで./setup.shを実行します。 手順はNVIDIAとAMDで同じです。 インストーラーがお使いのカードを見つけ、適切なエンジンを設定します。 いくつかの質問をされます:どのモデルとサイズか、コンテキストの量(モデルが記憶しているテキストの量)、画像を読むかどうか。 推奨される回答の場合は、毎回Enterキーを押してください。 その後、モデルをダウンロード(約70GB)して起動します。 ダウンロードが停止した場合、再度実行してください:中断したところから再開します。 Strataアプリがhttp://127.0.0.1:8080で開きます。 モデルが起動している間、PCは遅くなったり、1〜3分間応答しなくなったりする可能性があります(初回が最も長いです)。 Strataは35〜55GBをRAMにロードし、その一部をグラフィックカード用にロックします。 これは正常です。待って、ウィンドウを閉じないでください。 ウィンドウにStrataの動作が表示されます。 次回は、START-HERE.bat(または./setup.sh)を再度実行してください。 すぐに起動し、何も二度ダウンロードしません。 ウィンドウを閉じるとモデルが停止します。 UPDATE.bat(./update.sh)は、モデルを起動せずにStrataを更新します。 アップデート、Docker、複数のカード、ファイルの場所、すべてのオプション:docs/INSTALL.md。 どのモデルを選ぶべきか? インストーラーがお使いのRAMに合ったものを推奨します。 同じモデルにはいくつかのサイズがあり、圧縮の度合いが異なります。小さいサイズは速いです。大きいサイズは少し賢いです。 RAM 使用量 32 GB Coder が適合します。32GBで、コード用に作られています(24GBカードの場合、Q2_0とIQ2_XSも実行可能)。 48 GB IQ2_XS(またはQ2_0、最速)より大きいサイズは適合しません。 64 GB IQ2_XS(推奨)、またはIQ3_XXS / IQ3_S。すべてのサイズが適合します。IQ3_Sが最良ですが最も遅いです。 96 GB以上 IQ3_S、またはUnslothのUD-IQ4_XS(約4ビット)。他のすべてが開いた状態でも、最大のサイズに対応できます。 Coder:半分のエキスパートが削除されたコーディングバージョンです。 フルモデルのSWE-bench Verifiedスコアの91%に達します(作成者による測定)。 32GBのRAMに適合します。 コード以外の分野、特に中国語やその他のCJKテキストでは弱いです(#438)。 それらの場合は、Q2_0、IQ2_XS、またはIQ3_Sを選択してください。これらはすべてエキスパートを保持しています。 Swift 1.5:応答する前に、はるかに短い時間考えるようにファインチューニングされています。 同じ品質で、より早く回答が得られます。 Unsloth UD-IQ4_XS:Unslothの約4ビットバージョンで、IQ3_SとUD-Q4_K_XLの品質の中間に位置します。 94GBのダウンロード。 RAMが約80GB未満の場合、StrataはSSDから一部を読み込みながら応答するため、そこでは遅くなります(NVMe SSDが役立ちます)。 Unsloth UD-Q4_K_XL(実験的):フルモデルに最も近いものです。 しかし、Strataは応答中にSSDからほとんどを読み込むため、64GB PCでは毎秒7〜8.5トークンしか書き込めません。 OrcaRouterのUncensored IQ3_XXS:手動でセットアップする必要があります。 インストーラーのメニューにはありません。 サイズ、ダウンロード、および適合する場所:docs/MODELS.md。 後で別のモデルを追加するには、SETUP.bat(Linux: ./setup.sh --setup)を実行します。 使用方法 ビデオのパゴダガーデンをコーディングエージェントが作成中のStrataアプリのモニター(左)と(右) ブラウザで:http://127.0.0.1:8080を開きます。 チャット、モデルとGPU/CPU/RAMのライブモニター、設定とアドレスを含む「About」があります。 アプリとコーディングエージェント: 「OpenAI互換」プロバイダーをベースURL http://127.0.0.1:8080/v1 で追加します。 任意のAPIキーと任意のモデル名が機能します。 Anthropic APIを使用するアプリ:http://127.0.0.1:8080/v1/messages (Claude Code: ANTHROPIC_BASE_URL=http://127.0.0.1:8080)。 Codex CLIおよびOpenAI Responses APIを使用するその他のアプリ:/v1/responses (セットアップ)。 思考:チャットメニューまたはアプリの「推論努力」で、オフ、低、中、高を選択します。 オフが最速です。高は難しい質問に最適です。 画像:セットアップで「Images?」に「はい」と答えます。 その後、チャットで「Picture」をクリックするか、アプリで画像を添付します。 AMDカードはLinuxではプロセッサ経由で画像を読み込みます。Windowsではまだできません。 スマートフォンや別のPCから:START-HERE.bat --setup --host 0.0.0.0 --api-key <secret>。 常にキーを設定してください。 一度に1つのリクエスト:デフォルトでは、Strataは1つのリクエストに応答し、他は待機します。 一度に複数に応答するには、「parallel」を2に設定します(BATCHING.md)。 12GBカードでは、各応答が遅くなります。 長いプロンプト:Strataはチャットの最初のメッセージをすべて読み込みます。約30,000トークンあたり1分です。 フォローアップメッセージは数秒で開始されます。 詳細:チャットの保存場所、API。 何か問題がありましたか? 初めてStrataが起動したときにPCがフリーズしました。 モデルのロード中は正常です。待って、ウィンドウを閉じないでください。 10分経ってもフリーズしたままですか?PCを再起動し、他のプログラムを閉じてから再試行するか、より小さいサイズを選択してください。 ダウンロード中またはインストール中に停止しました。 START-HERE.bat(または./setup.sh)を再度実行してください。 中断したところから再開します。 非常に遅く、ディスクライトが点滅し続けるか、「エンジンが予期せず停止しました」と表示されます。 PCの空きRAMが不足しています。 他のプログラムを閉じます(ブラウザは多く使用します)、またはより小さいサイズを選択します(Q2_0またはIQ2_XS)。 ポート8080が既に使用されていると表示されます。 Strataは既に実行中です。そのウィンドウを探してください。 その他の問題とその修正:docs/TROUBLESHOOTING.md。