AI・機械学習
コンシューマーハードウェア(RTX 4090)でQwen 3.8 Flash Next (125B)を100T/sで実行する
Run Qwen 3.8 Flash Next (125B) on consumer hardware (RTX 4090) at 100T/s (github.com)
要約
Strataは、NVIDIAまたはAMDのグラフィックカード(12GB以上のVRAM)を搭載した一般的なゲーミングPCで、Qwen 3.8 Flash Next (125B)のような大規模AIモデルを実行できるオープンソースソフトウェアです。このツールは、モデルの実行速度(応答生成で毎秒60トークン、プロンプト読み込みで毎秒2,650トークン)を測定し、必要なシステム要件(GPU、RAM、ディスク容量)とインストール手順を詳しく説明しています。プライバシーを重視し、すべての処理がローカルPC上で完結します。
全文翻訳
Strata
英語 · 简体中文 · 日本語 · Deutsch · Français · Español · Português
120億パラメータのAIモデルを、お使いのPCで実行しましょう
NVIDIAまたはAMDのグラフィックカード(12GB以上) · WindowsまたはLinux · 無料でオープンソース
Strata(IQ3_S、128Kコンテキスト)でRTX 5070上で実行中のボクセルパゴダガーデンの1ショットプロンプト · フルビデオ(49秒)
Strataは、通常のPCでQwen3.8-Flash-Nextを実行します。これは通常サーバーを必要とする、大きくて賢いAIモデルです。チャット、コード作成、画像読み込み、アプリやコーディングエージェントとの連携が可能です。何もPCから外に出ません。
どれくらい速いですか?
2台の一般的なゲーミングPCで測定しました。トークンは約¾単語です。
応答を書き出す:短いチャットで返信が表示される速さ。毎秒60トークンは、あなたが読むよりも速いです。
プロンプトを読み込む:送信した内容(ここでは32Kトークンのドキュメント、コード、またはチャット履歴)を読み込む速さ。
NVIDIA: RTX 5070 (12 GB), Ryzen 5 7600, 64 GB RAM
AMD: RX 9070 XT (16 GB), Ryzen 9 3900X, 47 GB RAM
サイズ
応答を書き出す
プロンプトを読み込む
Q2_0
94 トークン/秒
2,650 トークン/秒
IQ2_XS
79 トークン/秒
2,090 トークン/秒
IQ3_XXS
62 トークン/秒
1,750 トークン/秒
IQ3_S
53 トークン/秒
1,620 トークン/秒
Coder
55 トークン/秒
2,180 トークン/秒
サイズ
応答を書き出す
プロンプトを読み込む
Q2_0
60 トークン/秒
1,160 トークン/秒
IQ2_XS
52 トークン/秒
1,110 トークン/秒
Coder
44 トークン/秒
1,420 トークン/秒
NVIDIA: Q2_0 はエンジン 0.1.36、他の行は 0.1.26(4K応答、32Kプロンプト)を使用。
完全な表は DETAILS.md にあります。
VRAMが多いカードほど高速です:RTX 3090 (24 GB) は毎秒約100〜140トークンを書き出すはずです。
長いチャットと他のカード:各モデルの速度、コミュニティの結果。
Strataは無料です。お使いのPCでうまく動作する場合、コーヒー1杯で作業を継続できます。
必要なもの
グラフィックカード
NVIDIA GeForce RTX 20、30、40、または50シリーズ、またはAMD Radeon RX 7900 XT / XTX、RX 7800 XT / 7700 XT、RX 9060 XT、RX 9070 / 9070 XT、Radeon AI PRO R9700、またはRX 6800 / 6900シリーズ。
12GB以上のVRAMが必要です。
RAM
32GB以上。
RAMによって、どのモデルが適合するかが決まります。64GBならすべてのサイズが動作します。
ディスク
約80GBの空き容量。
SSDを使用することをお勧めします:最初の起動がはるかに速くなります。
システム
Windows 10 / 11 または Linux、およびNVIDIAまたはAMDの最新グラフィックドライバー。
インストーラーが他のすべてを設定します。
2枚または3枚のカードでモデルを共有できます(マルチGPU)。
実験的で、コミュニティメンバーが自身のマシンで記述・テストしています:
古いグラフィックカード(Tesla P40 / V100、GTX 10、Radeon VII / MI50、RX 6700 XT、RX 5500 XT):古いGPU。
Intel Arc、Linuxでソースからビルド:Intel Arc。
AVX2なしの古いプロセッサ:動作しますが、遅いです。古いCPU。
完全なリスト:docs/INSTALL.md。
インストール
AIにセットアップさせましょう
AIコーディングアシスタント(Claude Code, Cursor, Codex, GitHub Copilotなど)を使用していますか?
これを貼り付けてください:このPCにStrataをセットアップしてください:https://github.com/Niko1221/Strata - そのリポジトリのdocs/AI_SETUP.mdに従ってください。
お使いのグラフィックカード、RAM、ディスクをチェックし、適合するモデルを選択します。
その後、インストールして起動し、アプリへの接続方法を教えてくれます。
AIツールは、StrataをMCPサーバー経由でインストール、起動、停止することもできます。
または自分で実行する
Strataをダウンロードして解凍します(またはgit cloneします)。
Windows:START-HERE.batをダブルクリックします。
Linux:Strataフォルダで./setup.shを実行します。
手順はNVIDIAとAMDで同じです。
インストーラーがお使いのカードを見つけ、適切なエンジンを設定します。
いくつかの質問をされます:どのモデルとサイズか、コンテキストの量(モデルが記憶しているテキストの量)、画像を読むかどうか。
推奨される回答の場合は、毎回Enterキーを押してください。
その後、モデルをダウンロード(約70GB)して起動します。
ダウンロードが停止した場合、再度実行してください:中断したところから再開します。
Strataアプリがhttp://127.0.0.1:8080で開きます。
モデルが起動している間、PCは遅くなったり、1〜3分間応答しなくなったりする可能性があります(初回が最も長いです)。
Strataは35〜55GBをRAMにロードし、その一部をグラフィックカード用にロックします。
これは正常です。待って、ウィンドウを閉じないでください。
ウィンドウにStrataの動作が表示されます。
次回は、START-HERE.bat(または./setup.sh)を再度実行してください。
すぐに起動し、何も二度ダウンロードしません。
ウィンドウを閉じるとモデルが停止します。
UPDATE.bat(./update.sh)は、モデルを起動せずにStrataを更新します。
アップデート、Docker、複数のカード、ファイルの場所、すべてのオプション:docs/INSTALL.md。
どのモデルを選ぶべきか?
インストーラーがお使いのRAMに合ったものを推奨します。
同じモデルにはいくつかのサイズがあり、圧縮の度合いが異なります。小さいサイズは速いです。大きいサイズは少し賢いです。
RAM
使用量
32 GB
Coder が適合します。32GBで、コード用に作られています(24GBカードの場合、Q2_0とIQ2_XSも実行可能)。
48 GB
IQ2_XS(またはQ2_0、最速)より大きいサイズは適合しません。
64 GB
IQ2_XS(推奨)、またはIQ3_XXS / IQ3_S。すべてのサイズが適合します。IQ3_Sが最良ですが最も遅いです。
96 GB以上
IQ3_S、またはUnslothのUD-IQ4_XS(約4ビット)。他のすべてが開いた状態でも、最大のサイズに対応できます。
Coder:半分のエキスパートが削除されたコーディングバージョンです。
フルモデルのSWE-bench Verifiedスコアの91%に達します(作成者による測定)。
32GBのRAMに適合します。
コード以外の分野、特に中国語やその他のCJKテキストでは弱いです(#438)。
それらの場合は、Q2_0、IQ2_XS、またはIQ3_Sを選択してください。これらはすべてエキスパートを保持しています。
Swift 1.5:応答する前に、はるかに短い時間考えるようにファインチューニングされています。
同じ品質で、より早く回答が得られます。
Unsloth UD-IQ4_XS:Unslothの約4ビットバージョンで、IQ3_SとUD-Q4_K_XLの品質の中間に位置します。
94GBのダウンロード。
RAMが約80GB未満の場合、StrataはSSDから一部を読み込みながら応答するため、そこでは遅くなります(NVMe SSDが役立ちます)。
Unsloth UD-Q4_K_XL(実験的):フルモデルに最も近いものです。
しかし、Strataは応答中にSSDからほとんどを読み込むため、64GB PCでは毎秒7〜8.5トークンしか書き込めません。
OrcaRouterのUncensored IQ3_XXS:手動でセットアップする必要があります。
インストーラーのメニューにはありません。
サイズ、ダウンロード、および適合する場所:docs/MODELS.md。
後で別のモデルを追加するには、SETUP.bat(Linux: ./setup.sh --setup)を実行します。
使用方法
ビデオのパゴダガーデンをコーディングエージェントが作成中のStrataアプリのモニター(左)と(右)
ブラウザで:http://127.0.0.1:8080を開きます。
チャット、モデルとGPU/CPU/RAMのライブモニター、設定とアドレスを含む「About」があります。
アプリとコーディングエージェント:
「OpenAI互換」プロバイダーをベースURL http://127.0.0.1:8080/v1 で追加します。
任意のAPIキーと任意のモデル名が機能します。
Anthropic APIを使用するアプリ:http://127.0.0.1:8080/v1/messages (Claude Code: ANTHROPIC_BASE_URL=http://127.0.0.1:8080)。
Codex CLIおよびOpenAI Responses APIを使用するその他のアプリ:/v1/responses (セットアップ)。
思考:チャットメニューまたはアプリの「推論努力」で、オフ、低、中、高を選択します。
オフが最速です。高は難しい質問に最適です。
画像:セットアップで「Images?」に「はい」と答えます。
その後、チャットで「Picture」をクリックするか、アプリで画像を添付します。
AMDカードはLinuxではプロセッサ経由で画像を読み込みます。Windowsではまだできません。
スマートフォンや別のPCから:START-HERE.bat --setup --host 0.0.0.0 --api-key <secret>。
常にキーを設定してください。
一度に1つのリクエスト:デフォルトでは、Strataは1つのリクエストに応答し、他は待機します。
一度に複数に応答するには、「parallel」を2に設定します(BATCHING.md)。
12GBカードでは、各応答が遅くなります。
長いプロンプト:Strataはチャットの最初のメッセージをすべて読み込みます。約30,000トークンあたり1分です。
フォローアップメッセージは数秒で開始されます。
詳細:チャットの保存場所、API。
何か問題がありましたか?
初めてStrataが起動したときにPCがフリーズしました。
モデルのロード中は正常です。待って、ウィンドウを閉じないでください。
10分経ってもフリーズしたままですか?PCを再起動し、他のプログラムを閉じてから再試行するか、より小さいサイズを選択してください。
ダウンロード中またはインストール中に停止しました。
START-HERE.bat(または./setup.sh)を再度実行してください。
中断したところから再開します。
非常に遅く、ディスクライトが点滅し続けるか、「エンジンが予期せず停止しました」と表示されます。
PCの空きRAMが不足しています。
他のプログラムを閉じます(ブラウザは多く使用します)、またはより小さいサイズを選択します(Q2_0またはIQ2_XS)。
ポート8080が既に使用されていると表示されます。
Strataは既に実行中です。そのウィンドウを探してください。
その他の問題とその修正:docs/TROUBLESHOOTING.md。