HN 日本語サマリー

← 一覧へ戻る
AI・機械学習

Shapelearn Qwen 3.8 27B (13.1 GB VRAM)

Shapelearn Qwen 3.8 27B (13.1 GB VRAM) (byteshape.com)

23 pointsby syntaxing0 コメント

要約

ByteShapeは、大規模言語モデルQwen 3.8 27Bの新しい量子化モデル「ShapeLearn」を発表しました。このモデルは、以前の「ShapeLearn-Lite」よりも品質と速度のバランスが向上しており、特にGPU-5構成で高い性能を発揮します。スペキュラティブデコーディング技術(MTPまたはDFlash2)を併用することで、スループットがさらに向上し、様々なGPU環境での利用が可能です。

全文翻訳

私たちは少しせっかちでした。Qwen 3.8 27Bは2026年8月14日にリリースされました。4日後の8月18日、私たちは最初のGGUFセットを公開しました。意図的に「ShapeLearn-Lite」と名付けたのは、より小さな最適化予算、少ないチェック、そしてより少ない待ち時間で生成されたためです。現在、フルバージョンのShapeLearnモデルが完成し、Liteセットや競合する量子化モデルと比較ベンチマークを行いました。良いニュースは、ShapeLearn-Liteがかなり健闘したことです。後で「ShapeLearn-Lite、 retrospect」で詳しく説明します。さらに良いニュースは、フルバージョンのShapeLearnモデルがさらに優れていることです。Qwen3.8-27B(GGUF)を試すllama.cppでのクイックスタートMTPドラフトヘッドは、すべてのGGUFにバンドルされています。DFlash2は、別の1.1 GBドラフトモデルを使用します。どちらのコマンドもGPU-5を使用します。タグをリリース内の他のモデルと入れ替えてください。MTP埋め込みドラフト。画像入力に対応しています。llama-serverをコピー -hf byteshape/Qwen3.8-27B-GGUF:Qwen3.8-27B-IQ4_XS-3.84bpw --mmproj-auto --spec-type draft-mtp --spec-draft-n-max 3 DFlash2外部ドラフト。最速のオプション、テキストのみ。llama-serverをコピー -hf byteshape/Qwen3.8-27B-GGUF:Qwen3.8-27B-IQ4_XS-3.84bpw -hfd incoai/Qwen3.8-27B-DFlash2-GGUF:Q4_K_M --spec-type draft-dflash --spec-draft-n-max 7 --no-mmproj DFlash2にはllama.cpp b10658以降が必要です。すべてのモデルについて、推奨されるサンプリング設定を備えたすぐに実行できるコマンドが、runツールとモデルカードにあります。要するにフルShapeLearnは、測定された品質-速度のフロンティアをLiteを超えて移動させます。新しいリリースに含まれる5つのモデルすべてが、6つのGPU比較のそれぞれでフロンティア上に位置します。GPU-5は、それが収まる場所であればどこでも私たちのデフォルトの推奨事項であり、BF16の集計ベンチマークスコアの99.63%に達します。必要なコンテキストに収まらない場合は、GPU-4は依然として非常に競争力があります。より小さいサイズ(13.1 GBではなく11.0 GB)でBF16の98.72%に達し、より高速です。ShapeLearn-LiteもKLDランキングが示唆したよりも良好なパフォーマンスを示しました。6つのモデルのうち3つが、Lite対Unsloth Dynamic v3の比較でフロンティア上に位置しています。MTPまたはDFlash2を使用したスペキュラティブデコーディングは、テストされたすべてのShapeLearnモデルとGPUでスループットを増加させます。DFlash2は通常より高速ですが、より多くのメモリを必要とし、llama.cppでの画像入力をサポートしません。メモリが許す場合は、テキストのみの最大スループットのためにDFlash2を選択し、VRAMまたはマルチモーダルサポートがより重要な場合はMTPを選択してください。フルShapeLearnはフロンティアを移動させます私たちはQwen 3.8 27BのフルShapeLearn実行をリリースします。このリリース内では、より大きなモデルはより高い集計スコアを生成し、より小さなモデルはより高いスループットを提供します。その順序は、テストされた6つのGPUすべてで維持されます。これは密なモデルであり、メモリ転送がボトルネックであるため、BPWが低いほど、MoEよりもTPSが高くなります。GPUごとの比較には、AtomicChat、Bartowski、ISTA-DASLab、およびUnsloth Dynamic v3も含まれます。Bartowskiの最新モデルは、私たちのテスト後にリリースされたため、含まれていません。フルShapeLearnは、図ではByteShapeとラベル付けされています。5つのShapeLearnモデルすべてが測定されたフロンティア上に残っており、GPU-5はプロットされた量子化モデルの中で最も高い集計スコアを達成しています。他のチームも競争力のあるポイントを提供しています。特に、ISTA-DASLabの優れたモデル(下のグラフの黄色い「d」)もフロンティア上に位置しています。「フロンティア」とは、他のプロットされたモデルがより高速かつより正確であることを意味します。96 GB:RTX Pro 6000最もメモリが多いGPUであるRTX PRO 6000は、テストされたモデルのフルレンジを示すことを可能にします。RTX Pro 6000:トークン/秒 vs 品質(フルShapeLearnと競合する量子化モデル)モデルの詳細については、下の「凡例を表示」をタップしてください。RTX Pro 6000:トークン/秒 vs 品質(フルShapeLearnと競合する量子化モデル)モデルの詳細については、バブルにカーソルを合わせるか、下の「凡例を表示」をクリックしてください。凡例を表示#モデルAccTPSBPWByteShape GPU-1IQ2_XXS-2.56bpw0.9304116.112.56 GPU-2IQ3_XXS-2.88bpw0.9656108.012.88 GPU-3IQ3_XS-3.01bpw0.9726105.443.01 GPU-4IQ3_S-3.23bpw0.9872101.113.23 GPU-5IQ4_XS-3.84bpw0.996390.423.84UnslothAUD-IQ2_S0.8633114.812.49BUD-Q2_K_XL0.9572106.952.82CUD-IQ3_XXS0.9359100.513.14DUD-IQ3_S0.955595.533.47EUD-Q3_K_XL0.976090.883.80FUD-IQ4_XS0.992086.734.13GUD-Q4_K_S0.987782.214.46HUD-Q4_K_M0.970378.584.79IUD-Q4_K_XL0.987174.755.12JUD-Q5_K_S0.987871.005.44KUD-Q5_K_M0.989767.715.77LUD-Q5_K_XL0.990565.526.10ISTA-DASLabaGSQ-RCO-IQ2_XS0.8647112.772.50bGSQ-RCO-IQ2_S0.9364108.222.75cGSQ-RCO-IQ3_XXS0.9438103.393.00dGSQ-RCO-IQ3_S0.994394.773.50BartowskyaIQ2_XXS0.7986112.212.72bIQ2_S0.9296106.332.99cQ2_K0.961696.083.45dIQ3_XXS0.959492.433.68eIQ3_XS0.958288.363.89fIQ3_M0.966786.174.06AtomicChataAD-IQ2_XXS0.8385116.282.58bAD-IQ2_XS0.9296108.672.85cAD-IQ2_S0.9061100.283.22dAD-IQ3_XXS0.964495.293.50eAD-IQ3_S0.973088.524.04GPU-5は、どこにでも収まる場所であればデフォルトです。90.4トークン/秒でBF16ベースラインの99.63%に達します。32 GB:RTX 5090RTX 5090も同様の話をしており、同じ推奨事項につながります。RTX 5090:トークン/秒 vs 品質(フルShapeLearnと競合する量子化モデル)モデルの詳細については、下の「凡例を表示」をタップしてください。RTX 5090:トークン/秒 vs 品質(フルShapeLearnと競合する量子化モデル)モデルの詳細については、バブルにカーソルを合わせるか、下の「凡例を表示」をクリックしてください。凡例を表示#モデルAccTPSBPWByteShape GPU-1IQ2_XXS-2.56bpw0.9304119.132.56 GPU-2IQ3_XXS-2.88bpw0.9656110.782.88 GPU-3IQ3_XS-3.01bpw0.9726108.083.01 GPU-4IQ3_S-3.23bpw0.9872103.573.23 GPU-5IQ4_XS-3.84bpw0.996393.663.84UnslothAUD-IQ2_S0.8633115.342.49BUD-Q2_K_XL0.9572108.122.82CUD-IQ3_XXS0.9359102.873.14DUD-IQ3_S0.955597.873.47EUD-Q3_K_XL0.976093.463.80FUD-IQ4_XS0.992089.694.13GUD-Q4_K_S0.987785.284.46HUD-Q4_K_M0.970381.634.79IUD-Q4_K_XL0.987177.515.12JUD-Q5_K_S0.987873.605.44KUD-Q5_K_M0.989769.875.77LUD-Q5_K_XL0.990567.596.10ISTA-DASLabaGSQ-RCO-IQ2_XS0.8647114.112.50bGSQ-RCO-IQ2_S0.9364110.192.75cGSQ-RCO-IQ3_XXS0.9438105.673.00dGSQ-RCO-IQ3_S0.994395.493.50BartowskyaIQ2_XXS0.7986115.772.72bIQ2_S0.9296109.392.99cQ2_K0.961699.293.45dIQ3_XXS0.959495.833.68eIQ3_XS0.958291.143.89fIQ3_M0.966789.084.06AtomicChataAD-IQ2_XXS0.8385119.532.58bAD-IQ2_XS0.9296112.392.85cAD-IQ2_S0.9061103.463.22dAD-IQ3_XXS0.964498.223.50eAD-IQ3_S0.973091.724.04再びGPU-5は私たちのデフォルトの選択肢であり、93.7トークン/秒に達します。コンテキスト長が少し長い場合やTPSが少し良い場合はGPU-4を選択してください。24 GB:RTX 4090およびRTX 3090どちらの24 GBカードも、5つのShapeLearnモデルすべてに適合します。スループットが異なるため別々にプロットしますが、両方のカードで順序は同じです。RTX 4090RTX 4090は同じパターンを維持しています。GPU-5がデフォルトで、59.2トークン/秒に達します。RTX 4090:トークン/秒 vs 品質(フルShapeLearnと競合する量子化モデル)モデルの詳細については、下の「凡例を表示」をタップしてください。RTX 4090:トークン/秒 vs 品質(フルShapeLearnと競合する量子化モデル)モデルの詳細については、バブルにカーソルを合わせるか、下の「凡例を表示」をクリックしてください。凡例を表示#モデルAccTPSBPWByteShape GPU-1IQ2_XXS-2.56bpw0.930478.672.56 GPU-2IQ3_XXS-2.88bpw0.965672.892.88 GPU-3IQ3_XS-3.01bpw0.972671.123.01 GPU-4IQ3_S-3.23bpw0.987267.773.23 GPU-5IQ4_XS-3.84bpw0.996359.163.84UnslothAUD-IQ2_S0.863378.232.49BUD-Q2_K_XL0.957272.792.82CUD-IQ3_XXS0.935967.243.14DUD-IQ3_S0.955563.023.47EUD-Q3_K_XL0.976059.133.80FUD-IQ4_XS0.992055.624.13GUD-Q4_K_S0.987752.444.46HUD-Q4_K_M0.970349.774.79IUD-Q4_K_XL0.987147.085.12JUD-Q5_K_S0.987844.805.44KUD-Q5_K_M0.989742.455.77LUD-Q5_K_XL0.990540.846.10ISTA-DASLabaGSQ-RCO-IQ2_XS0.864777.802.50bGSQ-RCO-IQ2_S0.936473.342.75cGSQ-RCO-IQ3_XXS0.943869.263.00dGSQ-RCO-IQ3_S0.994362.413.50BartowskyaIQ2_XXS0.798675.282.72bIQ2_S0.929671.272.99cQ2_K0.961663.743.45dIQ3_XXS0.959461.033.68eIQ3_XS0.958258.203.89fIQ3_M0.966756.164.06AtomicChataAD-IQ2_XXS0.838579.512.58bAD-IQ2_XS0.929674.192.85cAD-IQ2_S0.906167.403.22dAD-IQ3_XXS0.964463.603.50eAD-IQ3_S0.973057.384.04RTX 3090古いですが、これらの測定でもまだ高速です。RTX 3090:トークン/秒 vs 品質(フルShapeLearnと競合する量子化モデル)モデルの詳細については、下の「凡例を表示」をタップしてください。RTX 3090:トークン/秒 vs 品質(フルShapeLearnと競合する量子化モデル)H