HN 日本語サマリー

← 一覧へ戻る
AI・機械学習

ポケットスケール推論のベンチマーキング

Benchmarking Pocket-Scale Inference (artificialanalysis.ai)

12 pointsby sys425900 コメント

要約

Artificial Analysisは、モバイルデバイスでのAIモデルのパフォーマンスを評価するため、小型モデル(8GBメモリに収まるもの)を対象としたベンチマーキングを実施しました。このテストでは、iPhone 17 ProとGalaxy S26 Ultraを使用し、モデルの知能と推論速度、メモリ使用量などを測定しました。結果は、モデルの性能とデバイスの制約とのトレードオフを示しており、モバイル環境でのAI活用における重要な指標となります。

全文翻訳

Artificial AnalysisK2–20Wモバイルフォン→15W–2kWラップトップ&ワークステーション2026年後半700W–600kWデータセンターシステム→ポケットスケール推論のベンチマーキング モバイルフォンで小型モデルをベンチマークします。Artificial Analysisのテストは、実際のモバイルデバイスの使用状況を代表するように選択されたベンチマークセットにおけるモデルの知能をカバーしており、Liquid AIと提携してデバイス自体で測定された実際の推論データを収集しています。注意:Liquid AIの推論測定プロセスは、独立して検証済みです。 「小型」モデルとは、量子化後、8GBのメモリに収まるすべてのモデルを指し、KVキャッシュを8Kコンテキストで含みます。すべてのルールとプロセスは、方法論ページで確認できます。 iPhone 17 Pro 12 GB Galaxy S26 Ultra 12 GB iPhone 17 Pro 12 GB Galaxy S26 Ultra 12 GB インテリジェンスと推論パフォーマンスの概要 インテリジェンス vs. 生成時間 インテリジェンス vs. ピークメモリ 平均スコア(最大コンテキスト16K) vs. エンドツーエンド生成時間 |iPhone 17 Pro 実際のモバイルデバイスの使用状況を代表するように選択された5つの評価の単純平均:BFCL(サブセット)、IFBench、AA-Omniscience、GPQA Diamond、MATH-500・コンテキストは16Kトークンに制限・E2E時間は、1024トークンのプロンプトを処理し、256トークンの応答を生成するためにかかる秒数 23 of 39 models 最も魅力的な象限 パレート線 Nanbeige Liquid AI Ornith AI Alibaba Google TII UAE Inclusion AI AI9Stars IBM OpenBMB 平均スコア(モバイルデバイスベンチマークセット) 実際のモバイルデバイスの使用状況を代表するように選択された5つの評価の単純平均。ポータブルハードウェアに収まる小型モデルに対して実行され、それぞれArtificial Analysisによって独立して測定されました。詳細については、方法論を参照してください。 エンドツーエンド生成時間 1024トークンのプロンプトを処理し、256トークンの応答を生成するための総壁時計時間。これは、使用されるハードウェアとモデルのアーキテクチャに根本的に依存しており、モデルの冗長性や、より多くの、またはより少ないターンを使用する傾向の影響は含まれていません。 推論パフォーマンス エンドツーエンド生成時間 出力速度 ピークメモリ エンドツーエンド生成時間 |iPhone 17 Pro 1024トークンのプロンプトを処理し、256トークンの応答を生成するための秒数・低いほど良い 23 of 39 models エンドツーエンド生成時間 1024トークンのプロンプトを処理し、256トークンの応答を生成するための総壁時計時間。これは、使用されるハードウェアとモデルのアーキテクチャに根本的に依存しており、モデルの冗長性や、より多くの、またはより少ないターンを使用する傾向の影響は含まれていません。 モデルインテリジェンス 平均スコア(最大コンテキスト16K) 平均スコア(最大コンテキスト64K) 平均スコア(最大時間1分) 平均スコア(モバイルデバイスベンチマークセット、最大コンテキスト16K) |iPhone 17 Pro 実際のモバイルデバイスの使用状況を代表するように選択された5つの評価の単純平均:BFCL(サブセット)、IFBench、AA-Omniscience、GPQA Diamond、MATH-500・コンテキストは16Kトークンに制限・高いほど良い 23 of 39 models スコア(最大コンテキスト64K) パフォーマンス測定は、モデルがこのデバイスに収まらなかったか、時間制限を超えたため省略されました。 Nanbeige Liquid AI Ornith AI Alibaba Google TII UAE Inclusion AI NVIDIA AI9Stars Prism ML IBM OpenBMB 平均スコア(モバイルデバイスベンチマークセット) 実際のモバイルデバイスの使用状況を代表するように選択された5つの評価の単純平均。ポータブルハードウェアに収まる小型モデルに対して実行され、それぞれArtificial Analysisによって独立して測定されました。詳細については、方法論を参照してください。 これらのモデルのArtificial Analysisインテリジェンスインデックススコアをお探しですか?以下のモデルは、当社のフルインデックスで評価されており、スコアは各モデルページで確認できます。 Gemma 4 31B (Reasoning) LFM2.5-2.6B Ling 3.0 Tiny Ministral 3 3B Ministral 3 8B Qwen3.5 9B (Reasoning) Qwen3.6 27B (Reasoning) Qwen3.6 35B A3B (Reasoning) トークン効率 コンテキストバジェット超過 インテリジェンス vs. 出力トークン コンテキストバジェット超過 モデルで実行されたすべての評価にわたる、16Kトークン制限で終了した(完了しなかった)生成数・低いほど良い 23 of 39 models Liquid AI Google IBM NVIDIA Alibaba Nanbeige Ornith AI TII UAE Inclusion AI AI9Stars OpenBMB Prism ML 評価の内訳 モバイルデバイスベンチマークセット評価(最大コンテキスト16K) |iPhone 17 Pro Artificial Analysisによって独立して測定されたインテリジェンス評価・コンテキストは16Kトークンに制限・高いほど良い 23 of 39 models BFCL ツール呼び出し(インデックスサブセット) IFBench 指示追従 AA-Omniscience 精度 AA-Omniscience 非幻覚率 1 - 幻覚率 GPQA Diamond 科学的推論 MATH-500 定量的推論