AI・機械学習
ポケットスケール推論のベンチマーキング
Benchmarking Pocket-Scale Inference (artificialanalysis.ai)
要約
Artificial Analysisは、モバイルデバイスでのAIモデルのパフォーマンスを評価するため、小型モデル(8GBメモリに収まるもの)を対象としたベンチマーキングを実施しました。このテストでは、iPhone 17 ProとGalaxy S26 Ultraを使用し、モデルの知能と推論速度、メモリ使用量などを測定しました。結果は、モデルの性能とデバイスの制約とのトレードオフを示しており、モバイル環境でのAI活用における重要な指標となります。
全文翻訳
Artificial AnalysisK2–20Wモバイルフォン→15W–2kWラップトップ&ワークステーション2026年後半700W–600kWデータセンターシステム→ポケットスケール推論のベンチマーキング
モバイルフォンで小型モデルをベンチマークします。Artificial Analysisのテストは、実際のモバイルデバイスの使用状況を代表するように選択されたベンチマークセットにおけるモデルの知能をカバーしており、Liquid AIと提携してデバイス自体で測定された実際の推論データを収集しています。注意:Liquid AIの推論測定プロセスは、独立して検証済みです。
「小型」モデルとは、量子化後、8GBのメモリに収まるすべてのモデルを指し、KVキャッシュを8Kコンテキストで含みます。すべてのルールとプロセスは、方法論ページで確認できます。
iPhone 17 Pro
12 GB
Galaxy S26 Ultra
12 GB
iPhone 17 Pro
12 GB
Galaxy S26 Ultra
12 GB
インテリジェンスと推論パフォーマンスの概要
インテリジェンス vs. 生成時間
インテリジェンス vs. ピークメモリ
平均スコア(最大コンテキスト16K) vs. エンドツーエンド生成時間
|iPhone 17 Pro
実際のモバイルデバイスの使用状況を代表するように選択された5つの評価の単純平均:BFCL(サブセット)、IFBench、AA-Omniscience、GPQA Diamond、MATH-500・コンテキストは16Kトークンに制限・E2E時間は、1024トークンのプロンプトを処理し、256トークンの応答を生成するためにかかる秒数
23 of 39 models
最も魅力的な象限
パレート線
Nanbeige
Liquid AI
Ornith AI
Alibaba
Google
TII UAE
Inclusion
AI
AI9Stars
IBM
OpenBMB
平均スコア(モバイルデバイスベンチマークセット)
実際のモバイルデバイスの使用状況を代表するように選択された5つの評価の単純平均。ポータブルハードウェアに収まる小型モデルに対して実行され、それぞれArtificial Analysisによって独立して測定されました。詳細については、方法論を参照してください。
エンドツーエンド生成時間
1024トークンのプロンプトを処理し、256トークンの応答を生成するための総壁時計時間。これは、使用されるハードウェアとモデルのアーキテクチャに根本的に依存しており、モデルの冗長性や、より多くの、またはより少ないターンを使用する傾向の影響は含まれていません。
推論パフォーマンス
エンドツーエンド生成時間
出力速度
ピークメモリ
エンドツーエンド生成時間
|iPhone 17 Pro
1024トークンのプロンプトを処理し、256トークンの応答を生成するための秒数・低いほど良い
23 of 39 models
エンドツーエンド生成時間
1024トークンのプロンプトを処理し、256トークンの応答を生成するための総壁時計時間。これは、使用されるハードウェアとモデルのアーキテクチャに根本的に依存しており、モデルの冗長性や、より多くの、またはより少ないターンを使用する傾向の影響は含まれていません。
モデルインテリジェンス
平均スコア(最大コンテキスト16K)
平均スコア(最大コンテキスト64K)
平均スコア(最大時間1分)
平均スコア(モバイルデバイスベンチマークセット、最大コンテキスト16K)
|iPhone 17 Pro
実際のモバイルデバイスの使用状況を代表するように選択された5つの評価の単純平均:BFCL(サブセット)、IFBench、AA-Omniscience、GPQA Diamond、MATH-500・コンテキストは16Kトークンに制限・高いほど良い
23 of 39 models
スコア(最大コンテキスト64K)
パフォーマンス測定は、モデルがこのデバイスに収まらなかったか、時間制限を超えたため省略されました。
Nanbeige
Liquid AI
Ornith AI
Alibaba
Google
TII UAE
Inclusion
AI
NVIDIA
AI9Stars
Prism ML
IBM
OpenBMB
平均スコア(モバイルデバイスベンチマークセット)
実際のモバイルデバイスの使用状況を代表するように選択された5つの評価の単純平均。ポータブルハードウェアに収まる小型モデルに対して実行され、それぞれArtificial Analysisによって独立して測定されました。詳細については、方法論を参照してください。
これらのモデルのArtificial Analysisインテリジェンスインデックススコアをお探しですか?以下のモデルは、当社のフルインデックスで評価されており、スコアは各モデルページで確認できます。
Gemma 4 31B (Reasoning)
LFM2.5-2.6B
Ling 3.0 Tiny
Ministral 3 3B
Ministral 3 8B
Qwen3.5 9B (Reasoning)
Qwen3.6 27B (Reasoning)
Qwen3.6 35B A3B (Reasoning)
トークン効率
コンテキストバジェット超過
インテリジェンス vs. 出力トークン
コンテキストバジェット超過
モデルで実行されたすべての評価にわたる、16Kトークン制限で終了した(完了しなかった)生成数・低いほど良い
23 of 39 models
Liquid AI
Google
IBM
NVIDIA
Alibaba
Nanbeige
Ornith AI
TII UAE
Inclusion
AI
AI9Stars
OpenBMB
Prism ML
評価の内訳
モバイルデバイスベンチマークセット評価(最大コンテキスト16K)
|iPhone 17 Pro
Artificial Analysisによって独立して測定されたインテリジェンス評価・コンテキストは16Kトークンに制限・高いほど良い
23 of 39 models
BFCL
ツール呼び出し(インデックスサブセット)
IFBench
指示追従
AA-Omniscience
精度
AA-Omniscience
非幻覚率
1 - 幻覚率
GPQA Diamond
科学的推論
MATH-500
定量的推論