AI・機械学習
Kimi K3と、ペリカンベンチマークからまだ学べること
Kimi K3, and what we can still learn from the pelican benchmark (simonwillison.net)
要約
この記事は、中国のAIラボであるMoonshot AIが発表した最新の大規模言語モデル「Kimi K3」について解説しています。2.8兆パラメータを持つKimi K3は、他の主要モデルと比較して性能や価格、トークン効率の面で評価されており、特にペリカンベンチマークを用いたテストとその意義、限界について考察しています。
全文翻訳
Simon Willison’s Weblog
購読
スポンサー: Atlassian — エージェントに計画を与えよう。プロンプトではなく。新しいJiraの機能が、AIネイティブなソフトウェア開発のためのフルコンテキストを解除します。Jiraから直接、Claude、Cursor、またはGitHub Copilotにタスクを割り当てることができます。詳細はこちら
Kimi K3と、ペリカンベンチマークからまだ学べること
2026年7月16日
中国のAIラボであるMoonshot AIは今朝、Kimi K3を発表し、「これまでのモデルの中で最も高性能で、2.8兆パラメータを持つ」と説明しました。現在、ウェブサイトとAPIを通じて利用可能ですが、オープンウェイト版は「2026年7月27日までに」リリースされる予定です。Moonshotはこれを初の「オープン3Tクラスモデル」(2.8兆を3兆に丸めていると思われます)と呼んでおり、DeepSeekの1.6T v4 Proから王座を奪いました。彼らの自己申告ベンチマークでは、K3はClaude Opus 4.8 maxとGPT-5.5 highをほとんど上回っていますが、Claude Fable 5とGPT-5.6 Solには劣ります。Artificial Analysisレポートからのいくつかのハイライト:
「当社のプライベートな長期間の知識作業評価において、Kimi K3は総合Eloスコア1547を達成し、Kimi K2.6から+732ポイント向上し、Claude Fable 5に次ぐ位置にいます。」
「タスクあたりのコスト(0.94ドル)はGPT-5.6 Sol(1.04ドル)と同程度で、Opus 4.8(1.80ドル)の約半額、オープンウェイトの競合よりも高価です。」
「Artificial Analysis Intelligence IndexにおけるKimi K3のトークン使用量は大幅に減少し、K2.6よりも出力トークンを21%少なく使用しました。」
このモデルは、Arena.aiのFrontend Codeアリーナでもトップとなり、Claude Fable 5さえも上回りました。新しいモデルは価格設定が注目に値します。入力トークン100万あたり3ドル、出力トークン100万あたり15ドルで、これはAnthropicのClaude Sonnetシリーズと同レベルであり、中国のAIラボがこれまでにリリースした中で最も高価なモデルとなります。これは、Kimi K2.6の0.95ドル/4.2ドルといった以前のモデルからの大幅な増加です。2.8兆パラメータというのも、1Tモデルの2倍以上です。
しかし、それはペリカンにどう影響するのでしょうか?私はOpenRouter(Moonshot APIキーのサインアップを避けるため)とllm-openrouterプラグインを使用して、ペリカンが自転車に乗っているSVGを生成しました。
llm -m openrouter/moonshotai/kimi-k3 'Generate an SVG of a pelican riding a bicycle'
こちらがそのトランスクリプトです。結果は以下の通りです。
そのペリカンは95入力トークンと16,658出力トークン(13,241は推論トークン)を消費し、合計コストは25セントでした!K3は画像入力を受け付けるため、上記のレンダリングされたSVG(私のaltテキストプロンプト付き)に対して実行し、0.6セントで以下の結果を得ました。
「白いスカーフを巻いた白いペリカンが、白い破線のある灰色の道で赤い自転車に乗っているカートゥーンイラスト。ペリカンは大きなオレンジ色のくちばしと水かきのあるオレンジ色の足でペダルを漕いでおり、後ろには白いモーションラインがあります。背景には白い雲のある明るい青い空、黄色い太陽、飛んでいる2羽の小さな黒い鳥、そして前景には小さな白い花が咲いた緑の草があります。」
ペリカンから何を学べるか?
私の「Generate an SVG of a pelican riding a bicycle」というテストは、今から21ヶ月前になります。これは決して特に優れたベンチマークではありませんでした。これらのモデルを比較することがどれほど不条理に難しいかというジョークとして始まったのですが、最初の1年間は、モデルの実際の性能と驚くほど相関があることが判明しました。その関連性はほとんど失われています。GPT-5.6とClaude Fable 5のペリカンはGLM-5.2に凌駕されており、GLMをどれだけ気に入っていても、それがFableクラスのモデルだとは思いません。(ラボがベンチマークのためにトレーニングしているとはまだ確信が持てません。もしそうなら、もっと良い結果を期待するでしょう。Geminiが動物と乗り物の組み合わせを最適化している可能性はあります!)ペリカンの最大の限界は、今日のモデルにとって最も重要なこと、つまりエージェントによるツール呼び出しと、会話が長くなるにつれてツールを確実に操作する能力に全く触れていないことです。ですから、モデルを比較するためにペリカンを使わないでください!
とはいえ、私は自分でベンチマークを実行することから、依然としてかなりの価値を得ています。まず、それは実際にモデルを試すための強制的な関数です。もし私がペリカンを見せたら、それは私がそのプロンプトをモデルで実行できたことを意味します。モデルに公式APIがあればそれを使用し、オープンウェイト(そして128GB M5 MacBook Proに収まるほど小さい)であれば、通常はllama.cpp、LM Studio、またはOllama経由で自分のマシンで実行しようとします。OpenRouterは通常、新しいAPIキーを必要とせずに公式APIへのプロキシを提供してくれるため、よく使用します。私のペリカンのほとんどは、LLM CLIツールを使用して生成されており、それが最新モデルを(プラグインの1つを通じて)サポートしていることを確認するよう促してくれます。
さらに重要なのは、単一のプロンプト「Generate an SVG of a pelican riding a bicycle」を実行する行為でさえ、興味深いモデルの特性を明らかにできることです。今日のKimi K3の結果を考えてみてください。これらの単純なプロンプトを実行したことで、モデルに関するいくつかの点が強調されました。現在、推論のレベルは「max」の1つしかありません。そしてそれは現れています。モデルは応答の3,417トークンを出力するために13,241の推論トークンを消費しました。これは高価です。ペリカンは25セントかかりました!プロンプト「Generate an SVG of a pelican riding a bicycle」は、どのようにして95入力トークンになるのでしょうか?OpenAIのトークナイザーは10、AnthropicのOpus 4.6は10、Opus 4.7は30、Sonnet 5/Fable 5は25とカウントします。Kimi K3に「hi」とプロンプトすると86トークンとカウントされ、85トークンの隠しシステムプロンプトが存在する可能性が示唆されます。しかし、それは漏洩を拒否しました。ビジョンはうまく機能します。生成されたaltテキストは非常に優れています。
K3は現在、思考レベルが1つしかないですが、私は最近、異なる思考レベルで同じペリカンプロンプトを実行することからかなりの価値を得ており、それらがどのような影響を与えるかを素早く把握しています。例えば、GPT-5.6モデルファミリーの私のマトリックスは以下の通りです。
しかし、ペリカンテストから私が得る主なものは次のとおりです。
モデルにプロンプトするための「Hello World」演習
単純なタスクのコストと推論の概算
モデルが有効なSVGを出力でき、幾何学と空間認識の基本的なアイデアを持っていることの確認。これは、私のラップトップで動作する小規模なモデルにとっては、さらに大きな意味があります。
同じモデルファミリーのリリース間でペリカンを比較することは、依然として興味深いです。K3のペリカンは、Kimi 2.5からの顕著な改善です。それは、私がそれを試したことを示す共有できるものです。さらに、ペリカンを含むコメントは、現時点ではHacker Newsの伝統のようなものであり、私が遅れるたびに、どこにあるのかと尋ねるコメントが寄せられます!
2026年7月16日午後8時19分投稿 · Mastodon、Bluesky、Twitterでフォローするか、ニュースレターを購読してください
最近の記事
新しいGPT-5.6ファミリー:Luna、Terra、Sol - 2026年7月9日
sqlite-utils 4.0、データベーススキーママイグレーション対応 - 2026年7月7日
これはKimi K3であり、Simon Willisonが2026年7月16日に投稿したペリカンベンチマークからまだ学べることです。ai 2,126 generative-ai 1,880 llms 1,847 llm-pricing 83 pelican-riding-a-bicycle 127 llm-release 216 ai-in-china 98 artificial-analysis 7 moonshot 8 kimi 12 前の記事: 新しいGPT-5.6ファミリー:Luna、Terra、Sol
月次ブリーフィング
月間最も重要なLLM開発のキュレーションされたメールダイジェストを受け取るために、月額10ドルで私をスポンサーしてください。私に支払って、より少ない情報を受け取ってください!スポンサー&購読
開示
コロフォン
© 2002 2003 2004 2005 2006 2007 2008 2009 2010 2011 2012 2013 2014 2015 2016 2017 2018 2019 2020 2021 2022 2023 2024 2025 2026