HN 日本語サマリー

← 一覧へ戻る
AI・機械学習

GPT-6.1 Sol、わずか7日でGPT-6 Solに取って代わり、Astra級の知能に迫る

GPT-6.1 Sol replaces GPT-6 Sol after just 7 days, with near-Astra intelligence (artificialanalysis.ai)

80 pointsby theanonymousone101 コメント

要約

Artificial Analysisは、わずか7日間でGPT-6 SolをGPT-6.1 Solに置き換えたと発表しました。GPT-6.1 Solは、GPT-6 Astraに1ポイント劣るものの、コストは4分の1未満で、知能指数(Intelligence Index)で4ポイント向上しています。これにより、AIモデルの性能とコスト効率の新たな基準が打ち立てられました。

全文翻訳

Artificial Analysis 全記事 2026年9月29日 GPT-6.1 Sol、わずか7日でGPT-6 Solに取って代わり、Astra級の知能に迫る モデルページを見る GPT-6.1 Solが、わずか7日でGPT-6 Solに取って代わりました。知能指数(Intelligence Index)ではGPT-6 Astraより1ポイント下ですが、タスクあたりのコストは4分の1未満です。価格はGPT-6 Solと同じく、入力/出力トークン100万あたり2ドル/10ドルですが、キャッシュ読み取り割引が90%から95%に上昇します。したがって、GPT-6.1 Solの全体的なエージェントワークロードにおけるブレンド価格は、GPT-6 Solよりもわずかに低くなります。これは、GPT-6 Solの当初のGPT-5.6 Solからの50%割引に続く、さらなる価格引き下げとなります。 主なポイント: ➤ Astra級の知能に迫る:GPT-6.1 Solは、知能指数においてGPT-6 Sol比で4ポイント、GPT-5.6 Sol比で5ポイント向上し、GPT-6 Astraより1ポイント下に着地しました。エージェントによる知識作業で大幅な進歩を遂げ、AA-Briefcase v1.1とGDPval-AA v2.1でそれぞれ4ポイントと5ポイント向上しました。その他の注目すべき進歩には、Terminal-Bench 4.0での12ポイントジャンプ、Humanity’s Last Examでの5ポイントジャンプ、GDP.pdfでの6ポイントジャンプ、そして幻覚率が60%から54%に低下したAA-Omniscience Accuracyでの8ポイントジャンプが含まれます。 ➤ コスト効率のフロンティアを押し広げる:最大努力時、GPT-6.1 Solの知能指数あたりのコストはGPT-6 Astraの4分の1未満(0.72ドル対3.26ドル)です。また、タスクあたりのコストはGPT-6 Sol(1.05ドル)より31%、GPT-5.6 Sol(1.99ドル)より64%低くなります。GPT-6.1 Solのあらゆる努力レベルがコスト効率のパレートフロンティアを押し広げます。特定の知能レベルに対して、これより安いモデルは存在しません。 ➤ トークン効率のフロンティアを押し広げるが、GPT-6 Solよりわずかに多くの出力トークンを使用:GPT-6.1 Solは、努力レベル全体でGPT-6 Solより約10〜30%多くの出力トークンを使用します。しかし、知能指数のスコアの上昇により、低および中程度の努力レベルではトークン効率のパレート最適性を達成します。 ➤ コーディングエージェントインデックスでの進歩:GPT-6.1 Solは、Artificial Analysis Coding Agent Indexにおいて最大努力時でGPT-6 Solより3ポイント向上し、GPT-6 Astraより2ポイント下です。GPT-6.1 Solは、Artificial Analysis Coding Agent Index対タスクあたりのコストのパレートフロンティアの低価格帯を支配します。GPT-6.1 Sol (xhigh) は、コストの15%未満でGPT-6 Astraより1ポイント上回ります。これはGPT-6 Sol (max) からの6ポイントの進歩を表します。xhigh努力設定がmax努力設定を3ポイント上回ることが観察されました。 トークン効率 GPT-6.1 Solは、知能指数において努力設定全体でGPT-6 Solより10〜30%多くの出力トークンを使用します。しかし、知能の上昇により、低および中程度の努力設定はトークン効率のパレート最適性を達成します。 AA-Omniscience 最大努力時、GPT-6.1 SolはAA-Omniscience Accuracyで8ポイントジャンプし、幻覚率が6ポイント低下しました。 AA-Briefcase GPT-6.1 SolはAA-Briefcaseで約80 Elo改善しました。これは、ルーブリックスコアと分析品質Eloの上昇によって推進されていますが、プレゼンテーションEloはわずかに低下しました。 評価別の結果 Artificial Analysis Intelligence Index v4.3.2の個々の評価の内訳。 他の主要モデルとの比較は以下でご覧ください:artificialanalysis.ai/models/releases/gpt-6-1-sol 最新情報 韓国のAIラボUpstageがSolar Mini 4をリリース 韓国のAIラボUpstageは、Artificial Analysis Intelligence Indexで24を記録したSolar Mini 4をリリースしましたが、GPT-6 Luna (max) と同等のトークン単価にもかかわらず、タスクあたりのコストは約5倍です。 2026年9月30日 Gemini 4 Argon:Googleが達成知能トップ3に返り咲く Googleの新しいGemini 4 Argonは、割引価格でGPT-6 Astraと同等のArtificial Analysis Intelligence Indexを達成し、コストはGPT-6 Astraの60%です。Googleは達成知能においてトップ3ラボの地位を取り戻しました。 2026年9月30日 AA-AgentPerf-Local:ラップトップとワークステーションでのローカルAIエージェントのベンチマーク ラップトップやワークステーションでエージェントAIがどのくらいの速さで動作するかをテストするためのオープンソースツール。DGX Spark、Ryzen AI Halo、MacBook Pro (M5 Pro)、RTX 5090のローンチ結果を4つのオープンウェイトモデルで示します。 2026年9月29日