HN 日本語サマリー

← 一覧へ戻る
AI・機械学習

Opus 5 はなぜ使い勝手が悪く感じるのか?

Why does Opus 5 feel worse to work with? (mun-logadan.github.io)

873 pointsby numeri794 コメント

要約

Opus 5 は、以前のバージョンや Fable と比較して、使い勝手が悪く感じられるという意見が表明されています。これは、モデルが不明確な意図に対して質問するのではなく、憶測で進める傾向があるためであり、ベンチマークでの高スコアを追求する開発方針が原因であると推測されています。実世界では曖昧さがつきものであるため、このようなモデルの挙動は、コーディングエージェントに期待される「確認を求める」という性質と相反すると指摘されています。

全文翻訳

Opus 5 はなぜ使い勝手が悪く感じるのか? 2026年8月14日投稿 :: ソースコード Opus 5 はなぜ使い勝手が悪く感じるのか? 私の意見、そして話を聞いた同僚たちの意見では、Opus 5 を使うことは Opus 4.7、Opus 4.8、Fable と比較してダウングレードのように感じられます。能力が後退したとは主張しません。Opus 4.7 や Opus 4.8 よりも能力が高く、ベンチマークでも Fable に匹敵しますが、これらの他のモデルの方が使い勝手が良いと感じます。これは、それらのモデルが、私の意図が不明確な場合に立ち止まって質問し、確認せずに憶測を立てず、尋ねずに私の計画を再解釈したり更新したりしないためだと信じています。このため、Opus 5 が必要とするような注意深い監視は不要です。 根拠のない推測 これは、Anthropic、そして現在のフロンティアラボ全般における2つの複合的な力の結果だと推測しています。第一に、自己改善型のAIを作成し、AGI/ASIへと再帰的にブートストラップできる能力を持つAIを作成したいという願望です。第二に、ベンチマークで高得点を取るというプレッシャーです。多くのベンチマークタスクは、定義が不十分であったり、不公平であったり、ハック可能であったり、あるいは壊れているという公然の秘密ですが、良いベンチマークタスクは自己完結型です。それは解決可能です。合格するためにヒントや、タスク作成者の心を読んだり、外部情報が必要だったりしません。それは、良いタスクに正解が1つしかないという意味ではなく、曖昧に正しいすべての答えを等しく採点すべきだということです。 ベンチマークでうまくいくモデルを選択すること(そして実際、それらのために、あるいは一般的にRLVRタスクでトレーニングすること)は、本質的に曖昧さの中で大胆で、通常は正しい憶測をするモデルを選択することになります。それは、明確化や指示を求めるために立ち止まる傾向のあるモデルを罰します。残念ながら、それはコーディングエージェントに私たちが最も望むことなのです。どんなに努力しても、文脈、意図、ビジネスへの影響、予算の制約、その他すべてを書き出して、コーディングエージェントがアクセスできるようにすることはほぼ不可能です。曖昧さと、選択を迫られる状況は避けられず、エージェントが必要なときに立ち止まって質問してくれると良いのですが。現実世界はベンチマークではありません。すべての質問に保証された正解があるわけでも、正解のセットがあるわけでもありません。そして、現実世界の結果が伴う場合、私はエージェントに最善の推測をさせたくありません!