HN 日本語サマリー

← 一覧へ戻る
AI・機械学習

GPT-6 Astraのコードレビュー:性能向上、プライバシー、コスト

GPT-6 Astra in code review: Gains, privacy, and cost (coderabbit.ai)

4 pointsby cebert1 コメント

要約

OpenAIのGPT-6 Astraは、コードレビューにおいてGPT-5.6 SolやOpus 5と比較して、特にファイル間を跨ぐ複雑なレビューでバグ検出能力が大幅に向上したことが評価されました。しかし、その高度な推論能力はAPI料金の増加を伴い、コストパフォーマンスの評価が重要となります。Astraはコードレビュー以外にも、研究合成や運用調査など、散在する情報から関係性を推論するタスクへの応用が期待されています。

全文翻訳

コードレビューで最も困難な作業は、変更された行の外側で行われることが多いです。ある変更は、単独で見れば正しくても、システム内の他の場所のコードを壊してしまう可能性があります。それが、OpenAIのGPT-6 Astraに関する初期の結果が最も興味深い理由です。私たちの評価では、AstraはGPT-5.6 Solよりも約4%、Opus 5よりも22%多くのラベル付けされたバグを、実行可能な発見を通じて検出しました。最大の飛躍は、より困難なファイル間レビューで、Astraの性能向上はSolに対して20%、Opus 5に対して33%に達します。その能力を顧客規模で利用するには、顧客データを保護し、モデルの公開API料金を評価することも意味します。 Astraがコードレビューに追加したもの ここで私たちの測定基準は、実行可能なバグカバレッジです。これは、モデルが開発者が対応できる発見を通じて、どれだけのラベル付けされたバグを検出するかを意味します。カバレッジは小数点以下1桁に丸められ、相対的な増加は丸められていない値を使用します。GPT-5.6 Solに対する全体的な増加は、この最初の評価尺度では控えめに見えます。この評価には、より単純なレビューも含まれており、より強力なモデルが差別化する余地が少ない可能性があります。Astraのより大きな利点は、より困難なファイル間サブセットに現れます。これは初期の、方向性のある結果です。カバレッジは小数点以下1桁に丸められ、相対的な増加は丸められていない値を使用します。このチャート内のモデルを比較してください。レビューの難易度が全体評価と異なるためです。より困難なファイル間の比較は、より有望です。Astraの相対的な利点は、Solに対して20%、Opus 5に対して33%に増加します。これは、変更の意図をコードベース全体に分散した結果と結びつける価値を示唆しています。これらの結果は、レビューパフォーマンスの一部の側面を記述したものです。全体的なレビュー品質のランキングを確立したり、チームの欠陥率を予測したり、プルリクエストごとに同じ増加を約束したりするものではありません。 コンテキストを活かす 大きなコンテキストウィンドウは、情報のためのスペースを作り出します。有用な推論には、モデルがどの部分が重要かを特定し、それらを接続し、証拠に裏付けられた結論に達する必要があります。私たちの解釈では、Astraの最も興味深い進歩は、適切な情報の接続にあります。より困難なファイル間レビューでのより大きな増加は、関連情報が分散している作業での進歩を示唆しています。それらは、その進歩の原因を特定したり、より多くのコンテキストだけがモデルのパフォーマンスを向上させることを証明したりするものではありません。OpenAIは、Astraをコード、ブラウザ、プロフェッショナルソフトウェアを横断する多段階の作業のために位置づけています。モデルで構築するチームにとって、有用な質問は、追加の推論がそのコストを正当化するほど結果をどれだけ変えるかということです。散在する証拠を持つ困難なタスクは、より安価なモデルがすでに確実に処理しているルーチンタスクよりも、調査する価値のある候補となります。それは、すべてのセッションをAstraに切り替え、推論の努力を最大化し、それを自由に実行することを意味するわけではありません。 より強力な推論はプレミアムを伴う Astraの標準API料金は、Astraの公開価格によると、入力トークン100万あたり10ドル、出力トークン100万あたり50ドルです。Claude Fable 5.1は、キャッシュ価格は異なりますが、同じ基本の入出力レートを持っています。Anthropicの価格設定ドキュメントには、完全な内訳が記載されています。これらの価格をコンテキストに入れるために、100,000のキャッシュされていない入力トークンと、推論トークンを含む10,000の請求可能な出力トークンを使用する例示的なタスクを検討してください。トークン使用量を一定に保つことで、公開レートを比較しやすくなります。実際のタスクコストは使用量によって異なります。すべての数値は、2026年9月4日に確認された、公開されている標準API価格を使用しています。OpenAIの数値は短コンテキストレートを使用しています。Solの公開プロモーション価格は、少なくとも2026年11月21日まで利用可能です。この例では、キャッシュ、キャッシュ書き込み、ツール、リトライ、地域別割増、サービスティア調整は除外されています。実際のタスクでは異なる数のトークンが使用される場合があります。 | Model | Input / 1M tokens | Output / 1M tokens | Illustrative task cost | |---|---|---|---| | GPT-5.6 Luna | $0.20 | $1.20 | $0.032 | | GPT-5.6 Terra | $2.00 | $12.00 | $0.32 | | GPT-5.6 Sol | $4.00 | $20.00 | $0.60 | | GPT-6 Astra | $10.00 | $50.00 | $1.50 | | Claude Fable 5.1 | $10.00 | $50.00 | $1.50 | その固定使用量では、AstraはSolの2.5倍、Terraの約4.7倍、Lunaの約47倍のコストがかかります。これらは意味のあるプレミアムです。それらは、完了したタスクあたりのコストの違いの予測ではありません。より少ないトークンまたはより少ない試行を必要とするモデルは、ギャップを狭める可能性があります。OpenAIは、トークン価格が高いにもかかわらず、一部の独自の評価ではAstraのタスクコストが低いと報告しています。そのため、トークン価格または機能スコアのいずれかが決定を下すと仮定するのではなく、完了した成果あたりの総コストを自分の作業で測定する価値があります。OpenAIの効率に関するガイダンスをお読みください。 コードレビューを超えて転移する可能性のあるもの 転移可能なアイデアは、別々のソース間の関係性についての推論です。私たちの発見は、評価する価値のあるいくつかの用途を示唆していますが、これらのタスクでAstraを測定したわけではありません。 研究合成:矛盾する報告を照合し、主張を証拠に結び付け、各文書の要約では見逃されるギャップを特定する。 運用調査:ログ、インシデントノート、ランブックから一貫した説明を組み立て、観察と仮説を分離する。 要件とポリシー分析:提案された変更を仕様、内部ポリシー、実装計画にトレースして、専門家レビューのために矛盾をフラグ付けする。 ドキュメントとスプレッドシートの作業:レポートとそのサポート資料全体で、仮定、数式、および記述的な結論が一致しているかを確認する。 共通の構造は、散在する証拠であり、その部分間に依存関係があります。回答を確認できる、範囲を限定した作業から始めてください。 Astraがあなたのワークフローや製品に適しているかどうかをテストする最も簡単な方法は、同じタスクで現在のモデルと並行して実行し、回答の品質、検証時間、および総コストを比較することです。 NIGHTSHIFTの構築とバランス調整 また、Astraを使用してゲーム全体を構築しました。NIGHTSHIFTは、GodotとGDScriptで作られたアクションRPGです。その最も困難な問題は、システム間の相互作用のバランスを取り、ゲームが変化するにつれてそのバランスを再評価することでした。 NIGHTSHIFT、人間による指示と反復を通じてAstraで構築された。 これは、7つのキャラクタークラス、Path of Exileの伝説的なパッシブノードツリーにインスパイアされた988ノードのパッシブスキルツリー、アクティブスキル、ルーンとソケット可能なアップグレード、スキル進化、および協力プレイを横断する推論を意味しました。10幕の40ゾーンにわたるキャンペーンは、ますます複雑な敵の群れと組み合わせを導入します。1つのクラスを変更すると、どのアップグレードが役立つか、スキルがどのように進化するか、パーティーが何に対処できるかにも影響します。開発中にコアシステムに根本的な変更を加え、Astraにその結果を処理し、バランスを取り直すように依頼しました。 このようなゲームにおける「バランス」は、魅力的なゲームプレイにとって最も困難な創造的な課題です。進行、戦闘、難易度を一貫させながら、広範な変更を行ったり、まったく新しいゲームシステムやメカニズムを導入したりするにはどうすればよいでしょうか?また、プレイヤーがクラス、ステータス、アイテム、パッシブ、アクティブスキルの巧妙な組み合わせを通じて、強力なエンドゲームビルドを発見できるようにしたいと考えました。課題は、中間ゲームに到達することさえ不確実な進行を形成することでしたが、創造性と実験は壮観な方法で報われる可能性がありました。それらの組み合わせを見つけることの報酬は、敵の群れを満足のいくように溶かすことができるビルドを構築することでした。 そのプロセスは、他の作業の合間にゲームに戻り、Astraにフィードバックを与え、そのバランスを洗練させるために判断を下すための完全な自律性を与えることを意味しました。Astraはまた、ネイティブのPS5およびXboxコントローラーサポート、ネイティブmacOS、Web、Linuxビルド、および協力プレイも構築しました。協力プレイは特に興味深かったのは、Astraが同じコンピューティングとLANでプレイするためにそれを構築できたからです。これは、macOSを実行している同僚に配布したかったため、新しいXcodeプロジェクト、App Store Connectアカウントの生成、複数の証明書と権限の確立、および notarization が必要でした。Astraはそれらすべてを自律的に処理し、すでに持っていない権限と許可を求めるために一時停止するだけでした。楽しいボーナスとして、ゲームはエージェント自身がプレイヤーになるためにも構築されました。これは、ある意味でシュールな体験でした。