HN 日本語サマリー

← 一覧へ戻る
プログラミング

Superpowers 6

Superpowers 6 (blog.fsck.com)

164 pointsby seahorseemoji66 コメント

要約

Superpowers 6は、AIコーディング支援ツールの最新版で、大幅な高速化とトークン消費量の削減を実現しました。AnthropicのFableモデルを活用し、コードレビューや仕様適合性の確認プロセスを最適化することで、ビルド時間を最大50%、コストを最大60%削減することに成功しました。このバージョンでは、複数のコーディングエージェントの連携や、 autoresearch 機能による継続的なコスト効率改善も可能になっています。

全文翻訳

2026年6月15日 Superpowers 6 #superpowers · #agents · #coding · #claude · #codex · #fable · #optimization この投稿は、当社のコーポレートブログ(https://primeradiant.com/blog)でもお読みいただけます。 TL;DR: Superpowers 6は、はるかに高速になり、同じ高品質な結果を得るために消費するトークンが大幅に少なくなりました。トークンを最大限に活用したい方は、このリリースを見送るかもしれませんが、ビルド時間を最大50%短縮し、コストを最大60%削減したいのであれば、Superpowers 6を気に入るはずです。 1週間前、私たちはSuperpowers 5.2のリリース準備を進めていました。「あと一つだけ」の改善を加えるために、すでに数回リリースを延期していました。Pi、Antigravity、Kimi Codeのサポートを追加しました。CodexやOpenCode、CursorでSuperpowersがより良く動作するようにしました。Superpowersのスキルの一部を、モデルやハーネスに依存しないように書き直し、どこでもより信頼性が高まるようにしました。また、Superpowersで新しいコーディングエージェントハーネスのサポートを追加する方法に関する新しい貢献ガイドも作成しました。Visual Brainstormingをより使いやすく、安全で、信頼性の高いものにするために多くの作業を行いました。また、コードレビューのサブエージェントが、単一のタスクではなく、ブランチ全体をレビューしてしまうという、非常に厄介なバグを含む、数多くのバグを修正しました。素晴らしいリリースになるはずでした。 そして、AnthropicがFableをリリース(そして取り下げ)しました。Fableにアクセスできた数日間、私はそれを最大限に活用しました。Superpowersユーザーから最もよく聞かれる不満は、トークンが高価であり、Superpowersが大量のトークンを消費することです。Superpowersを使ったソフトウェア開発は、それを使わない場合よりも遅いです。「遅い」という点は重要ではないはずです。これは、ビルドプロセスにおける自律的なサブエージェント駆動開発のオーケストレーション中に発生するからです。しかし、それは重要です。遅いのは楽しくありません。高価なのも楽しくありません。 Superpowersのビルドに時間がかかり、コストがかかる理由の多くは、多くのユーザーに良い結果をもたらす理由と同じです。ハンズオフで実装できるように、多くの事前の計画作業を行い、実装中は厳格なTDD(テスト駆動開発)を強制し、その後、Superpowers内のオーケストレーターがすべての変更を2つの軸でレビューします。エージェントは要求されたことを正確に、それ以上でもそれ以下でもなく実装したか。作業の質は十分か。やっていることの性質上、テストされていない実装をそのままにして一日を終えるよりも遅くなります。しかし、それが遅くて高価であることに満足したことはありません。 Fableが登場したとき、私はSubagent Driven Developmentをどの程度最適化できるかを見てみることにしました。15%程度のトークン消費量の削減を期待していました。それは達成しました。そして、それ以上のものを。最初の攻撃角度は、コーディネーターからレビュアーへのハンドオフを調べることでした。Fableは、数千のSubagent Driven Developmentセッションを分析し、コードと仕様適合性のレビューサブエージェントが、レビュー中に多くのgitコマンドを実行することがあることを発見しました。レビューするコミットを見つける方法の指示を、レビューパッケージ(フォーマットされた差分とその他のメタデータを含む)を事前に生成するシェルスクリプトに切り替えるだけで、トークン消費量と実時間を約10%削減できました。 その夜寝る前に、Fableに、私が寝ている間に評価の実行時間を15%削減するように指示しました。寝る前に、コードレビュアーと仕様適合性レビュアーを組み合わせた場合に何が起こるかを評価することを検討すべきだと、社内Slackに投稿しました。一晩で何が起こるかを期待していたかはよくわかりませんが、Fableが独立して同じ結論に達し、それをテストし、評価スイート全体で私が求めた追加の15%を節約したことを発見して目覚めることは、おそらく予想していませんでした。 次の夜、私は少し野心的になりました。 /goal これが終わったら、Superpowersのビルドループのコスト効率を改善するためにautoresearchループを実行してください。opusをコーディネーターとしてテストしてください。仮説ログを作成してください。実験を実行してください。少なくとも25回の実験を実行してください。 Fableは完全なautoresearchハーネスを構築し、一晩で実行しました。GitHubで構築されたものを見ることができます。 **==autoresearch== ループが完了しました:25回の実験が終了しました**(バックログとしてログされた4回を追加)、コーディネーターは常にopus、すべての仮説は事前にログに予測が記録され、現在evals `docs/experiments/2026-06-11-build-loop-==autoresearch==.md` (a76ddc9) で耐久性があります。ループの消費は約165ドルです。 ループが見つけたもの **出荷候補(E27):** opusコントローラー + 引き出された計画 + 条件付き俳句実装者 + 簡潔なレビュアー契約 + ナレーションレシピ + 最終レビューティアピン → **フラクタル 6.24ドル/6.60ドル**(ハンドプランのコンボ設定は11.67ドル〜14.84ドルでした)。植え付けられた欠陥ゲートは2/3で、1回の失敗はフォレンジックにレビュアーのばらつきとジャッジの厳格さに起因するとされました。簡潔な契約は、レビュアーのレポートを読むことで明示的に免責されました。N=5ゲートバッテリーは、スキルテキストとして出荷される前にまだ提供されていません。 **数値による勝利:** 簡潔なレビュアー契約(レビュアー出力-41%、判定はそのまま)、ナレーションレシピ(-54%、ばらつきゼロ)、条件付き実装者ティアリング(〜0.5〜1ドル/実行、E22はプログラミングプランでは俳句を正しく拒否することが証明されました)、フィクスチャリアリズムはsvelte(-24%スコープマッチ)で再現されました。 **証明された無効なもの:** コントローラーの思考を制限すること**は裏目に出ます**—ローズが92→138になり、出力が倍増しました;思考は効率を買います。プランの単語予算は、コードが免除されていてもテストコンテンツを-62%削減します。ソネットプラン生成は忠実度を維持しますが、タスク構造を崩壊させます。実装本体はプランでは周辺的です—テスト+インターフェース+構造がすべての負荷を運びます(E28)。 **覚えておく価値のあるリスク発見:** 差分パッケージのみを与えられたレビュアーは、自信を持って仕様判定を下しますが、「仕様」をグローバル制約として静かに再定義します—0/5が不足しているブリーフをフラグ付けしました。俳句レビュアー擁護と同じ失敗ファミリーです。 **既に最適化されているとして閉じられた6つのリード**(レポート読み取り、キャッシュヘルス、レビュアーフロア、俳句フィクサー、todoブックキーピング、ディスパッチ再導出)—誰も買い直さないように記録されています。私の3つの測定バグは、手動検査規律(自己レビューキャッチとしてのgrepカウントテンプレートエコー、差分をインライン化しなかったハーネス、改行を逃したスコアラー正規表現)によってループ中にキャッチされ、修正されました—1つの撤回された判定は、クリーンに再測定されました(-74%が正直な-41%になりました)。 長々と話しましたが、約36時間の作業と650ドルの補助なしトークン消費量で、Anthropicの評価ベンチマークでは、Superpowersビルトの実行時間を50%、トークン消費量を60%削減したように見えました。そして、Codexに対して評価を実行しました。結果は良くありませんでした。同じレベルの改善が見られないかもしれないと心配していましたが、改善は見られませんでした。数分間の調査で、原因を突き止めました。Codexでは、評価がホストOSから十分に分離されていませんでした…そのため、常にSuperpowers 5.1.0をベンチマークしていました。少し調整した後…はい。すべてがうまくいきました。 最大の改善は、仕様適合性とコード品質レビューエージェントを組み合わせること、レビュー担当者に渡されるレビュー「パッケージ」を事前に作成してgitを実行する必要性を減らすこと、そして特定のタスクに必要なエージェントの種類に関するオーケストレーターへのガイダンスを変更することから来ました。 私たちはSuperpowersのエバリュエーションスイートに懸命に取り組んでおり、それがなければ、Superpowersの変更を測定・テストし、成長するコーディングエージェントのセット全体でそれらの変更が何をするかを定量化することは不可能だったでしょう。スイートはまだ比較的新しいですが、さまざまなサポートされているハーネスでSuperpowersの変更を作成・テストし、それらの変更が成長するコーディングエージェントのセット全体で何をするかを定量化できることを意味しています。https://github.com/prime-radiant-inc/superpowers-evals で見つけることができます。 私たちは、Superpowers 6で私たち(と私たちのロボット仲間)が行った改善を非常に誇りに思っています。新しいバージョンを気に入っていただけると思います。https://github.com/obra/superpowers から今すぐインストールできます。それはすぐに開始されます