AI・機械学習
AIが単独で完了できる最大のソフトウェアプロジェクトは何か?
What's the largest software project AI can complete on its own? (epoch.ai)
要約
MirrorCodeは、AIが単独で完了できるソフトウェアプロジェクトの規模を評価するためのベンチマークです。従来のベンチマークとは異なり、AIに十分な推論予算と、インターネットアクセスや元のコードベースへのアクセスを制限したサンドボックス環境を提供します。これにより、AIは人間でも数ヶ月かかるような複雑なタスクに挑戦し、公平かつ不正行為なしに評価されます。
全文翻訳
スケールを考慮した評価
決定的に重要なのは、MirrorCodeタスクに真剣に取り組むための十分な推論予算を提供することです。多くの既存のソフトウェアエンジニアリングベンチマークは、タスクが人間にとって数週間かかる場合でも、推論支出を約1〜10ドルに制限しています。例えば、MirrorCodeのタスクの中で最も大きいものの一つは、単一の実行で2,600ドルかかり、AIが人間の介入なしに19日間作業しました。
困難だが公平
プログラム全体を再実装することは、人間のソフトウェアエンジニアにとって非常に困難です。AIを使用しない人間のエンジニアは、最も複雑なMirrorCodeタスクを解決するのに数ヶ月かかると考えています。しかし、MirrorCodeタスクは実行可能でもあります。タスクには公平であるための十分な情報があることを私たちは知っています。
不正行為に強い設計
AIモデルをサンドボックス化し、インターネットへのアクセス、元のコードベースへのアクセスなしで作業を行い、タスクで不正行為を行う方法がないように要求します。モデルが開発中に決して見ることのないエンドツーエンドテストがあるため、元のプログラムの出力を模倣するために単純なルックアップテーブルを作成することはできません。