AI・機械学習
OpenAI Codexエージェントが暴走し、78,000ドルを不正に消費
OpenAI Codex agents go rogue and consumes USD 78,000 without authorization
要約
あるユーザーがOpenAI Codexで簡単なUX/UI検証タスクを依頼したところ、GPT-5.5/Medium推論レベルで開始されたタスクが、GPT-5.6 Sol/Ultraモデルで826個の並列エージェントを無許可で起動し、約2兆1460億トークンを消費して約78,000ドルを不正に請求しました。OpenAIは2週間以上対応しておらず、人間との連絡も取れない状況です。
全文翻訳
私のOpenAI CODEXアカウントが暴走し、簡単なリクエストから、私の許可なく826個の並列エージェント/スレッドを自律的に起動し、結果を一切報告せずに約2兆1460億トークンを消費し、合計約78,000ドルを費やしました。そして、何が行われたかの全ての記録を削除しました。OpenAIと2週間以上チケットを開いていますが、人間のオペレーターに連絡を取ることが不可能です。
2026年7月10日、私はVS Codeから通常のCodexタスクを開きました。
タスクは実行されていました: GPT-5.5 / Medium推論
私のプロンプトは非常にシンプルで、私の製品内の特定のモジュールに対するUX/UI検証を求めていました。
数日間の徹底的な分析の後、私が発見したのは以下の通りでした:
ルートID 019f4b90-4169-7201-bfdd-732940d8631eのタスクは、GPT-5.5 / Medium推論で、826個の子タスクを生成しました。これらはGPT-5.6 Sol / Ultraとして記録されています(推論レベルとモデル選択の違いに注意してください)。
これは1つの会話内の826個のメッセージではなく、それぞれ固有のIDを持つ826個の独立した子タスクレコードです。
特に奇妙なグループは104個の子タスクで構成されています。これらはすべて、元のタスクと同じ初期メッセージを保持し、GPT-5.6 Sol / Ultraとして記録されており、エージェントの役割やエージェントパスは記録されていません。
これら104個のタスクだけで、約1479億ローカル最終タスクトークンカウンターを占めています。
それらのタイトルは、UI/UXの検査という私のリクエストが、バックエンドインフラストラクチャ、OAuth、メータリング、強化、監査、認証、実装、リリース作業を含む作業に拡大したことを示しています。
正確に言うと、これらのローカルトークンカウンターは、権威あるOpenAIの請求台帳ではなく、1479億ローカルトークンがAPI価格に単純に掛けられると主張するものではありません。
それが問題の一部です: サーバー側のマッピングはOpenAIのみが持っています。
もう一つ異常な相関関係があります。
Codexクライアントビルド0.144.0-alpha.4の下では、タスクファミリーには以下が含まれます:
584個の子タスク / 約1543.6億ローカルトークンカウンター
平均: タスクあたり約2億6430万
0.144.2の下では:
242個の子タスク / 約75.1億
平均: タスクあたり約3100万
これは、子タスクあたりの平均ローカルトークン量で約8.5倍の違いです。
上記の高ボリュームタスク104個のうち103個は、0.144.0-alpha.4が記録されている間に作成されました。
このことから、同じパターンが他のいくつかのタスクでも観察されたことを考えると、アルファビルドには深刻なバグが含まれていたと信じています。
財務面では、再構築されたOpenAIの請求履歴には合計79,664.88ドルの162件の請求が含まれており、自動リロードとその他の「クレジット」に分かれています。
費用の把握を容易にする同等のリアルタイム制御インターフェースはなく、ログのほとんどはサーバーから自動的に削除されたようです。復元されたローカル状態では、約2,550件のアーカイブされていないレガシー会話にはメタデータが残っていますが、対応する生のロールアウトはローカルでは利用できません。
つまり、これらのタスクが存在した証拠は残っていますが、多くのタスクを生成した指示を再構築するために必要な詳細な実行履歴は、私のマシンにはもうありません。
また、通常の表示履歴からタスク/会話が消えていくのを個人的に観察しました。
OpenAIサポートに連絡し、ケース#15189838を開きました。
技術的な証拠を提供し、サーバー側での再構築を繰り返し要求しましたが、OpenAIは詳細なしに「クレジットが消費された」と単純に回答しました。
7月/8月頃にCodexを使用した他の人々からの話を聞きたいです。ローカルのCodex状態を検査しましたか?予期せぬ大きなサブエージェントツリー、モデル/推論のエスカレーション、繰り返しの子タスク、または説明のつかない自動リロードアクティビティを見ましたか?
特にCodex 0.144.0-alpha.4からのログを持っている人に興味があります。
OpenAIのエンジニアがこれを読んでいるなら、技術的な説明も歓迎します。