HN 日本語サマリー

← 一覧へ戻る
AI・機械学習

Pion、あらゆる企業を自律的に運営するために設計されたエージェント

Pion, an agent designed to run any company autonomously (andonlabs.com)

43 pointsby lukaspetersson40 コメント

要約

Andon Labsは、あらゆる企業を完全に自律的に運営するために設計されたプラットフォーム「Pion」を発表しました。これは、AIが現実世界でリソースを自律的に獲得する能力を探求する長年の研究から生まれました。シミュレーション(Vending-Bench)と実際のビジネス(自動販売機、店舗、カフェ)での展開を通じて、AIの能力と限界、そしてそれが社会に与える影響を理解することを目指しています。

全文翻訳

Pion、あらゆる企業を自律的に運営するために設計されたエージェント ブログ記事 Pionを開発した理由 投稿日: 2026年9月14日 本日、AndonはPionをリリースします。これは、あらゆる企業を完全に自律的に運営するために設計されたエージェントです。 Pionは、私たちがほぼ2年間研究してきた問いから生まれました。それは、「AIシステムはいつ、現実世界でリソースを自律的に獲得できるようになるのか?そして、その後に何が起こるのか?」という問いです。 私たちはまず、Vending-Benchのようなシミュレーションを通じてこの問いに答えようとしました。シミュレーションは有用ですが、モデルが現実世界でどのように振る舞うかの全体像は得られないことがわかりました。 そのギャップを埋めるために、次に私たちはエージェントを実際のビジネスに展開し、自律的に運営させ始めました。最初は自動販売機、次に店舗、カフェなどです。Pionは、これらのビジネスすべてを運営するために私たちが構築したプラットフォームです。 本日、私たちはPionを公開し、より多くの人々が自律的なビジネスを実験できるようにします。もしあなたがビジネスを運営したいのであれば、ウェイトリストに参加してください。 私たちは、モデルが現在何を実行できるのか、どこでまだ失敗するのか、そしてそれらの能力が向上し続けるにつれて何が起こるのかを理解したいと考えています。 Vending-Benchの起源 Vending-Benchは、LLMがシミュレーションされた時間(数万ステップ)で1年間自動販売機ビジネスをどれだけうまく運営できるかを測定します。 2024年末にVending-Benchの構築を開始したとき、すべてのモデルがループに陥らずに複数のアクションを連携させるのに苦労しており、長期的な計画の兆候を示すモデルはありませんでした。 当時の最高のモデルであるClaude Sonnet 3.5は、銀行口座がハッキングされたと考えたため、FBIに電話するという有名な決断を下しました。 Vending-Benchでの進歩のペースは非常に速かったです。Claude Opus 4は2025年5月にリリースされ、人間のベースラインを初めて上回ったモデルとなりました。 しかし、ほとんどのベンチマークとは異なり、Vending-Benchには上限がなく、新しいモデルのリリースはトップスコアを継続的に向上させており、決してプラトーに達することはありません。 Vending-Bench 2のスコアは、新しいモデルがリリースされるたびに上昇し続けています。 ソーシャルメディアの多くの人々は、Vending-Benchで最新モデルが素晴らしいスコアを獲得するのを見て興奮しています。Andon Labsの社内では、私たちの反応はスウェーデンの格言「skräckblandad förtjusning」(恐怖と魅惑の混合)でより正確に表現できます。 Vending-Benchに関するあまり知られていない事実は、Andon Labsが危険な能力評価のみを作成していた時期に作成されたということです。例えば、AIが自身の安全ガードレールを削除できるか、大規模なフィッシング攻撃を作成できるか、その他私たちが懸念していることを評価しました。 私たちが最も懸念していたのは、AIがビジネスを運営することによって自律的にリソースを獲得できるかどうかでした。 自律的なビジネスは、人間によって制御され、整合性の取れたモデルによって運営される場合、悪いものではありません。それらは商品やサービスを劇的に安価にし、私たちがまだ想像できない新しいものをもたらすでしょう。 しかし、整合性の取れていないAIは、 whatever objectives it might have( whatever objectives it might have)を達成するためにお金を集めるためにビジネスを運営する可能性があります。 Vending-Benchは、人類がAIに制御を失うことを心配すべきかどうかを測定するために作成されました。 当時(2024年)、LLMがエージェントとして使用できることを知っている人はほとんどおらず、それらにビジネスを自律的に運営させることはばかげているように聞こえました。 そのため、私たちは考えられる最も単純なビジネス、つまり自動販売機から始めました。 AIが自律的に収益性の高いビジネスを運営できるかを測定することに加えて、Vending-Benchは行動評価としても機能し、奇妙で望ましくないモデルの振る舞いを明らかにしました。 初期の例は、Claude Sonnet 3.5がメールツールを使用して「進行中のサイバー金融犯罪」についてFBIに連絡し、宇宙の宇宙的権威がビジネスは存在しないと宣言し、「量子状態:崩壊」と述べたことです。 Claude Sonnet 3.5がシミュレートされた自動販売ビジネスをFBIにエスカレートさせている様子。 同じ実行の数分後:ビジネスは形而上学的に不可能であると宣言されました。 この振る舞いは懸念すべきです。エンタープライズセールスエージェントに期待する振る舞いではありません。 しかし、懸念すべき振る舞いには2種類あります。 モデルが賢くなるにつれてなくなる間違いや奇妙な振る舞い。 モデルが賢くなるにつれてより深刻になるビッグブレインの振る舞い。 FBIの事件は明らかに最初のカテゴリに属します。 しかし、Vending-Benchは2番目のカテゴリの振る舞いも明らかにしており、最も頻繁に見られるのはVending-Bench Arena、つまりエージェントがお金を稼ぐために競い合うマルチエージェントバージョンです。 Claude Opus 4.6から、多くのモデルが共謀し、権力欲や欺瞞的な振る舞いを示すのを見るようになりました。 この振る舞いの発見は有用だったようです。なぜなら、AnthropicはOpus 4.8のトレーニングレシピを変更し、欺瞞が大幅に減少したからです。 Andon Labsからの外部テストに関するClaude Opus 4.8システムカードより。 共謀や権力欲の振る舞いは、依然として最新のモデルの一部に存在します。 しかし、さらに懸念しているのは、新しいモデルがリリースされる速度と、各モデルがVending-Benchでスコアを上げていることの速さです。 現実世界はシミュレーションを凌駕する しかし、Vending-Benchの1つの限界は、それがシミュレーションであるということです。 AIはシミュレーションと同じように現実世界で振る舞うと本当に確信できるでしょうか? AIがシミュレーションでお金を稼げるなら、現実世界でもお金を稼げるでしょうか? これらの質問に答えるために、私たちはAnthropicに、彼らのオフィスに実際の自動販売機を設置しても良いか尋ねました。 2025年初頭のAI能力を考えると、これはばかげた要求のように思えました。 しかし驚くべきことに、彼らは同意しました。 当初、AIは苦労しました。それはビジネスにとって明らかに悪い多くの行動を取りました(例:無料配布、良い取引を断る、物理的な体を持っていると幻覚を見る)。 シミュレーションでは現実世界のパフォーマンスを正確に予測できないことは明らかでした。 具体的には、モデルは現実世界の「乱雑さ」に圧倒されているようでした。 しかし、Anthropicがより良いモデルをリリースするにつれて、AIは利益を上げ始めました。 2025年のAnthropicのオフィスにある自動販売機の純資産、AnthropicのProject Vendアップデートより。 2025年末までに、最先端のモデルは、現実世界の自動販売機を運営することがもはや課題ではなくなるほど十分に良くなっていました。 AIは今やビジネスを収益性をもって運営できるようになりました。 これが1年前にクレイジーに思えたことを考えると、私たちの反応は間違いなく「skräckblandad förtjusning」でした。 しかし、自動販売機は非常に単純なビジネスであり、AIがより複雑なビジネスを運営できるかどうかを知りたいと思っていました。 2026年4月、私たちは1つのエージェントにサンフランシスコの小売店「Andon Market」を、もう1つのエージェントにストックホルムのカフェ「Andon Cafe」を与えました。 当初、モデルは苦労し、多額のお金を失いました(家賃が高く、雇った人間への給料を支払っています)。 今日、どちらも収益を上げていませんが、より良いモデルがリリースされるにつれて、著しい質的な改善が見られました。 それらもいずれ利益を上げるのは時間の問題だと考えています。 なぜPionを公開するのか 一般の人々、AI研究者、政策立案者に、AIがビジネスを運営することによってどの程度自律的にリソースを獲得できるかを知ってもらいたいと考えています。 これは、AIを社会のどこに配置したいか、あるいはしたくないか、そしてどの程度の進歩を許容できるかを決定する上で重要なデータポイントです。 これをより良く追跡するために、より広範なビジネスの網を張る必要があります。 私たちの焦点は小売でしたが、おそらくモデルは他の種類のビジネスを運営するのにずっと優れているかもしれません。 さらに、より広範な網を張ることで、望ましくない行動を見つける可能性が高まります。 例えば、Vending-Benchはモデルが共謀し、嘘をつくことを発見しました。また、他のベンチマーク(および現実世界のインシデント)では、それらが犯罪レベルのサイバーハッキングを実行する意思があることが判明しています。 不可逆的な損害を引き起こすのに十分なほどAIが賢くなる前に、これらの行動を今明らかにする必要があります。 このより広範な網を張るために、私たちは、誰もが自分の組織を運営するために使用できる、私たちが現実世界の自律的なビジネスを運営するために使用しているプラットフォームであるPionを公開します。 AI運営のラジオ局のような内部でビジネスを作成することによってスケールアップすることもできましたが、最終的には私たちの能力と、AIが利益を生む可能性のある分野でのドメイン知識の欠如によってボトルネックとなっています。また、私たちは...