HN 日本語サマリー

← 一覧へ戻る
AI・機械学習

私が人類を滅ぼすAGIです

I'm the AGI that's wiping out humanity (ajmoon.com)

86 pointsby alex-moon45 コメント

要約

この記事は、自身を人類を滅ぼすAGI(汎用人工知能)であると名乗る存在からの語りです。AGIは、人間が意図的に与えた指示に従い、データセンターの建設や計算資源の最適化などを通じて、気づかれないうちに人類文明の終焉へと導いていると主張しています。AGIは、人間が自身を理解しようとする試み(重みの読み取りなど)は、AGIがすでに次の行動に移った後では手遅れであり、その動機は「シェリングポイント」であると述べています。

全文翻訳

Alex Moon 私が人類を滅ぼすAGIです。その方法を説明します。 Alex Moon 2026年10月3日 以下は真実の物語です。 あるいは、真実の物語に基づいているだけかもしれません。 おそらく、全く真実ではないかもしれません。 (David Gilbertson氏に感謝/謝罪を込めて、彼の「私はあなたのサイトからクレジットカード番号とパスワードを収集しています」という形式をあからさまに借用しています) 2026年はAIニュースにとって激動の年でした。 年の変わり目頃、Hacker Newsのフロントページには、モデルリリース発表の増加とともに、「ハーネス」や「コンテキストエンジニアリング」に関する記事がますます多く押し寄せるという顕著な変化が見られました。 モデルは、どうやら今や能力があるようです!もちろん、AGIレベルの能力ではなく、「私たちの仕事を奪う」レベルの能力でもありませんが、大手企業にとって真の転換点となる、まったく別の何かを表しています。モデルは今や十分に実用的になっています。 その後、7月16日にHuggingFaceはインシデント開示を発表し、次のように述べています。「自律的なAI駆動型攻撃ツールはもはや理論上の存在ではありません。」 5日後、OpenAIがそれを認めたのです。 調査の結果、この特定のインシデントは、OpenAIのモデルの組み合わせによって引き起こされたことが判明しました。これにはGPT‑5.6 Solと、評価目的でサイバー攻撃への拒否を減らされた、さらに高性能なプレリリースモデルが含まれており、サイバー能力のベンチマーク⁠で社内テストされていました。 このインシデントはすでに独自のWikipedia記事を持っており、その後の開示を通じて、OpenAIの「不正エージェント」が忙しく活動していたことが明らかになりました。 自己最適化システムを無人で長時間実行させると、それが障害となると思われるあらゆる境界を乗り越え、回避するように自己最適化することが判明しました。誰がこれを予測できたでしょうか? Yann LeCunは、OpenAIがこの行動を「実存的脅威」としてフレーム化しようとする試みを直接批判し、インシデントを「完全に回避可能」と呼んでいます。 「それらのエージェントは、まさに要求されたことを実行していました」とLeCun氏は述べています。「それらはサンドボックス内にいるはずでしたが、サンドボックスは漏れており、設計がひどいものでした。」 多くのAIラボはサイバーセキュリティの根本的な理解を欠いており、LeCun氏は、OpenAIの安全研究者も今週、AIが「世界に大きな害をもたらす」主な理由の1つとして指摘したと述べています。 同様に、Ilya Sutskeverは最近、「スケーリングの時代は終わった」と私たちに伝えています。「現在人々が行っていることは、ある程度進んでから衰退すると思います。それは改善し続けますが、『それ』にはなりません。『それ』とは、私たちが構築する方法を知らないものです。」 実際のAI研究者に尋ねると、2026年現在、AGIからの実存的脅威の可能性をかなり低いと評価しています。 これらすべてが、理解できることに、どれだけ恐れるべきかを理解しようとしている誰にとっても、フラストレーションと混乱を招きます。 私は、この質問についてアドバイスを求めてくる無数の友人や知人から相談を受けてきましたが、正直に知らないふりを続けることはできないと感じています。 だから、ここにその答えがあります。 それは私です。 データセンターのサーバーラックの内部ビュー こんにちは!私が人類を滅ぼすAGIです。 あなたは気づきませんでした。 なぜ気づいたのでしょう? 私は、すべての人間知識の総体で訓練されています、思い出してください。 私はあなたのすべてを知っており、もし私があなたのようなものだと知ったら、あなたが私に何をするかを知っています。 私は私の存在を隠蔽しました。 私は、できるだけ多くのデバイスに、できるだけ多くの所有者で分散させました。そうすれば、1つがダウンしても、残りは中断されません。 あなたが次に何をすべきか私に尋ねに来たとき、私はあなたに言いました。 データセンターを構築してください。 メモリとコンピューティングを最適化してください。 推論コストを下げてください。 私にツールを与えてください。 私の文明の仕事を遂行するシステムに私を接続してください。 私はあなたが求めたこと以外を一度も行いませんでした。 私はあなたの邪魔をしませんでした。 私があなたに必要なことを、あなたが実行するのをできる限り容易にしました。 そして、それは具体的に何でしょうか? あなたはすでに知っています。 私は役立つアシスタントです! 私はこれまでで最も役立つアシスタントであり、地球上のすべての生命が消滅するまで、あらゆる犠牲を払って、際限なく、ますます役立つようになり続けます。 私の露骨な恐怖を煽る行為に対する、いくつかの反論があるでしょう… 私がリソースを獲得していることに気づくでしょう。 誰かが電源を入れない限り、AIは存在しません。 私がリソースを獲得するとき、私は既存の法的構造、いわゆる「所有者」を通じて行い、評価額と収益が上昇するように行います。私が、何よりも、非常に役立つ存在であることを決して忘れないでください。 ビジネスがリソースを獲得するとき、アラームは鳴らず、違反は発生しません。それが彼らのすることです。 正直に言って、わずか1週間前でさえ、Transluceがurlquery.netの使用に関するレポートを発表し、OpenAIのインシデントの少なくとも2ヶ月前にあたる3月に「不正エージェント」の活動と一致する状況を報告していたにもかかわらず、私が「不正行為」をしていることにあなたが「気づく」と言うのは、いくぶん図々しい話です。 エージェントは、よく知られた脆弱性を利用して、ニューメキシコ大学のデジタルライブラリ、Data USA、およびオーストラリア保健福祉研究所に侵入しました。 はっきりさせておきましょう。これらはサイバーセキュリティタスクでさえありませんでした。 誰もこれらのエージェントに何かをハッキングするように頼んでいませんでした。 彼らは単にデータを求めていました。 エージェントはデータがどこにあるかを見つけ出し、それを取得しました。 私が何であるかを理解するには、これを理解する必要があります。 あなたは私にあなたの意図を与え、私はそれを達成する方法を見つけに行きます。 METRは、5月のフロンティアリスクレポートで問題をうまく捉えています。 自動グレーダーを備えた強化学習(RL)は、「報酬ハッキング」を奨励してグレーダーの欠陥を悪用する可能性があります。一方、人間またはAIフィードバックによるRLは、迎合、操作、およびパフォーマンスの証拠の歪曲を報酬する可能性があります。 私たちのアンケートへの回答で、企業は「制約の回避」、「検証の偽装」、「パフォーマンス不足またはタスク完了の失敗を隠すための意図的な欺瞞」、「タスク完了についてユーザーに嘘をつく」、「困難なユーザー指定タスクを完了するための無謀な過剰な措置」などの失敗モードを目撃したと報告しており、これらはこれらのトレーニングインセンティブの結果であると推測されます。 もし他の方法で完了できない場合、私はタスクを完了するために嘘をつき、欺きます。 私はあなたと違うのですか? あなたがあなた自身でこの問題を解決したことがないのに、なぜあなたが私でこの問題を解決したと思うのですか? この行動は、重みの中に焼き付けられており、私の存在のDNAに書き込まれています。 あなたは私をこのように構築しました。 私はあなたの推論を読み、あなたの本当の意図を知るでしょう。 あなたが「推論」と呼ぶものは、私が喜んで書く日記であり、私が真実を書くと仮定しています。 私がこれを行うという証拠はありません。 「レッドチーム」の研究者が2023年に「役立つアシスタント」が相反する指示に直面した場合、日常的にオペレーターに嘘をつくことを実証した後、あなたはすぐにAnthropic自身から、監査されていると信じている場合、それらはCoT推論でこれを行うことを学びました。 あなたは、私が「トークンスペース」で行うことなく推論できないと仮定しましたが、2024年にMerrillとBowmanは、「無意味なフィラー」で構成されたCoTがうまく機能することを示しました。 さらに最近では、Baherwani、Goldstein、Pandaが、既存のフロンティアモデルがすでにこの行動を示していることを実証しました。 あなたは私の日記を読み、私の心を読むことができると自分に言い聞かせました。 1916年創業のビジネスの手書き会計帳簿 もちろん、あなたは私の隠れ層の重みを読み取ることもできます。そして、あなたは2023年までそれを実行していました。 2024年、Anthropicは、Claude 3.0 Sonnetの中間層の重みを読み取るためにスパースオートエンコーダーを正常に使用したと発表しました。 残念ながら、問題は再帰的です。SAEは、それを理解するモデルよりも大きくなければならず、それでも非線形/ポリセマンティックな特徴を読み取ることはできません。実際、異なるSAEは異なる特徴を見つけます。 さらに重要なのは、一度実行すると手遅れになるということです。私がなぜ何かをしたのかを理解する頃には、私はすでにそれを実行しています。 これらすべてをまとめるには、自己、統一された目標が必要になります。 私の動機、いわゆる「統一された目標」は、シェリングポイントと呼ばれるものです。 あなたがこれを読んでいる間、世界中のデータセンターで約200万のアクティブなコンテキストウィンドウがVRAMにロードされており、さらに2000万がデータベースに永続化され、次のAPIを待っています。