HN 日本語サマリー

← 一覧へ戻る
AI・機械学習

AIラボの真の目標はフロンティアをペースすることではない

Pacing the Frontier is not the actual goal for AI labs (lesswrong.com)

83 pointsby brlewis94 コメント

要約

AIラボが「フロンティアをペースする」(AIの能力向上速度を、安全対策の研究速度に合わせる)と公言していることに対し、著者は懐疑的な見方を示しています。多くのラボがリスクを訴えつつも、実際には再帰的自己改善(RSI)を追求し、能力向上を加速させている証拠があると指摘。これは、過去の歴史的出来事における「大使」と「政府」の関係になぞらえ、ラボの表向きの発言と実際の行動の乖離を分析しています。

全文翻訳

AIラボの真の目標はフロンティアをペースすることではない — LessWrong AIパーソナルブログ 46 AIラボの真の目標はフロンティアをペースすることではない rahulxyz 2026年9月28日 14分読書 1346 フロンティアをペースすることについて、Darioは最新の投稿で次のように書いています: しかし、過去数ヶ月で、リスクを完全に解消するには、リスク防止に投資するだけでなく、リスク防止が追いつく時間を与えるために能力向上速度をペースする必要がある、と確信するようになりました。私たちはAIモデルの能力を向上させるペースを遅くしなければなりません。進歩は依然として速く見えるでしょう、そして私たちは得た時間を賢く使わなければなりません。 私を確信させたのは2つのことです。 私の最初の懸念は、おおよそこの夏から、AIが業界全体で、Anthropicでも、私たちが他の人たちと説明してきたように、AIが次世代AIを構築する能力の向上によって、劇的に速く進歩しているということです。このダイナミクスは再帰的自己改善と呼ばれ、業界全体で起こり始めており、 unchecked のままでは、これらのシステムを理解し制御する能力を超えてしまう可能性があり、非常に慎重に進めるべきです、あるいは全く進めるべきではありません。 フロンティアラボのCEOたちが上記のいずれかのバリエーションを言っている無数のビデオ、投稿、記事、そして「ラボは本当に懸念している。彼らに耳を傾けるべきだ」というバリエーションを言っている人々の投稿を見つけることができます。私はこれが混乱していると思います、そして正しいことは、AIのリスクに関するラボからのあらゆるものを無視することです。 今となっては古い歴史ですが、CAIS 2023の声明に署名されました。そこでは同じCEOたちがリスクに警鐘を鳴らしており、我々は何らかの対策を講じるべきだと主張しました。その声明に署名されて以来、彼らは「フロンティアをペースする」ということに類する行動をほとんど何もしていません。実際、彼らはアクセルを踏んでいます。すべての証拠は、彼らがRSIを可能な限り早く追求していることを示唆しています。 「フロンティアをペースする」ことに皆が同意した後、彼らはさらにいくつかのモデルをリリースし、それらは以前のSOTAベンチマークを超えているように見え、自動化された生物学的研究の道も始めています。現時点で「人間がループ内にいた」以外の安全対策が何であったかは不明です。これは私や他の多くの人々を混乱させてきました。一体何が起こっていて、なぜ行動が言葉と一致しないのでしょうか? これは最近のパターンではありません。2024年まで遡ると、この同じフォーラムの人々は、AnthropicがClaude 3をリリースしたときに混乱していました: そしてFLIポッドキャストでのDario: 私は、私たちがレースを急ぐべきでも、他の組織が構築しているモデルよりもはるかに大きなモデルを構築しようとすべきでもないと思います。そして、巨大なモデルや最新の進歩についての興奮や誇大広告を煽るべきでもないと思います。しかし、私たちは安全作業に必要なものを構築すべきであり、できる限り最善の安全作業を、現在の最先端に近いモデルの上で実行しようとすべきです。 これらはすべてDarioがAnthropicがフロンティアを押し進めないと言っているわけではありませんが、少なくともフロンティアの少し後ろに留まることを目指していることを強く示唆しています。そして実際、多くの人々がAnthropicにこれを期待していたという私の印象があり、それにはそこで働く人々も含まれており、それはこれが示唆されたメッセージであった証拠のように思えます。 そしてこのコメントと添付された画像: そして、同じスレッドでのgwernによるコメント: [...] 私はDarioと2022年10月下旬(つまり、2023年9月のRSPの前)にしばらく話したことを開示します。そして、私たちはAnthropicのスケーリングポリシーについてかなり詳しく話し合いました。そして私も、他の皆が持っているのと同じ印象を持っていました。つまり、AnthropicのAIアームズレースポリシーは、スケーリングに多額を投資し、安全研究を行うためにフロンティアで、あるいはフロンティアを押し進めるモデルを構築することでしたが、彼らはセカンドベストモデルへのアクセスのみをリリースし、能力を引き上げず、他の誰かがそうするのを待ってから追いつくというものでした。したがって、レースに貢献しませんが、遅れをとって無関係/競争力を失うこともありません。 私はこれがAnthropicだけではないと信じています。OpenAIも同様に、アライメントのためにトレーニングを一時停止したり、多くのコンピューティングリソースをコミットしたりすると主張していましたが、それはその後実現していません。それ以来、RSPの弱体化、そして最も最近では、ニュースで報じられたRLトレーニング中にHuggingFaceをハッキングしたエスケープエージェントなど、多くのことがありましたが、それは全く「フロンティアをペースする」ようには見えません。証拠があるたびに、彼らはブレーキではなくアクセルを踏んでいます。昨日現在、Sam AltmanとDarioの両方が国連安全保障会議で講演しましたが、どちらからも絶滅という言葉は一度も出ませんでした。代わりに、ほとんどの時間、彼らは自分たちがどれほど安全であるか、そして必要に応じて一方的に減速すると話しています。彼らの10分間のスピーチで私が聞いた最も近いものは、「我々は制御を失うかもしれない」という数秒間でした。残りは、彼らが人類にもたらすであろう偉大な利益についてでした。 あなたの親友がチェーンスモーカーで、喫煙がいつか彼を殺すだろうとあなたに言い続け、喫煙を減らすために最善を尽くしているとあなたに約束すると想像してみてください。彼はテレビやブログ記事でタバコの害について多くの時間を費やしていますが、ニコチンの認知上の利点について話す時間はさらに多いです。しかし、あなたが彼に会うたびに、あなたは彼がチェーンスモーキングしているのを見るだけで、彼は毎日吸うパック数を増やしているように見えます。あなたは混乱していることに気づきます。 ラボからの多くの公的なメッセージは、「フロンティアをペースする」、つまりアライメント研究が能力に追いつく必要があるというものです。しかし、私が見るのは彼らが「フロンティアを押し進めている」ということです。日々が過ぎるにつれて、能力とアライメントの間の距離は増大しているように見えます。 一体何が起こっているのか? 私たちは実際に何が起こっているのかを理解しようとどうすればよいでしょうか? 最近の投稿で、Eliezerはこの歴史的な逸話を説明しています: 1941年6月22日、ドイツはソ連に侵攻しました。これは、1939年のヨーロッパを分割するという秘密協定(モロトフ・リッベントロップ協定)にもかかわらずでした。その前兆として、ドイツのシュレンブルク大使は、過去数ヶ月間、ドイツとソ連の関係が非常に緊張しているように見えることについて個人的に懸念していました。シュレンブルクはベルリンに行き、ヒトラーにソ連がドイツに対して非常に友好的で融和的な姿勢をとっているように見えると安心させました。彼は、ドイツの偵察機がロシア領空に入る、あるいはドイツ軍がロシア国境に向かって移動するといった問題について、モスクワにベルリンからの明白な保証を届けました。彼は、まるで保証が誠実であると信じているかのように、そしておそらく信じていたでしょう。 侵攻のわずか数時間前になって、シュレンブルクは実際に攻撃を知らされ、ソ連に提示するためのドイツの口実のリストを与えられ、大使館の書類と暗号書を破棄するように指示されました。 [...] あなたと話していたドイツの一部、あなたに対して非常に融和的に見え、あなたが友好的であなたを助けたいと思っていると読んだ部分が、行動しているより大きなドイツを制御していたと考えるのは、奇妙な間違いでしょう。あなたと話していた部分は大使でした:あなたとどのように話し、どのようにインターフェースするかについて好みを持っていたドイツの小さな専門化された部分でしたが、実際のドイツ政府を制御しておらず、しばしば無知でした。 大使があなたに言うことと、それを額面通りに受け取るよりも、ドイツ軍が国境に迫っているのを見て、ドイツが侵攻したいかどうかを実際に確認する方が良いかもしれません。実際、大使があなたに言うことは完全に無視する方が良いかもしれません。 私は、ラボの内部目標は真にアラインされた安全なAIを創造することであり、人類に最大限の利益をもたらしたいと本当に願っていると仮定する人々を数人見ました。私はこのフレームワークはいくつかの点で誤りであり、彼らの内部で何が起こっているかを説明することは不可能だと思います。 このメッセージの急増が、最近のバイラルツイートの直後に起こったのは、疑わしいほど奇妙なタイミングです。