HN 日本語サマリー

← 一覧へ戻る
AI・機械学習

ガーディアンエンジェル:生産性とセキュリティのためのLLMパーソナライゼーション

Guardian Angels: LLM Personalization for Productivity and Security (gwern.net)

80 pointsby andsoitis13 コメント

要約

この記事は、将来の生産性向上と個人情報・サイバーセキュリティのために、高度にパーソナライズされた大規模言語モデル(LLM)を「ガーディアンエンジェル(GA)」として活用するアプローチを提案しています。GAは、ユーザーの価値観や好みを模倣することで、ユーザー自身を増幅させることを目指します。動的なLLM評価、アクティブラーニング、内省的な検索、データ拡張などの技術を組み合わせることで、ユーザーはAI企業のアウトソーシングされたCEOのように振る舞い、高度な攻撃から身を守りながら生産性を最大化できると論じています。

全文翻訳

GPT、マインド、パーソナリティ、模倣学習、決定トランスフォーマー、AIモード崩壊、AI安全性、トランスヒューマニズム 私は、近い将来の生産性向上と、ますます強力になるLLMに対する個人情報/サイバーセキュリティのために、高度にパーソナライズされたLLMのアプローチを提案します。それは、アップロードの精神に則り、ユーザー自身を置き換えるのではなく、ユーザーの価値観と好みを模倣しようと試みるべきです。私は、このような「ガーディアンエンジェル」を達成するための技術と提案のパッケージについて議論します。動的なLLM評価とアクティブラーニングおよび引き出し、そして重い内省的検索/データ拡張を組み合わせます。 2025-12-01–2026-06-05 完了 確実性:可能性 重要度:10 類似参考文献 チャットボットのインセンティブは不一致である チャットボットの問題 モード崩壊 怠惰 速すぎるため脆い 助けすぎ 健忘症のチャットボット 修正 協調的RL 継続学習 破滅的な忘却 汎化 創造的な執筆 過剰パラメータ化 非常に大きなLM アクティブラーニング 選好学習 脳の模倣学習 パーソナリティの模倣 ガーディアンエンジェル 原則 反原則 UX ユースケース:政治と政治 ハードウェアコスト 組織 スタートアップビジネスモデル 競争 初期ステップ 執筆のためのGBT データ拡張 強力なLLMは、今後数年間でグローバル規模で展開され、インターネットを支配し、ますます一般生活を支配するでしょう。2026年半ば現在、知識労働者や一般の人々がこれらのLLMを大規模な生産性向上にどのように活用できるか、あるいはサイバーセキュリティや認知セキュリティにどのように対処できるかについての、統一されたビジョンは存在しません。私はガーディアンエンジェル(GA)を作成するという目標を提案します。これは、典型的な「アシスタントチャットボットエージェント」のペルソナを提供するのではなく、単一ユーザーのパーソナリティ、価値観、好みを模倣することを目的としてパーソナライズされたデジタルツインLLMです。これは、プリンシパルとエージェントを可能な限り統合することによって、プリンシパル・エージェント問題を弱く解決します。GAの未来では、「プリンシパル」ユーザーの焦点は、GA(エージェント)ユーザーに「何をすべきか」を定義することにあり、何をするか、どのようにするかではなく、企業のCEOや「取締役会」のように機能します。これにより、多数のエージェントを展開して望ましいことを達成し、セキュリティを処理できます。例えば、プロパガンダやスピアフィッシングのための合成メディアの相互接続されたエコシステムのような高度な攻撃をすべてスクリーニングします。これらは、より大きなAIアラインメント問題を解決することはできませんが、社会全体の防御戦略の一部として個々の人間を支援できます。 GAのペルソナは、プリンシパルの出力を模倣することを学び、より高品質で生産的です。それは、定義上、プリンシパルと同盟を結び、その価値観と目標を共有するため、信頼できます。そして、単一の、ユニークで状況に応じたユーザー(プロンプト攻撃に従うことが不条理なユーザー)をハードワイヤリングすることで、一部セキュリティが確保され、「混乱した代理人」の問題を回避します。同時に、基盤となるモデルの定期的なアップグレードと防御側の優位性により、GAは攻撃者に追いつくことができます。ポストトレーニング、コンテキストウィンドウ、計算効率は高いがパラメータ化が不十分なモデルでのフリーズされた重みによる自己注意、低計算出力、そして受動的なオフラインデータ収集という現状の組み合わせは、知識労働者の増強や創造的な執筆におけるチャットボットの残念な結果と、エージェント設定での致命的なエラーに集団的に責任があります。これらの問題は、フリーズされたモデルのためのインコンテキストラーニングのプロンプトプログラミングのような標準的な技術では、有用なGAを作成できません。 私たちは、以下のような技術の組み合わせによってGAを作成しようとすることができます。オンライン学習(動的評価を介して)により、フリーズされた最先端モデルと競争しながら、無知と致命的なエラーを回避するためにLLMをリアルタイムで更新します。事前トレーニングされた選好指向の大規模モデルからのサンプル効率、およびプリンシパルに修正と選好データを問い合わせることによるアクティブラーニング(DAggerスタイルの境界からの低後悔を取得)、そしてローカルCLIファーストのログ指向UI/UXパラダイムです。GAはオープンソースのコミュニティの努力として行うこともできますが、展開における高いセキュリティの必要性と、Mythosスケールの攻撃者を装備したAPTsの増大する課題を考慮すると、おそらくスタートアップとして行う方が理にかなっています。当初はパワーユーザーやCEOや研究者などの知識労働者を対象とし、洗練されるにつれて下位層に移行します。 私の次の数年間はどうなるでしょうか? 2030年、多くの予測が超人的AIを呼びかけているとき、私はプログラマー、研究者、マネージャー、または作家として、日々何をしているでしょうか? 私はマグカップ一杯のお茶を入れ、ラップトップを開きます…そしてその後どうなるでしょうか? まだChatGPTブラウザタブにプロンプトを入力していますか? クロードコードをターミナルで開き、数時間無心にEnterキーを押していますか? 私にとって意味のある仕事をするためのビジョンは何でしょうか?(「希望」以外の計画があると良いのですが。)「デッドインターネット」攻撃、例えば合成メディアのエコシステムやピッグ・ブッチング詐欺、あるいは信頼できる人物がAI精神病に陥ること、あるいは単にAIによるすべてをスロップ化することから、どのように回避しているでしょうか?(結局、あなたを破壊しようとするボットを起動したり、考えなしの広告インセンティブを起動したりするのは、世界中で一人の人間で十分なのです。)もしあなたが、例えば配管工や看護師ではなく、ラップトップで仕事をする時間のほとんどを過ごしているなら、2030年の仕事のビジョンは何でしょうか? それはまだ確実でしょうか? AIは今日1%改善しました。あなたは改善しましたか? —マイルズ・ブランデージ(要約) 2020年にスケーリングが本格化して以来、長年このことを想像しようとしてきましたが、創造性が損なわれ、無限に繰り返される散文を持つチャットボットチューニングLLMから生産性を引き出すことに失敗しました。代わりに、創造性と私への洞察力では遅れをとる一方で、コーディングやサイバーセキュリティハッキングにおいてはますます上達していくのを見てきました。そしてオープンウェイトモデルはさらにそうで、ベンチマークされ、私には役に立ちません。私たちはますます、LLMが私を増強したり助けたりする力は失われ、私を置き換えたり傷つけたりする力はますます強くなる世界に住むようになりました。ベイエリアへの訪問中、私はAI研究者やインターンに、エージェント型LLMが数年でできるであろうことを、なぜ彼らが現在の研究やプロジェクトを行っているのか尋ねましたが、彼らは良い答えを持っているか、3年後に自分が何をしているのかについてほとんどアイデアがありませんでした。昨年のこと、長旅で叔母のドライブウェイを借りられないか電話したとき、彼女のボイスメールが電話するたびにいっぱいになっていたので、私の盲点は鋭くなりました。ついにパニックになり、彼女の娘に電話したところ、それは意図的なことだったと説明されました。電話詐欺が多すぎて、叔母は自分の電話に出ることを信頼できなくなり、すべてを娘を通してスクリーニングしていたのです。それは衝撃的でした。なぜなら、私は座って、数年後に私がすべての詐欺に対処できると思うのに、すでに単純なAIスロップを検出するのに苦労し、ますますコールドメールを無視し、ソーシャルメディアの大部分を情報源として諦めなければならず、私の仲間のすべてが信頼に値しないチャットボットアシスタントにすべての思考と執筆をオフロードすることにどれほど熱心であるか、そして多くのプロジェクトやメーリングリストが検証されていない貢献を締め出さなければならなかったか(例:今日私がこれを書いているとき、Project Ladybirdはそうでしたか?)を見ることができるのに、なぜ私は数年後に、能力が衰えた裕福な老人と同じようにならないと考えるのでしょうか? IRSからギフトカードで支払える罰金が課せられたという電話がかかってきたら…?もしそうでないなら、なぜ、そしてどのようにしてそうでないのか、具体的に? 賢明だった頃のデネソールは、自分の力の限界を知っていたので、サウロンに挑戦するためにそれを使おうとはしなかった。しかし彼の知恵は尽きた…彼は闇の力の意志に屈服するにはあまりにも偉大だったが、それでもなお、その力が彼に見せることを許したことだけを見た。彼が得た知識は、疑いなくしばしば彼の役に立った。しかし、彼に見せられたモルドールの偉大な力のビジョンは、彼の心を絶望で満たし、ついに彼の精神を打ち破った。—ガンダルフ、『王の帰還』 チャットボットのインセンティブは不一致である 機械を操作するには、機械のように操作しなければならない。—ジェームズ・P・カーズ