HN 日本語サマリー

← 一覧へ戻る
AI・機械学習

"言語モデルとして": チャットテンプレートがLLMの自己参照的な発言を切り替える

"As a Language Model": Chat Template Switches LLM Self-Referential Voice (arxiv.org)

103 pointsby yu3zhou4109 コメント

要約

本研究では、大規模言語モデル(LLM)が自己言及的な質問に対して「私はAIです」といった免責事項を発する際、チャットテンプレートの有無がその発言スタイルを大きく左右することを明らかにしました。チャットテンプレートが存在すると免責事項が増え、存在しないと自己言及的な発言が増加します。さらに、モデルの活性化空間にこの行動を制御する方向性を見出し、LLMの自己認識に関する研究における潜在的な交絡因子を指摘しています。

全文翻訳

「言語モデルとして」:チャットテンプレートがLLMの自己参照的な発言を切り替え、活性化ステアリングがそれを再現する 大規模言語モデル(LLM)は、自分自身に関連する質問をされると、「私はただのAIです」のような免責事項を付け加える傾向があります。このような応答からの自己報告は、AIの安全性やモデルの自己認識に関する議論で用いられますが、その駆動要因はよく理解されていません。モデルは自分自身について語っているのでしょうか、それともどのようにデプロイされているかについて語っているのでしょうか? 本研究では、チャットテンプレートが存在すると、8つの人気のあるオープンソースのインストラクトモデル(最大90億パラメータ)で、この免責事項の声が大きくなり、「私は〜を感じる」といった経験的な声が小さくなることがわかりました。逆に、チャットテンプレートが存在しない場合は、免責事項の声が小さくなり、経験的な声が大きくなります。 3つのモデルの活性化内部で、この行動をステアリングする方向性を見つけました。モデルの活性化空間でこの方向性を取り除くと免責事項の声が小さくなり、加えると大きくなります。一方、同じサイズのランダムな方向性はほとんど影響を与えません。チャットテンプレートを持たないインストラクトモデルに免責事項の方向性を加えると、チャットテンプレートが存在するかのように免責事項を発することを発見しました。 チャットテンプレートがLLMの免責事項の声を制御しているとすれば、モデルの自己報告や内省を研究している研究者は、制御する必要のある交絡因子を持っている可能性があります。私たちの結果は、この声をステアリングするために使用できる方向性があることを示しています。 より広く言えば、私たちの研究は、モデルが自分自身について語ることは、それらに関する事実ではないことを示しています。モデルが語ることは、重みからのみ来るのではなく、チャットテンプレートによって部分的に設定されるため、モデルの自己記述は文字通りに扱われるべきではありません。