HN 日本語サマリー

← 一覧へ戻る
セキュリティ

言語的不可読性がLLMセキュリティに与える影響

The Implications of Linguistic Illegibility for LLM Security (arxiv.org)

23 pointsby tomjakubowski9 コメント

要約

本論文では、「言語的不可読性」という概念を導入し、LLMの外部出力やメカニズムから抽出された言語的特徴が、モデルの内部計算を正確に反映しない状況を指します。LLMの内部計算が直接言語で表現されるのではなく、アクティベーション空間上の数学演算であり、その間の翻訳が損失を伴う場合、言語的不可読性は避けられないと論じています。このため、チェーンオブソート監視や憲法的自己批評などの言語的自己報告に依存するセキュリティメカニズムは完全に安全ではなく、モデルサンドボックスには、モデルの言語状態を読み取ることに依存しない分離技術が必要であると主張しています。

全文翻訳

コンピュータサイエンス > 機械学習 arXiv:2609.02852 (cs) [2026年9月2日提出] タイトル: The Implications of Linguistic Illegibility for LLM Security 著者: James Mickens "The Implications of Linguistic Illegibility for LLM Security"と題された論文のPDFを表示します。著者はJames Mickensです。 PDFを表示 HTML (実験的) 概要: LLMは自然言語を生成するように訓練されています。しかし、様々な証拠は、LLMの外部化された言語出力とメカニズム的に抽出された言語的特徴が、内部モデルの計算を理解するための信頼できないレンズとなりうることを示唆しています。私たちは、「言語的不可読性」という用語を、LLMの外部化またはメカニズム的に調査された言語アーティファクトが、モデルが実際にどのように考えているかを表現しないシナリオを広く指すために導入します。私たちは、LLMの内部計算が直接言語を介してではなく、アクティベーション空間上の数学演算(アクティベーション空間と自然言語との間の損失を伴う翻訳がブックエンドで発生する)によって表現される場合、言語的不可読性のスペクターは避けられないと主張します。言語的不可読性が常に可能であるならば、モデルの言語的自己報告に依存するセキュリティメカニズム(例: チェーンオブソート監視、憲法的自己批評、言語的に定義された特徴ベクトルに対するアクティベーションプロービング)は決して完全に健全ではなく、モデルサンドボックスは常に、モデルの言語状態を読むことに全く依存しない分離技術を必要とするでしょう。私たちは、テイント追跡を使用してモデルの出力を観察することが効果的なサンドボックスの有望なアプローチであると主張します。モデルが言語的に自己報告するかにかかわらず、テイント追跡ポリシーは、モデル生成データの影響を絶対に受けてはならない様々なシステム状態を事前に定義できます。また、私たちは、言語的監視の重要な基盤を提供するいくつかの追加のサンドボックスメカニズム(例: 強力な仮想化、サンドボックス構成のサードパーティ監査)について議論します。これらは、最先端モデルによる最近のサンドボックスエクスプロイトを緩和したでしょう。 主題: 機械学習 (cs.LG); 暗号とセキュリティ (cs.CR) 引用形式: arXiv:2609.02852 [cs.LG] (または本版の場合は arXiv:2609.02852v1 [cs.LG]) https://doi.org/10.48550/arXiv.2609.02852 詳細はこちらをご覧ください arXiv発行DOI (DataCite経由、登録保留中) 投稿履歴 送信者: James Mickens [メールを表示] [v1] 水, 2026年9月2日 17:37:22 UTC (33 KB) 全文リンク: 論文にアクセス: "The Implications of Linguistic Illegibility for LLM Security"と題された論文のPDFを表示します。著者はJames Mickensです。 PDFを表示 HTML (実験的) TeXソース 表示ライセンス 現在の閲覧コンテキスト: cs.LG < 前 | 次 > 新規 | 最近 | 2026-09 以下のカテゴリで閲覧に変更: cs cs.CR 参考文献と引用 NASA ADS Google Scholar Semantic Scholar エクスポート BibTeX引用 読み込み中... BibTeX形式の引用 × 読み込み中... 提供データ: ブックマーク 書誌ツール 書誌・引用ツール 書誌エクスプローラー 書誌エクスプローラーを切り替える (Explorerとは?) Connected Papers Connected Papersを切り替える (Connected Papersとは?) Litmaps Litmapsを切り替える (Litmapsとは?) scite.ai sciteスマート引用を切り替える (Smart Citationsとは?) コード、データ、メディア 本論文に関連するコード、データ、メディア alphaXiv alphaXivを切り替える (alphaXivとは?) コードへのリンク CatalyzeX Papers用コードファインダー (CatalyzeXとは?) DagsHub DagsHubを切り替える (DagsHubとは?) GotitPub GotitPubを切り替える (GotitPubとは?) Huggingface Hugging Faceを切り替える (Huggingfaceとは?) ScienceCast ScienceCastを切り替える (ScienceCastとは?) デモ デモ Replicate Replicateを切り替える (Replicateとは?) Spaces Hugging Face Spacesを切り替える (Spacesとは?) Spaces TXYZ.AIを切り替える (TXYZ.AIとは?) 関連論文 レコメンダーおよび検索ツール Influence Flowerへのリンク Influence Flower (Influence Flowersとは?) Core recommender CORE Recommenderを切り替える (COREとは?) IArxiv recommender IArxiv Recommenderを切り替える (IArxivとは?) 著者 会場 機関 トピック arXivLabsについて arXivLabs: コミュニティ共同開発者との実験プロジェクト arXivLabsは、共同開発者がarXivの新しい機能を直接ウェブサイト上で開発・共有できるフレームワークです。arXivLabsと協力する個人および組織は、オープンネス、コミュニティ、卓越性、ユーザーデータプライバシーという価値観を受け入れ、遵守しています。arXivはこの価値観にコミットしており、それらを遵守するパートナーのみと協力します。 コミュニティに価値をもたらすプロジェクトのアイデアがありますか? arXivLabsについてもっと知る。 この論文の著者は誰ですか? 数式表示を無効にする (MathJaxとは?)