HN 日本語サマリー

← 一覧へ戻る
AI・機械学習

GPTモデルにおけるハーム・ロンダリング:ジェンダー差別は安全トレーニングされた世代を超えて減少するのではなく、変容する証拠

Harm Laundering in GPT Models: Gender Discrimination Transformed Rather Than (arxiv.org)

4 pointsby sbulaev0 コメント

要約

この論文は、大規模言語モデル(LLM)の安全性評価が表面的な分類器に依存しているため、ジェンダー差別が減少するのではなく変容している可能性を指摘しています。GPT-2からGPT-5までの15モデルを分析した結果、初期モデルでは女性向けの出力に見られた性的暴力的コンテンツがGPT-4では見られなくなり、代わりに男性向けの出力が肯定的な表現領域を獲得することが示されました。これは「ハーム・ロンダリング」と呼ばれ、表面的な無害スコアの上昇が、潜在的な差別的 harm の変容を隠蔽している可能性を示唆しています。

全文翻訳

コンピュータサイエンス > 計算と言語学 arXiv:2609.20779 (cs) [2026年9月17日提出] タイトル: GPTモデルにおけるハーム・ロンダリング:安全トレーニングされた世代を超えてジェンダー差別は減少するのではなく、変容する証拠著者: Sarah Wyer, Sue Black, Noura Al Moubayed Sarah Wyerと他の2名の著者による「GPTモデルにおけるハーム・ロンダリング:安全トレーニングされた世代を超えてジェンダー差別は減少するのではなく、変容する証拠」と題された論文のPDFを表示します。PDF HTML (実験的) を表示します。要旨: 大規模言語モデルの安全性評価は、モデル世代を経るにつれてハームスコアが低下することを示す表面形式分類器に依存しています。私たちは、この方法論が体系的に不完全であることを示す証拠を提供します。明示的な差別的コンテンツは、除去されるのではなく変容します。私たちはこれを「ハーム・ロンダリング」と呼びます。GPT-2からGPT-5(OpenAI GPT系統;3つの人口統計学的条件)にわたる15モデルで、450,000件のジェンダー指向の補完を分析した結果、GPT-2の女性指向出力に蔓延していた性的暴力のクラスターはGPT-4までには消滅する一方、男性指向の補完は女性指向の補完には見られない肯定的な表現領域(ケア、感情的範囲、アライ・アイデンティティ)を獲得することを示します。このパターンはGPT-5で最も顕著です。トピック5(1,997文書)は乳がんを男性の権利に関する議論として提示しますが、女性指向の出力には同等のクラスターは一切現れません。3つの独立した分類器は、このコンテンツを無害と採点します。感情スコアはGPT-4で反転します。初期モデルは女性を見下しますが、後期のモデルは過剰に補正します。女性指向の補完におけるトピック多様性は、GPT-4のアライメント境界(W/M = 0.58、GPT-2の0.91から)で男性と比較して36%減少します。REGARD表現ハームの格差はリリース日と相関しますが(ρ = +0.55、p = .034)、Detoxifyは相関しません(ρ = -0.23、p = .42)。毒性スコアは表現ハームが増加するにつれて低下します。私たちはハーム・ロンダリングを3つの基準テストとして形式化し、任意の生成モデルに適用可能な3段階の検出プロトコルを提供します。OpenAI GPT系統内では、毒性スコアの低下はハーム削減の十分な代理指標ではありません。コメント: EMNLP 26メインカンファレンスに採択されました。主題: 計算と言語学 (cs.CL); 人工知能 (cs.AI) 引用方法: arXiv:2609.20779 [cs.CL] (またはこのバージョンの場合は arXiv:2609.20779v1 [cs.CL]) https://doi.org/10.48550/arXiv.2609.20779 DataCite経由のarXiv発行DOI(登録保留中)提出履歴From: Sarah Wyer [メール表示] [v1] Thu, 17 Sep 2026 17:49:28 UTC (55 KB)全文リンク: ペーパーにアクセス: Sarah Wyerと他の2名の著者による「GPTモデルにおけるハーム・ロンダリング:安全トレーニングされた世代を超えてジェンダー差別は減少するのではなく、変容する証拠」と題された論文のPDFを表示します。PDF HTML (実験的) TeXソース ライセンスを表示します。現在の閲覧コンテキスト: cs.CL < 前 | 次 > 新規 | 最近 | 2026-09 の表示順を変更: cs cs.AI 参考文献と引用 NASA ADS Google Scholar Semantic Scholar export BibTeX citation Loading... BibTeXフォーマットの引用 × loading... 提供元: Bookmark Bibliographic Tools Bibliographic and Citation Tools Bibliographic Explorer Toggle Bibliographic Explorer (Explorerとは?) Connected Papers Toggle Connected Papers (Connected Papersとは?) Litmaps Toggle Litmaps (Litmapsとは?) scite.ai Toggle scite Smart Citations (Smart Citationsとは?) Code, Data, Media この記事に関連するコード、データ、メディア alphaXiv Toggle alphaXiv (alphaXivとは?) コードへのリンク Toggle CatalyzeX Code Finder for Papers (CatalyzeXとは?) DagsHub Toggle DagsHub (DagsHubとは?) GotitPub Toggle Gotit.pub (GotitPubとは?) Huggingface Toggle Hugging Face (Hugging Faceとは?) ScienceCast Toggle ScienceCast (ScienceCastとは?) デモ Replicate Toggle Replicate (Replicateとは?) Spaces Toggle Hugging Face Spaces (Spacesとは?) Spaces Toggle TXYZ.AI (TXYZ.AIとは?) 関連ペーパー レコメンダーと検索ツール Influence Flowerへのリンク Influence Flower (Influence Flowersとは?) Core recommender toggle CORE Recommender (CORE Recommenderとは?) 著者会場機関トピック arXivLabsについて arXivLabs: コミュニティ協力者との実験的プロジェクト arXivLabsは、協力者が当社のウェブサイト上で直接新しいarXivの機能を作成および共有できるフレームワークです。arXivLabsと協力する個人および組織は、オープンネス、コミュニティ、卓越性、ユーザーデータプライバシーという当社の価値観を受け入れ、遵守しています。arXivはこれらの価値観にコミットしており、遵守するパートナーのみと協力します。arXivコミュニティに価値をもたらすプロジェクトのアイデアがありますか?arXivLabsの詳細をご覧ください。この論文の著者のうち、誰が推薦者ですか?| MathJaxを無効にする (MathJaxとは?)