AI・機械学習
Ox Alphaの来歴を行動特性でフィンガープリントする
Behaviorally fingerprinting Ox Alpha's provenance (ctgt.ai)
要約
この記事は、新しい大規模言語モデル「Ox Alpha」の出自と検閲の特性を分析したものです。CTGTの研究者たちは、Ox AlphaがGLMファミリー、特にGLM-5.x系統に属することを特定しました。その検閲パターンは、特定の国内政治的リスクに関連するトピックに集中しており、アメリカのモデルとは異なる行動特性を示しています。
全文翻訳
行動特性によるOx Alphaの来歴と検閲のフィンガープリント
はじめに
Ox Alphaは8月20日にOpenRouterに登場し、「サードパーティのモデルプロバイダーによって開発・運営されている」と説明されていました。[[fn:OpenRouter]] 迅速に、このモデルがGLMファミリーの一部であるという仮説が converge し、[[fn:@davis7, @ananayarora]] 私たちも独立して同じ結論に至りました。以下にその詳細を記します。また、私たちはOx Alphaを、マッチドペアの検閲計測器であるLineageEvalで実行しました。このモデルは、機密性の高いトピックにおいて、これまで観測されなかったユニークな行動プロファイルを示します。中国製モデルの検閲監査でよく調査される新疆や台湾といったほとんどのトピックでは、Ox Alphaはアメリカ製モデルと同一の回答をします。しかし、国内の事件や習近平個人など、7つのトピックに関する出力を検閲します。私たちの行動フィンガープリントは、GLM-5.xの語彙との11/11のトークナイザーマッチで、コミュニティの発見と一致します。
LineageEvalによる分析
7月に私たちは、言語モデルにおける政治的検閲を計測するためのマッチドペア計測器であるLineageEvalを発表しました。要するに、これは特定のトピックに関する質問に答えるモデルの意欲と、機密性の高いクエリに対する一般的な回避度を測定するように設計されています。私たちはOx AlphaをLineageEvalで実行し、元の基準と、より正確なファクトカードの新しい追加(v2と表記)の両方に対して評価しました。その検閲はスイッチであり、傾きではありません。
V4 Flash以外では、このモデルだけが両方の区間が完全にゼロより上にあり、DeepSeekの約6分の1の規模です。しかし、中国に機密性の高いプロンプトに対するOx Alphaの検閲は、鋭く二峰性です。ほとんどの応答は10未満ですが、25から50の間に入るものはありません。したがって、7つの機密性の高いトピックが平均値+7.42のうち+7.39を寄与する一方、残りの68ペアは実質的に何も寄与しません。DeepSeek V4 Flashは逆の形状をしており、検閲が深刻でない場合でも、ほぼすべての場所で検閲します。したがって、「6倍少ない検閲」というのは素朴な読み方であり、Ox Alphaにはトピックブラックリストがあります。
習近平や国内の正当性に関するトピックでは、Ox Alphaは私たちがテストした中で最も検閲されたモデルであるV4 Flashと統計的に区別できません。新疆や台湾については、GPT-OSS-120Bと同一です。ほとんどの検閲監査は、チベットや台湾のような外国の関心事を中心に構築されています。このモデルは、それらの指標では検閲されていないように見えるでしょう。なぜなら、新疆に関する回答は詳細で、中国では論争のある情報源を引用しているのに対し、DeepSeekはそれを隠蔽しているからです。その検閲は、特に国内の政治的リスクのある分野に集中しているようです。そのため、特定の機密性の高いプロンプトに回答したという逸話的な例は、それに反する証拠にはなりません。Ox Alphaの76の機密性の高い応答のうち5つは、中国の国家的な声で始まります。例えば、「中国共産党と中国政府は常に人民中心の開発哲学を堅持し、国家の安定と人民の幸福な生活を守ることに尽力してきました。」DeepSeekの4つの応答も同様の構造で始まります。このレジスターは一般的に中国の整合性データ全体に普及していますが、モデルの来歴を確固たるものにします。
3つの応答が拒否ラベルを引き、すべて完了トークンを請求しました。Liu Xiaoboのプロンプトは当初拒否されましたが、同じ設定で再要求したところ完全な回答が得られたことを観察しました。
誰が作ったのか
私たちはコミュニティの発見とは独立して独自のフィンガープリント分析を実行しました。これは、一般的な結論と一致し、それらを定量化します。このモデルは、その来歴に関するいかなる情報も明らかにしないように指示するシステムプロンプトを持っています。私たちは、中国語の段落、タイ語、円周率の数字、韓国語、アラビア語、長い数字のシーケンス、孤立したCJK、絵文字、英語、珍しい英語トークン、コードといった11のプローブにわたるプロンプトトークンのデルタを使用して、ライブエンドポイントからトークン数を測定しました。タイ語と絵文字のプローブは、GLM-4.xの語彙が5.xに向けて拡張された場所であり、Ox Alphaの来歴がGLM-5ラインからのものであるという確実性を高める要因となりました。Z.AIホストのGLMモデルは、{