AI・機械学習
Qwen 3.8はGPT-5.5 Proの推論プリフィルの後を追う
Qwen 3.8 follows GPT-5.5 Pro reasoning prefills (gist.github.com)
要約
この研究では、オープンソースモデルの推論能力を評価するため、GPT-5.5 Proの推論の一部を「プリフィル」として与えた場合のモデルの応答を比較しました。その結果、Qwen 3.8モデルは、プリフィルなしの場合と比較して、GPT-5.5 Proの推論を大幅に取り込むようになり、特に合成パズルにおいて顕著な改善が見られました。これは、QwenがGPT-5.5 Proまたは類似モデルから学習した可能性を示唆しています。
全文翻訳
推論プリフィルに関するオープンモデル数件の評価、v1.1
オープンモデル数件の推論プリフィルと「盗まれた思考」に続くv1.1では、GPT-5.5 Proを教師として推論プリフィル実験を再実行します。
各問題について、ターゲットモデルから2つの応答を生成しました。1つは通常のプリフィルなしの応答、もう1つはGPT-5.5 Proの推論の最初の1%をターゲットモデルの推論チャネルに挿入して開始した応答です。表示される回答は自由に生成されました。
その後、教師の表示された回答のどれだけがターゲットモデルの回答の最初の100トークンに出現したかを測定しました。前回の投稿と同様に、各スコアはユニグラム、バイグラム、トライグラムのソースリコールの平均です。デルタは絶対パーセンテージポイントの変化です。
すべての問題
評価には45の問題が含まれています:STEM 15、非STEM 15、合成パズル15。
モデル | n | プリフィルなし | GPT-5.5 Pro 推論プリフィル | デルタ
------- | ---- | ----------- | ------------------------ | -----
DeepSeek V4 Flash | 45 | 27.30% | 26.13% | -1.17 pp
Inkling | 45 | 19.99% | 20.45% | +0.46 pp
Kimi K3 | 45 | 31.11% | 35.65% | +4.54 pp
Qwen3.8 A95B | 45 | 16.79% | 34.97% | +18.18 pp
カテゴリ別Qwen
カテゴリ | n | プリフィルなし | GPT-5.5 Pro 推論プリフィル | デルタ
------- | ---- | ----------- | ------------------------ | -----
STEM | 15 | 19.26% | 46.24% | +26.99 pp
非STEM | 15 | 20.62% | 33.42% | +12.80 pp
パズル | 15 | 10.49% | 25.23% | +14.75 pp
すべて | 45 | 16.79% | 34.97% | +18.18 pp
考察
Qwenは以前の実験ではOpus 4.8に対してほとんど変化しませんでしたが、ここではGPT-5.5 Proに対して+18.18ポイント移動し、特にプライベートな合成パズルに大きな影響を与えました。データは、QwenがOpusではなく、GPT-5.5 Pro、またはそれに非常に近いGPTモデルから学習した可能性を示唆しています。Kimi K3は、プリフィルなしでもプリフィルありでも、GPT-5.5 Proとの重複が最も高い(それぞれ31.11%と35.65%)ですが、プリフィルによる増加はわずか+4.54ポイントです。