HN 日本語サマリー

← 一覧へ戻る
AI・機械学習

Qwen 3.8はGPT-5.5 Proの推論プリフィルの後を追う

Qwen 3.8 follows GPT-5.5 Pro reasoning prefills (gist.github.com)

86 pointsby wsxiaoys30 コメント

要約

この研究では、オープンソースモデルの推論能力を評価するため、GPT-5.5 Proの推論の一部を「プリフィル」として与えた場合のモデルの応答を比較しました。その結果、Qwen 3.8モデルは、プリフィルなしの場合と比較して、GPT-5.5 Proの推論を大幅に取り込むようになり、特に合成パズルにおいて顕著な改善が見られました。これは、QwenがGPT-5.5 Proまたは類似モデルから学習した可能性を示唆しています。

全文翻訳

推論プリフィルに関するオープンモデル数件の評価、v1.1 オープンモデル数件の推論プリフィルと「盗まれた思考」に続くv1.1では、GPT-5.5 Proを教師として推論プリフィル実験を再実行します。 各問題について、ターゲットモデルから2つの応答を生成しました。1つは通常のプリフィルなしの応答、もう1つはGPT-5.5 Proの推論の最初の1%をターゲットモデルの推論チャネルに挿入して開始した応答です。表示される回答は自由に生成されました。 その後、教師の表示された回答のどれだけがターゲットモデルの回答の最初の100トークンに出現したかを測定しました。前回の投稿と同様に、各スコアはユニグラム、バイグラム、トライグラムのソースリコールの平均です。デルタは絶対パーセンテージポイントの変化です。 すべての問題 評価には45の問題が含まれています:STEM 15、非STEM 15、合成パズル15。 モデル | n | プリフィルなし | GPT-5.5 Pro 推論プリフィル | デルタ ------- | ---- | ----------- | ------------------------ | ----- DeepSeek V4 Flash | 45 | 27.30% | 26.13% | -1.17 pp Inkling | 45 | 19.99% | 20.45% | +0.46 pp Kimi K3 | 45 | 31.11% | 35.65% | +4.54 pp Qwen3.8 A95B | 45 | 16.79% | 34.97% | +18.18 pp カテゴリ別Qwen カテゴリ | n | プリフィルなし | GPT-5.5 Pro 推論プリフィル | デルタ ------- | ---- | ----------- | ------------------------ | ----- STEM | 15 | 19.26% | 46.24% | +26.99 pp 非STEM | 15 | 20.62% | 33.42% | +12.80 pp パズル | 15 | 10.49% | 25.23% | +14.75 pp すべて | 45 | 16.79% | 34.97% | +18.18 pp 考察 Qwenは以前の実験ではOpus 4.8に対してほとんど変化しませんでしたが、ここではGPT-5.5 Proに対して+18.18ポイント移動し、特にプライベートな合成パズルに大きな影響を与えました。データは、QwenがOpusではなく、GPT-5.5 Pro、またはそれに非常に近いGPTモデルから学習した可能性を示唆しています。Kimi K3は、プリフィルなしでもプリフィルありでも、GPT-5.5 Proとの重複が最も高い(それぞれ31.11%と35.65%)ですが、プリフィルによる増加はわずか+4.54ポイントです。