AI・機械学習
UniEvo-VL: マルチモーダルモデルの自己改善のための自己蒸留トレーニング
UniEvo-VL: Self-Distillation Training for Multimodal Model Self-Improvement (arxiv.org)
要約
UniEvo-VLは、マルチモーダルモデルがテスト時の計算中に自身の建設的な自己修正フィードバックから学習するための自己進化フレームワークです。外部の教師モデルに頼るのではなく、モデル自身の自己批評を特権情報として活用し、単一のマルチモーダルモデルが異なるコンテキストで教師と生徒の両方として機能します。この手法は、画像生成能力を向上させ、追加の反射情報への感度を維持することが実験で示されています。
全文翻訳
コンピュータサイエンス > 人工知能
arXiv:2609.38721 (cs) [2026年9月30日投稿]
タイトル: UniEvo-VL: マルチモーダルモデルの自己改善のためのオンポリシー自己蒸留トレーニングレシピ
著者: Fang Wu, Da Xing, Yanjie Huang, Junxi Wang, Ji Wang, Hejia Geng, Guancheng Wan, Bowen Zuo, Xiaomin Li, Shixiang Tang, Xinyu Xiang, Zehong Wang, Shiyi Du, Peng Xia, Shuangjia Zheng, Yining Hong, Li Erran Li, Jure Leskovec, Yejin Choi
Fang Wuと他の18人の著者による「UniEvo-VL: マルチモーダルモデルの自己改善のためのオンポリシー自己蒸留トレーニングレシピ」と題された論文のPDFを表示
PDF HTML(実験的)を表示
概要:
最新のマルチモーダルモデルは、生成と理解を単一の統合システムにもたらし、それ自身のフィードバックを提供し、そこから学習することを可能にします。
この統合された能力に触発されて、私たちはUniEvo-VLを導入します。これは、テスト時の計算中にこの建設的な自己修正フィードバックから学習するためのマルチモーダルモデルの自己進化フレームワークです。
別途、しばしばより大きな教師モデルに依存するのではなく、私たちはそれらの自己批評を特権情報として活用し、単一のマルチモーダルモデルに異なるコンテキストで教師と生徒の両方として機能させます。
生徒はバニラ質問のみを見ますが、教師は特権的な批評に条件付けられます。
その後、トレーニングは、生徒自身のサンプリング軌道にわたるデノイジング拡散分布間の状態ごとの発散を最小化します。
実験は、UniEvo-VLがマルチモーダルモデルの画像生成能力を向上させ、追加の反射情報への感度を維持することを示しています。
具体的には、オープンソースのQwen-image-2512をベースにし、GenEvalで0.747から0.808へ、GenEval2 Soft-TIFAで32.97から35.53へと大幅なパフォーマンス向上を観察しました。
さらに、より強力な外部批評者(例: GPT5.6-Luna)での試みは、強力なジャッジ能力を持つマルチモーダルモデルがより高い自己進化の天井を予測できることを示しています。
最後に、混合テキストレンダリングの結果は、私たちの自己改善が異なるタスク間で均一ではない可能性があることを示しています。
私たちの研究は、外部の監督やガイダンスなしにマルチモーダルモデルを使用する際のユーザーエクスペリエンスを向上させるための、現在のホットな再帰的自己改善研究ラインに光を当てることを目指しています。
主題:
人工知能 (cs.AI); コンピュータビジョンとパターン認識 (cs.CV)
引用形式:
arXiv:2609.38721 [cs.AI] (またはこのバージョンの場合は arXiv:2609.38721v1 [cs.AI])
https://doi.org/10.48550/arXiv.2609.38721
詳細はこちら
arXiv発行のDOIはDataCite経由(登録保留中)
投稿履歴
投稿者: Fang Wu [メール表示] [v1] 2026年9月30日 00:54:09 UTC (42,272 KB)
全文リンク:
論文にアクセス: Fang Wuと他の18人の著者による「UniEvo-VL: マルチモーダルモデルの自己改善のためのオンポリシー自己蒸留トレーニングレシピ」と題された論文のPDFを表示
PDF HTML(実験的)TeXソースライセンスを表示
現在の閲覧コンテキスト: cs.AI < 前 | 次 > 新着 | 最近 | 2026-09
以下の条件で閲覧を変更:
cs cs.CV
参考文献と引用
NASA ADSGoogle Scholar Semantic Scholar
エクスポート
BibTeX引用読み込み中...
BibTeX形式の引用×読み込み中...
Data provided by:
ブックマーク
書誌ツール
書誌および引用ツール
書誌エクスプローラー
書誌エクスプローラー(書誌エクスプローラーとは?)
Connected Papers
Connected Papers(Connected Papersとは?)
Litmaps
Litmaps(Litmapsとは?)
scite.ai
scite Smart Citations(Smart Citationsとは?)
コード、データ、メディア
この論文に関連するコード、データ、メディア
alphaXiv
alphaXiv(alphaXivとは?)
コードへのリンク
CatalyzeX
論文用コードファインダー(論文用コードファインダーとは?)
DagsHub
DagsHub(DagsHubとは?)
GotitPub
Gotit.pub(Gotit.pubとは?)
Huggingface
Hugging Face(Hugging Faceとは?)
ScienceCast
ScienceCast(ScienceCastとは?)
デモ
デモ
Replicate
Replicate(Replicateとは?)
Spaces
Hugging Face Spaces(Hugging Face Spacesとは?)
Spaces
TXYZ.AI(TXYZ.AIとは?)
関連論文
レコメンダーと検索ツール
Influence Flowerへのリンク
Influence Flower(Influence Flowerとは?)
コアレコメンダー
CORE Recommender(CORE Recommenderとは?)
著者
会場
機関
トピック
arXivLabsについて
arXivLabs: コミュニティ共同作業者との実験プロジェクト
arXivLabsは、共同作業者がarXivの新しい機能を直接ウェブサイトで開発および共有できるフレームワークです。
arXivLabsと協力する個人および組織は、オープンさ、コミュニティ、卓越性、ユーザーデータプライバシーという私たちの価値観を受け入れ、遵守しています。
arXivはこれらの価値観にコミットしており、それらを遵守するパートナーのみと協力します。
コミュニティに価値をもたらすプロジェクトのアイデアがありますか?arXivLabsの詳細をご覧ください。
この論文の著者のうち、誰が推薦者ですか?
MathJaxを無効にする(MathJaxとは?)