HN 日本語サマリー

← 一覧へ戻る
AI・機械学習

Continuous Diffusion Language Models (CDLM's)

Continuous Diffusion Language Models (CDLM's) (sander.ai)

14 pointsby peter_d_sherman2 コメント

要約

近年、言語モデリングにおける連続拡散モデル(CDLM)への関心が再燃しています。かつては離散拡散モデルに取って代わられましたが、CDLMは不確実性の表現や豊富なサンプリングアルゴリズムといった利点を持つため、再び注目されています。本記事では、CDLMの歴史的背景、離散拡散モデルとの比較、そして近年の動向について解説します。

全文翻訳

言語分野における連続拡散モデル(Continuous Diffusion Models)に関する最近の活発な動きは、数年間の比較的静かな期間を経て、このアプローチが復活しつつあることを示唆しています。完全に離散的な拡散手法が、言語への連続拡散の試みをほぼ置き換えていましたが、潮目が変わり始めています。この記事では、何が起こっているのか、そしてなぜ今それが起こっているのかを詳しく見ていきたいと思います。この分野の新しい研究の流入は、私がいくつかの考えをまとめるきっかけとなりました。以前にも拡散言語モデルについて書いたことがありますが、今回は主にそれ以降に起こったことすべてをカバーするアップデートとして機能します。これはかなり主観的な記述になります。他の視点や反対意見は、コメントや他の場所で大歓迎です。言語のための連続拡散の技術的な側面については後で議論しますが、まずは歴史的な文脈から始めましょう。 オート回帰の覇権への挑戦 現代の言語モデルは、概してオート回帰的です。つまり、一度に1トークンずつシーケンスを生成します。これは、困難な生成タスクを、より小さく、より簡単な逐次ステップに分解する自然な方法です。すべてのステップは、同じ基盤となるタスク(先行するトークンが与えられた場合にトークンを予測する)のインスタンスであり、シーケンス次元全体でのパラメータ共有を可能にします。この本質的に逐次的な生成プロセスにもかかわらず、Transformerアーキテクチャは、ティーチャーフォーシングを使用して、すべてのシーケンス位置で効率的な並列トレーニングを可能にします。これは非常にスケーラブルなレシピであることが判明し、大規模言語モデル(LLM)をもたらしました。 しかし、オート回帰は、シーケンスのための反復的な生成プロセスを構築する唯一の方法ではありません。視聴覚分野での初期の成功に触発され、研究者たちは代わりに拡散を言語生成に適用しようとしました。シーケンスを一度に1要素ずつ生成するのではなく、拡散モデルの生成プロセスは、情報を徐々に破壊する破壊プロセスを逆転させることによって定義されます。これを実現する標準的な方法は、信号が完全に圧倒されるまで、ガウスノイズを少しずつ加えることです。 2021年:初期の離散拡散モデル 2019年と2020年の画像生成における初期の成功の後、このアイデアを言語に適用する最初の試みは2021年に登場し、カテゴリデータをモデル化するために、連続的な破壊プロセスを離散的なものに置き換えることを含みました。これには、多項拡散、D3PM、SUNDAEが含まれます。当時、オート回帰の優位性は今日ほど確立されていませんでした。GPT-3は注目を集めましたが、「ChatGPTの瞬間」は2022年後半まで来ませんでした。当時、離散拡散は、ティーチャーフォーシングによるエクスポージャーバイアスや、インフィリングおよび制約付き生成タスクへの適用における相対的な困難さなど、オート回帰パラダイムにおけるいくつかの実際の理論的な欠陥に対処しているように見えました。前の数年間で、非オート回帰的および任意の順序のオート回帰的アプローチのいくつかの探求があったことに注意してください(特に機械翻訳の場合)。ただし、まだ拡散の観点からはではありませんでした。 2022年:離散データのための連続拡散 2022年には、Diffusion-LMから始まり、連続拡散を言語モデリングに適用するいくつかの試みが出現しました。このアプローチは、カテゴリデータとガウスノイズによる破壊との間の互換性の問題を異なる方法で解決します。離散カテゴリを連続的な埋め込みベクトルで表すだけで、これらはガウスノイズ破壊に完全に適合します。その方法で、画像でうまく機能するガウス拡散メカニズムを、変更なしで適用できます。Diffusion-LMは、特に制御可能なテキスト生成において、この代替生成パラダイムの利点を喧伝しました。 2022年末の数ヶ月間で、このアプローチのバリエーションを使用した他の多くの論文が公開されました。これらには、DiffuSeq、SSD-LM、Difformer、SeqDiffuSeq、GENIE、LD4LG、そして私が取り組んだ2つの論文、自己条件付き埋め込み拡散(SED)およびカテゴリデータ(CDCD)のための連続拡散が含まれます。当時、これらの連続手法の魅力は、視聴覚生成を完全に引き継いでいた連続拡散のために発見および開発されていたすべての洞察、ツール、およびメカニズムから恩恵を受けることができることでした。たとえば、連続拡散モデル用に開発されたサンプリングおよび蒸留技術の一部を離散拡散に適用することは、しばしばはるかに簡単ではなく、あるいはまったく不可能でさえありました。 2023年後半:連続拡散の終焉 それから興味深いことが起こりました。2023年以降、この分野のほぼすべての新しい研究は離散拡散を使用し、言語のための連続拡散は消滅しました。拡散言語モデルに関する2025年のサーベイ論文からの図はこれを明確に示しています。連続手法は黄色で、離散手法は緑色で示されています。2023年から2024年への移行は非常に顕著です!これが起こった正確な理由を断定するのは難しいですが、いくつかの潜在的な要因が考えられます。1つはChatGPTの瞬間であり、言語拡散研究の焦点を理論的な利点とエレガントさから生のパフォーマンスへと徐々にシフトさせました。今や、目標は、大規模で強力なオート回帰モデルに匹敵するか、特定の状況でそれを上回ることでした。人々は、おそらくそれらがオート回帰により概念的に近い関係にあるため、パフォーマンスのギャップを埋めることは、完全に離散的な手法で達成しやすいと感じたようです。 別の要因は、言語拡散モデルのスケーリングに関する科学が探求され始めており、連続手法に関する初期の観測があまり有望ではなかった可能性があることです。2023年5月、Gulrajani & Hashimotoは、尤度ベースの連続拡散言語モデル(Plaid-1B)のトレーニング効率のギャップを定量化しました。それは64倍非効率でした。(上記の図ではPlaidを離散としてマークしていますが、それは連続手法です。)LLMコミュニティがまだトレーニング計算量とパープレキシティのパレートフロンティア(Chinchilla-optimality)に非常に集中していた時期に、オート回帰ベースラインよりも2桁近くトレーニング効率が悪いモデリングアプローチは、真剣に受け止められるのが困難でした。最初のLLaMAモデルは、このトレーニング効率の焦点に挑戦し、推論予算を考慮に入れることを主張しましたが、数ヶ月前にリリースされたばかりでした(2023年2月)。そのため、コミュニティがこのシフトをまだ内部化していなかった可能性が高いと私は信じています。 言うまでもなく、これらはすべて非常に推測的なものです。おそらくそれは単なる偶然であり、離散手法がその時期に純粋に偶然の勢いを増しただけかもしれません。2023年後半の連続拡散の終焉イベントの原因となった可能性のあることについて考えがある場合は、コメントで聞かせていただければ幸いです!個人的には、その時点で拡散言語モデルでの作業を停止していました(私は画像およびビデオ生成モデルの構築で忙しくなっていました:ImagenとVeo、そして後にNano BananaとOmni)。そのため、傍観者としてこの進化を観察していました。私はそれをやや驚くべきことだと感じました。なぜなら、連続拡散には、個々のトークンレベルでの不確実性の表現能力や、頼れるサンプリングアルゴリズムとトリックの豊富なツールボックスといった、いくつかの重要な利点があると考えていたからです。それらを諦めることは間違いだったかもしれませんが、研究コミュニティ全体が明らかにそれが進むべき道だと判断しました。 離散データへの連続拡散の適応 次のセクションで、拡散言語モデリング分野で最近起こっていることについて話しますが、その前に、離散データへの連続拡散の適応方法について議論することが有用だと考えます。