AI・機械学習
分散損失が小規模言語モデルにおける埋め込み凝縮を相殺する
Dispersion loss counteracts embedding condensation in small language models (chenliu-1996.github.io)
要約
小規模言語モデル(SLM)において、分散損失という現象が、より大規模なモデルと比較して顕著に現れることが発見されました。この現象はモデルの初期化時に発生し、事前学習によって軽減されますが、知識蒸留では解決されません。これは、SLMの性能限界を理解する上で重要な示唆を与えます。
全文翻訳
1. より大規模なモデルよりも小規模なモデルでより深刻である(図 2)。
2. 2. 影響を排除した設定下で再現可能である(図 3)。
3. 3. モデルの初期化時に出現し、事前学習によって軽減される(図 4)。
4. 4. より大きなモデルからの知識蒸留では解決されない(図 5)。