AI・機械学習
計算最適はクラスタ最適ではない
Compute-optimal is not cluster-optimal (szha.ai)
要約
最近の論文では、スケーリング則の段階にシステム段階を組み込むアプローチが提案されています。これは、トレーニングに使用するクラスタが実際に提供するリソースに基づいて各候補アーキテクチャのコストを評価するもので、特にMixture-of-Experts (MoE) モデルにおけるスパース性の最適な値は、トレーニングに使用するクラスタに依存するという結論に至っています。
全文翻訳
https://arxiv.org/pdf/2608.10605: 私たちの新しい論文は、システム段階をスケーリング則の段階に折り込みます。クラスタが実際に提供するものを基準に各候補アーキテクチャを価格設定すると、答えが変わります。MoEが持つべきスパース性は、トレーニングするクラスタに依存します。