HN 日本語サマリー

← 一覧へ戻る
AI・機械学習

計算最適はクラスタ最適ではない

Compute-optimal is not cluster-optimal (szha.ai)

6 pointsby yuxin_tang0 コメント

要約

最近の論文では、スケーリング則の段階にシステム段階を組み込むアプローチが提案されています。これは、トレーニングに使用するクラスタが実際に提供するリソースに基づいて各候補アーキテクチャのコストを評価するもので、特にMixture-of-Experts (MoE) モデルにおけるスパース性の最適な値は、トレーニングに使用するクラスタに依存するという結論に至っています。

全文翻訳

https://arxiv.org/pdf/2608.10605: 私たちの新しい論文は、システム段階をスケーリング則の段階に折り込みます。クラスタが実際に提供するものを基準に各候補アーキテクチャを価格設定すると、答えが変わります。MoEが持つべきスパース性は、トレーニングするクラスタに依存します。