HN 日本語サマリー

← 一覧へ戻る
AI・機械学習

Un-0:結合振動子を用いた画像生成

Un-0: Generating Images with Coupled Oscillators (unconv.ai)

172 pointsby babelfish41 コメント

要約

Unconventional AIは、GPU上での深層ニューラルネットワーク実行に代わる、物理法則を利用した新しいコンピューティング手法「Un-0」を発表しました。結合振動子システムをシミュレートすることで画像を生成し、ImageNet 64x64でFID 6.74を達成、従来の初期の画像生成手法と同等の品質を示しています。この研究は、将来的にAIモデルのエネルギー効率を1,000倍向上させる可能性を秘めており、モデルの重み、トレーニング、アブレーションコードはオープンソースで公開されています。

全文翻訳

2026年6月25日モデルリリース\nUn-0の紹介:結合振動子を用いた画像生成\n執筆者:Unconventional AI\n要約。GPU上での深層ニューラルネットワークの実行が10年間AIを支配してきましたが、次のエネルギー効率の飛躍には、物理法則が計算を行う根本的に異なるコンピューターが必要だと我々は考えています。我々は、結合振動子からなるシミュレートされたシステムによって駆動される画像生成器「Un-0」を構築しました。これは、新興の物理コンピューティング基盤の一例です。ImageNet 64×64においてFID 6.74を達成し、従来の主要な画像生成手法が最初に発表された時点での品質に匹敵します。重み、トレーニング、アブレーションコードはすべてオープンです。Unconventionalな旅にぜひご参加ください!図0:時間の経過に伴うUn-0生成の軌跡のサンプル。各線の色には、クラスと時間の経過とともに生成された画像を示す、類似の色のボックスが関連付けられています。\n\nUn-0\nUnconventional AIでは、物理法則を利用して計算を行う新しい種類のコンピューターを構築しています。私たちの目標は、現代のAIを今日の機械が必要とするエネルギーのほんの一部、約1,000分の1のエネルギーで実行することです。最初のステップとして、私たちは問いかけます:物理的な動的システムを訓練して、大規模に画像を生成することはできるでしょうか?今日の最高のAIモデルは、トランスフォーマーバックボーンを持つ従来の深層ネットワークです。しかし、物理システムのダイナミクス、例えば、従来のデジタル化された数値ではなくアナログ電圧と電流で計算するアナログ回路のノイズが多く時間変化する挙動を利用することでエネルギー効率を追求する代替手法の長い歴史もあります。これらの物理ベースの代替手法には、ニューロモルフィックコンピューティング(Mead, 1990)、ホップフィールドネットワーク(Hopfield, 1982)、リザバーコンピューティング(Jaeger, 2001; Maass et al., 2002)などがあります。最近では、ハミルトニアンネットワーク(Greydanus et al., 2019)、リキッドネットワーク(Hasani et al., 2021)、ニューラル波マシン(Keller & Welling, 2023)、熱力学コンピューティング(Coles et al., 2023; Jelinčič, 2025)、蔵本振動子(Miyato et al., 2025; Song et al., 2025)も開発されています。これらの代替コンピューティング方法を活用するには、AIタスクを物理システムのダイナミクスに効率的にマッピングする必要があります。Un-0は、最新のAIワークロードが今日のハードウェアよりも物理基盤上でより効率的に実行できることを検証しています。\n\nデータ空間における画像形成の軌跡(クラス:デイジー、レイクサイド、アガリクス、間欠泉、火山、クラゲ)。物理的および非従来型の基盤上でAIを構築する成長中のコミュニティにおいて[1-8、その他]、Un-0は、私たちの知る限り、物理的な動的システムのシミュレーションを使用するこれまでで最も高性能な画像生成器です。Un-0はクラス条件付きImageNet 64×64でFID 6.74を達成していますが、パラメーター数に対するモデルパフォーマンスを従来のフロンティアに向けて改善する機会はまだあります。私たちが探求する物理的プリミティブは新しいものではありませんが、それをより大規模な生成ベンチマークにスケールアップし、ダイナミクス自体のアブレーション解析を行い、モデルの挙動の解釈的分析を提供します。私たちは、モデルの重み、トレーニング、評価、アブレーションコードをリリースし、物理システムのダイナミクスに基づいたモデルを誰でも簡単に実験できるようにしています。私たちはUn-0をすぐに超えることが可能だと信じています。現代のAIを物理ダイナミクスに再配置し、約1000倍のエネルギー効率向上を達成する道のりはまだ始まったばかりです。\n\nUn-0の仕組み\n図1a:2つのメトロノームのような振動子が、時間経過とともに3つの結合レジームを示す。1)ドリフト(結合なし)、2)同期(正の結合)、3)逆位相同期(負の結合)。2つのメトロノームが隣り合って刻んでいる様子を想像してみてください(図1a)。それぞれは、いつでもその位相、つまり振り子のアームが振りのどの位置にあるかによって記述できます。2つのメトロノームを同じテーブルに置くと、共有された表面を通して互いに影響し合います。互いへの感度、つまり結合強度に応じて、それらは同調したり、反対の動きをしたりします。それが振動子です。位相を持ち、自身の固有の速度で回転しようとし、隣接する要素の力に影響されるプリミティブな構成要素です。\n\n図1b:結合振動子の集合の進化のイラスト。\nさて、それを2つの振動子から数千にスケールアップしてみましょう。これらの多数の振動子集団は、それぞれが独自の強度で互いに結合しており、自己組織化してパターンを形成します(図1b)。Un-0の計算エンジンは、大規模な振動子集団であり、すべての振動子ペア間の結合強度がモデルの主要な学習可能パラメータです。これらの結合振動子は、一般的に蔵本振動子としてモデル化されます。具体的には、各振動子の動きは、時間の経過とともに連続的に適用される単一のルールに従います。それは自身の固有周波数で回転し、他のすべての振動子の引力によってわずかに動かされます。以下の常微分方程式(ODE)は、時間の経過に伴う振動子の進化を記述します。\n\n\dot{\theta}_i = \omega_i + \sum_{j=1}^{N} K_{ij}\,\sin(\theta_j - \theta_i), \qquad i = 1, \dots, N\n\n各振動子 i は位相 \theta_i \in [0, 2\pi) を持ち、\omega_i はその固有周波数です。行列 K_{ij} は、振動子 j が i を揃えさせる、または遠ざけさせる強さを示す結合強度を指定します。Un-0のこのコンポーネントにおける学習問題は、結合行列 K と周波数 \omega を学習することです。これらが物理システムのパラメーターです。\n\nなぜ振動子なのか?\n脳では、リズミカルな活動と同期が遍在しており、分散した特徴をコヒーレントな知覚に結合する、領域間の通信をゲートする、スパイクのタイミングを組織化するなどの計算作業を行うことが長年仮説として提唱されてきました(Gray et al., 1989; Buzsáki, 2006; Fries, 2015)。結合振動子は、その種の挙動の最も単純な数学モデルの一つであり、ニューロインスパイアードな計算モデルを研究する上での自然なプリミティブとなっています(Winfree, 1967; Kuramoto, 1975; Ermentrout, 1996; Ermentrout et al., 2010)。Unconventionalで私たちにとって最も重要なのは、振動子が原始的な物理回路であるということです。結合振動子システムは、CMOSや他の物理基盤に直接実装でき、システムの物理がダイナミクスを直接計算します。それがUn-0の根底にある賭けです。つまり、物理法則がAIワークロードを計算できるならば、実行基盤は今日のものとは大きく異なる可能性があるということです。\n\nモデル\n図2:結合振動子(コンディショニング振動子から振動子のプールへの単方向低ランククラス条件付き行列を持つ)は、訓練された結合の下で時間とともに進化します。画像は、デコーダーを介して時間 T で読み出され、画像を生成します。画像分布は、初期条件を何度もサンプリングすることで生成されます。\n\nモデルアーキテクチャ。Un-0で画像を生成するための推論は、5つのステップに従います。\nランダム性から始める。すべての振動子の位相をランダムな角度 \theta_i \in [0, 2\pi) に設定します。このランダムな開始状態がシードであり、拡散モデルやGANがサンプリングするノイズに対応します。異なるシードは異なる画像を生成します。\nクラスを選択する。2番目のより小さな振動子のグループが、要求されたクラス(例:「デイジー」または「火山」)を駆動し、メインの振動子集団に結合され、メインの集団をそのクラスに関連する配置に偏らせます。\n物理を実行させる。システムを解放し、振動子がお互いを引き合わせるようにします。振動子は初期のランダムな状態から進化し、結合によって決定された状態へと落ち着きます。\nスナップショットを撮る。指定された時間(Tと呼びます)で、各振動子の位相を記録します。この最終位相の集合は数値のグリッドであり、画像の潜在表現です。\nレンダリング。従来のデコーダー(モデルのパラメーターの13%未満)が、その潜在表現を完成したピクセルに変換します。\nトレーニングはモデル内の3つのことだけを変更します。1)振動子同士がどのように結合されるか(行列 K)、2)各振動子の固有周波数(\omega_i)、および3)デコーダーの重みです。これらを合わせて、振動子