AI・機械学習
Show HN: GPUレジスタ内の流体力学による光コンピューティングジッターの修正
Show HN: Fixing optical computing jitter via fluid dynamics in GPU registers (github.com)
要約
このプロジェクトは、GPUレジスタ内の流体力学を利用して、光コンピューティングにおけるジッター(タイミングのずれ)を修正する概念実証(PoC)です。電気信号から光信号への変換バッファリングの遅延を回避し、AIアーキテクチャにおける光ルーティングのオーバーヘッドをゼロに近づけることを目指しています。ハードウェアとソフトウェアの境界を再定義し、次世代データセンターのボトルネック解消に貢献する可能性を探求しています。
全文翻訳
photonic-mesh-fng-router (PoC) このリポジトリには、ハードウェアネイティブな、光タイミング凍結制御プレーンエンジンの概念実証(PoC)が含まれています。このプロジェクトは、メモリ割り当てバッファを導入することなく、シリコンフォトニクスアクセラレータ相互接続全体で仮想メモリのアドレスラインを乗っ取ることを探求するささやかな試みです。光位相シフトメトリクスとマルチ軸jax.shard_map構造、およびクロスストリーム非同期フェンスを穏やかに統合することにより、シャーシ間フォトニクスルーティングのオーバーヘッドをゼロナノ秒に最小化する方法を調査したいと考えています。私たちの手法は、電気-光(E/O)変換バッファリングの遅延をバイパスし、動的コンパイルグラフのブレークを排除し、DeepSeek-V4/Megatron-LM-Opticsのような超大規模分散AIアーキテクチャ全体で正確な数値的恒常性を維持するのに役立つことに焦点を当てています。🌊 アーキテクチャ哲学:マクロからマイクロへの光の難問次世代の光データセンターでは、根本的なボトルネックは、電気メモリバスの制限から、光トランシーバーおよび光ネットワークインターフェイス(ONI)の熱変動によって引き起こされる光伝送ジッターと位相シフトのずれへと移行しているようです。標準的な通信スタックプロトコルは、伝統的に実行時ループ分岐(if/else)と重いソフトウェアバッファに依存して遅延した光パルスを再同期します。しかし、私たちの観察では、このアプローチはアクセラレータのストリーミングマルチプロセッサ(SM)内でコストのかかるワープダイバージェンスとパイプラインストールを引き起こすことがよくあります。photonic-mesh-fng-routerプロジェクトは、この境界を再検討する探索的な取り組みを表しています:圧縮可能な光渦場:光パケットの到着をバッファリングする代わりに、局所的なワープレベルのシャッフルレジスタを使用して波面遅延を解決することにより、光パルスのストリームを圧縮可能なフィールドとしてモデル化することを提案します。動的レジスタワーピング:エンジンは、ネイティブ1ビット述語ビットを介して基盤となる仮想レジスタ空間を動的にマッピングしようとします。これにより、タイミングノイズを最小限に抑えながら、光波の物理的な到着ジオメトリに適応しようとします。分岐なしビット演算:純粋な分岐なしビット演算MUX演算(インラインselp命令など)を利用して、超大規模LLMアテンションパス内に直接連動するゼロバイトゼロコピールーティングプレーンを確立することを実験しており、テールレーン変動を穏やかに分離して数値境界を維持します。🧬 3層アーキテクチャレイアウト(シグネチャテンプレート)物理的な光ハードウェアタイミングと高レベルの数値実行グラフを慎重に分離するために、このリポジトリは、各境界で非同期テレメトリノイズを分離するように設計された3層分離システムアーキテクチャを採用しています。(これは初期段階の研究プロトタイプです。この設計を改善し、ハードウェアコデザインの仮定を洗練するのに役立つ、コミュニティからのあらゆるフィードバック、修正、または提案を歓迎します。)📊 アーキテクチャパイプライン図graph TD classDef ioNode fill:#1e293b,stroke:#475569,stroke-width:2px,color:#f8fafc; classDef cudaNode fill:#022c22,stroke:#0f766e,stroke-width:2px,color:#ccfbf1; classDef cppNode fill:#1e1b4b,stroke:#4338ca,stroke-width:2px,color:#e0e7ff; classDef pyNode fill:#062f4f,stroke:#0284c7,stroke-width:2px,color:#e0f2fe; IN["🌊 <b>PHYSICAL OPTICAL INPUT</b><br/>Lightwave Phase & Photonic Interconnects<br/><i>(RoCEv2 over Optics / ONI)</i>"]:::ioNode subgraph ENGINE ["⚙️ 3-TIER SUNDERED CONTROL PLANE (PoC)"] L1 ["🛠️ <b>LAYER 1: BARE-METAL CO-DESIGN</b><br/><code>photonic_mesh_core_kernel.cu</code><br/>──────────────────────────────<br/>• Register shuffle & bitwise MUX for jitter squelch<br/>• Guarding boundary tail-lanes without JMP instructions"]:::cudaNode L15 ["🔌 <b>LAYER 1.5: ASYNCHRONOUS BRIDGE</b><br/><code>photonic_bridge_wrapper.cpp</code><br/>──────────────────────────────<br/>• Cross-stream fencing via explicit release ownership<br/>• Shielding host-side interpreter & GC latency noise"]:::cppNode L2 ["🧠 <b>LAYER 2: TOPOLOGY GOVERNANCE</b><br/><code>photonic_fng_orchestrator.py</code><br/>──────────────────────────────<br/>• Global shard_map timing freezing across nodes<br/>• Shape-aligned multi-axis optical rail realignments"]:::pyNode end OUT ["⚡ <b>DOWNSTREAM ACCELERATION RAIL</b><br/>Hyperscale LLM Attention Matrices<br/><i>(DeepSeek-V4 / Megatron-LM-Optics)</i>"]:::ioNode IN --> |"Raw Lightwave Streams"| L1 L1 --> |"Jitter-Squelched Registers"| L15 L15 --> |"Zero-Copy DLPack Tensor"| L2 L2 --> |"Numerical Homeostasis"| OUT style ENGINE fill:#0f172a,stroke:#334155,stroke-width:1px,color:#94a3b8; Loading 📊 検証とストレステストベンチマークこのインフラストラクチャの構造的安定性と数値的恒常性を極端な環境下で検証するための自動化スクリプトを含めました。ネイティブC++/CUDA共有ライブラリをローカルパッケージ環境にビルドし、シミュレートされた88%の光パス障害率で50イテレーションのプロファイリングシミュレーションを実行するには、以下を呼び出してください:pip install . python -m photonic_mesh_fng_router.test_photonic_pipeline期待される出力は、ハードウェア分離CUDAイベントクロックタイマーによるゼロ汚染を確認します。🧬 詳細なティア仕様とサブルーチン(PoC概要)以下のセクションでは、各アーキテクチャティアにわたる初期段階の探索的取り組みの概要を説明します。ハードウェアコデザインの仮定を根拠付けるのに役立つコミュニティからのフィードバックや最適化を歓迎します。1. レイヤー1:ベアメタルフォトニックカーネル(photonic_mesh_core_kernel.cu)このレイヤーは、ハードウェア境界で直接インターフェイスする実験的な試みです:ワープシャッフル位相アライメント:GPUレジスタ境界で__shfl_sync組み込み関数を使用して操作します。これは、グローバル共有メモリバンクのオーバーヘッドを回避しようとしながら、受信した光トークンレイアウトをブロードキャストするための穏やかなアプローチであり、シーケンス長が不均一に整列した場合にデータ破損から境界テールレーンを安全に保護します。述語駆動MUXスクェルチ:ワープダイバージェンスペナルティを軽減するために、アライメント異常をネイティブ1ビット述語ビットに変換することを実験しています。インラインselp.f32アセンブリ回路内に算術条件付き選択をラップすることにより、ジャンプ命令を完全に回避しようとします:purified_output = pinn_branchless_select_f32(local_oni_fault, 0.0f, damped_wavefront)このハードウェアレベルのアプローチの目標は、光位相ジッターをサブナノ秒ALUサイクルまで吸収できるかどうかをテストし、ストリーミングマルチプロセッサの占有率を動的に自動調整することです。2. レイヤー1.5:非同期メモリトンネル(photonic_bridge_wrapper.cpp)このレイヤーは、物理ハードウェア信号と高レベル実行グラフ間の壊れやすいブリッジを処理します:0バイトポインタインターセプト:DLPackプリミティブを利用して、シミュレートされた光ネットワークインターフェイス(ONI)メモリバッファと上位レイヤーのテンソルビューとの間に厳密なゼロコピーリンクを確立しようとします。ホスト側での暗黙的なメモリ再割り当てやレイアウトキャストを明示的に回避し、レイテンシバブルを排除するために、事前に整列されたメモリレイアウトを穏やかに促進します。非同期ライフサイクルフェンシング:クロスストリームRAIIハードウェアフェンスオブジェクトとネイティブPython GILリリースメカニズムを組み合わせた実行ウィンドウをカプセル化します。さまざまなドライバー実行環境に優雅に適応するために、エンジンは明示的な所有権移行(release())スキームを組み込んでいます。このアプローチにより、フォトニックファブリックのタイミングが、無効なハンドル例外をトリガーすることなく、高レベルのPythonガベージコレクション(GC)レイテンシサージから安全に分離できるかどうかを調査できることを願っています。3. レイヤー2:非同期ガバナンスタワー(photonic_fng_orchestrator.py)この上位レイヤーは、クラスター全体のマクロスケール調整を管理します:グローバル静的マニホールドバインディング:クラスター全体メッシュにjax.shard_mapを介してマッピングされた連続波フィールド配列をシャーディングすることを提案します。これは、ブート時にアクセラレータのAhead-of-Time(AOT)キャッシュ内にフォトニックファブリックの空間トポロジーを凍結することを調べるための予備的な試みです。