AI・機械学習
LLM生成GPUカーネルのための契約グレード検証器
A Contract-Grade Verifier for LLM-Generated GPU Kernels (arxiv.org)
要約
本研究では、大規模言語モデル(LLM)が生成したGPUカーネルの正確性を評価するための、より厳格な検証器を開発しました。従来のテスト手法では見逃される多くのバグを、この検証器は発見し、LLM生成カーネルの信頼性に対する懸念を提起しています。提案された検証器は、LLM生成カーネルの品質向上に不可欠なツールとなる可能性を示唆しています。
全文翻訳
言語モデルを用いてGPUカーネルを生成するシステムは、高い正解率を報告しています。
その率は、単一の緩いテストから来ています。それは、カーネルをいくつかのランダムな入力で、一つの固定された形状で実行し、出力が参照値に近い場合に受け入れるというものです。
カーネルはそのテストに合格しても、静かに間違っている可能性があります。
それは、真の答えがNaNや無限大である場合に通常の数値を返したり、実行ごとに異なったり、形状が変わると壊れたり、参照がfp32の合計を保持するのに対しfp16で蓄積したりする可能性があります。
私たちは、正確性を正しくチェックするツールを構築しました。それは、12の敵対的なゲートの契約グレード検証器です。各ゲートは、正しいカーネルが満たさなければならないプロパティであり、そのうちいくつかは許容誤差がないため、しきい値の選択によって失敗を説明することはできません。
外部に向けて、この検証器は、公開システムのハーネスが既に正しいと受け入れた2,638個のマシン生成カーネルを監査します。
それは、許容誤差の議論を超えて壊れているものが39.5%、少なくとも1つの違反を抱えているものが62.1%であることを発見します。
この分野の標準テストは、検証器が拒否する1,487個のカーネルを受け入れますが、その逆はわずか14個です。
私たちは、4つの独立した方法でその発見を防御します。7/7のポジティブコントロール、しきい値キャリブレーションのスイープ、参照ベンチマーク自身の正しさコードとの98.5%の一致、そして層化された手動監査です。
内部に向けて、この検証器は私たち自身のカーネルを評価します。それは、ゲート付き線形回帰(GDN)ファミリーのための最初のネイティブBlackwell tcgen05トレーニングバックワードであり、この分野がまだフォールバックで実行している逆状態ステージを含みます。
私たちは、二重精度オラクルに対して独立してその正しさを確立し、それを通して5つのファミリーメンバーをトレーニングします。
カーネル生成における報告された進捗の背後にある正しさの信号は、数字が示唆するよりもはるかに弱く、許容誤差のない契約のセットは、そのギャップのほとんどを埋めるでしょう。
コメント: 17ページ、3図。doi:https://doi.org/10.5281/zenodo.21563213でもアーカイブされています
主題: 機械学習 (cs.LG); ハードウェアアーキテクチャ (cs.AR); 分散、並列、クラスタコンピューティング (cs.DC)
参照形式: arXiv:2608.12700 [cs.LG] (またはこのバージョンについては arXiv:2608.12700v1 [cs.LG])
https://doi.org/10.48550/arXiv.2608.12700
詳細はこちらをご覧ください arXiv-issued DOI via DataCite (登録待ち)
投稿履歴
送信者: Rishi Shah [メールを見る] [v1] 木曜日、2026年8月13日 01:25:56 UTC (149 KB)
全文リンク:
論文にアクセス: Rishi Shahと他の1名の著者による「A Contract-Grade Verifier for LLM-Generated GPU Kernels, and a Native Blackwell Backward for the Gated-Linear-Recurrence Family」のPDFを表示PDFHTML (実験的)TeXソースライセンス表示
現在の閲覧コンテキスト: cs.LG < 前 | 次 > 新着 | 最近 | 2026-08
以下でブラウズするように変更: cs cs.AR cs.DC
参考文献と引用
NASA ADSGoogle Scholar Semantic Scholar
エクスポート
BibTeX引用
読み込み中...
BibTeX形式の引用 ×
読み込み中...
提供元データ:
ブックマーク
書誌ツール
書誌および引用ツール
書誌エクスプローラー
書誌エクスプローラーを切り替える (エクスプローラーとは?)
Connected Papers
Connected Papersを切り替える (Connected Papersとは?)
Litmaps
Litmapsを切り替える (Litmapsとは?)
scite.ai
scite Smart Citationsを切り替える (Smart Citationsとは?)
コード、データ、メディア
この論文に関連するコード、データ、メディア
alphaXiv
alphaXivを切り替える (alphaXivとは?)
コードへのリンク
CatalyzeX
Papersのコードファインダー (CatalyzeXとは?)
DagsHub
DagsHubを切り替える (DagsHubとは?)
GotitPub
Gotit.pubを切り替える (GotitPubとは?)
Huggingface
Hugging Faceを切り替える (Huggingfaceとは?)
ScienceCast
ScienceCastを切り替える (ScienceCastとは?)
デモ
デモ
Replicate
Replicateを切り替える (Replicateとは?)
Spaces
Hugging Face Spacesを切り替える (Spacesとは?)
Spaces
TXYZ.AIを切り替える (TXYZ.AIとは?)
関連記事
レコメンダーおよび検索ツール
Influence Flowerへのリンク
Influence Flower (Influence Flowersとは?)
Core recommender
CORE Recommenderを切り替える (COREとは?)
IArxiv recommender
IArxiv Recommenderを切り替える (IArxivとは?)
著者
会場
機関
トピック
arXivラボについて
arXivLabs: コミュニティ協力者との実験プロジェクト
arXivLabsは、協力者がarXivの新しい機能を直接ウェブサイト上で開発および共有できるフレームワークです。
arXivLabsと協力する個人および組織は、オープンさ、コミュニティ、卓越性、ユーザーデータプライバシーの価値を受け入れ、遵守しています。
arXivはこの価値観にコミットしており、それに準拠するパートナーのみと協力します。
コミュニティに価値をもたらすプロジェクトのアイデアがありますか? arXivLabsの詳細をご覧ください。
この論文の著者のうち、推薦者は誰ですか?
MathJaxを無効にする (MathJaxとは?)