AI・機械学習
Ultralytics YOLO26: 統合されたリアルタイムエンドツーエンドビジョンモデル
Ultralytics YOLO26: Unified Real-Time End-to-End Vision Models (arxiv.org)
要約
YOLO26は、リアルタイムビジョンモデルの精度、効率性、多様なハードウェアへの展開のしやすさといった課題に対応するために開発されました。従来のYOLOモデルが抱えていた非最大抑制(NMS)への依存、重い検出ヘッド、長い学習スケジュール、小オブジェクトの検出漏れといった制限を、アーキテクチャと学習プロセスの改良によって解決しています。本モデルは、NMSフリーのエンドツーエンド推論、軽量なデュアルヘッド設計、MuSGD最適化、Progressive Loss、STALといった新技術を導入し、さまざまなタスクで優れた性能を発揮します。
全文翻訳
コンピュータサイエンス > コンピュータビジョンとパターン認識 arXiv:2606.03748 (cs) [2026年6月2日提出] タイトル: Ultralytics YOLO26: 統合されたリアルタイムエンドツーエンドビジョンモデル 著者: Glenn Jocher, Jing Qiu, Mengyu Liu, Shuai Lyu, Fatih Cagatay Akyon, Muhammet Esat Kalfaoglu Glenn Jocherと他の5人の著者による論文「Ultralytics YOLO26: 統合されたリアルタイムエンドツーエンドビジョンモデル」のPDFを閲覧 PDF HTMLを閲覧(実験的) 概要: リアルタイムビジョンには、正確で効率的、かつ多様なハードウェアに簡単に展開できるモデルが求められます。YOLOファミリーはこの理由から広く展開されてきましたが、ほとんどのYOLO検出器は推論時に非最大抑制に依存し、Distribution Focal Lossのため重い検出ヘッドを持ち、長い学習スケジュールを必要とし、最小のオブジェクトに対して正のラベル割り当てができないことがあります。\n本研究では、これらの制限を、調整されたアーキテクチャと学習の進歩によって解決する、統合されたリアルタイムビジョンモデルファミリーであるUltralytics YOLO26を提案します。YOLO26は、ネイティブなNMSフリーのエンドツーエンド推論のためのデュアルヘッド設計を使用し、DFLを完全に削除することで、制約のない回帰範囲を持つ軽量なヘッドを実現します。その学習パイプラインは、大規模言語モデルの学習から採用されたハイブリッドMuon-SGD最適化手法であるMuSGD、推論時のヘッドへの監視をシフトさせるProgressive Loss、および小オブジェクトに対する正のカバー率を保証するラベル割り当て戦略であるSTALを組み合わせています。検出にとどまらず、YOLO26はインスタンスセグメンテーション、姿勢推定、および指向性検出のためのタスク固有のヘッドと損失設計を導入し、タスクとスケール全体で一貫した改善をもたらします。このファミリーは5つのスケール(n/s/m/l/x)にわたり、単一のパイプラインで検出、インスタンスセグメンテーション、姿勢推定、分類、および指向性検出をサポートし、テキスト、ビジュアル、およびプロンプトフリーの推論のためのオープンボキャブラリ拡張であるYOLOE-26も提供します。\nすべてのスケールで、YOLO26はCOCOにおいて1.7〜11.8 msのT4 TensorRTレイテンシで40.9〜57.5 mAPを達成し、以前のリアルタイム検出器よりも精度-レイテンシのパレート前線を前進させます。一方、YOLOE-26xはテキストプロンプトの下でLVIS minivalで40.6 APに達します。コードとモデルはこのhttps URLで利用可能です。\nコメント: 31ページ、8図 件名: コンピュータビジョンとパターン認識 (cs.CV); 人工知能 (cs.AI) 引用元: arXiv:2606.03748 [cs.CV] (またはこのバージョンについては arXiv:2606.03748v1 [cs.CV]) https://doi.org/10.48550/arXiv.2606.03748 DataCite経由でarXiv発行のDOIについて詳しく学ぶ (登録保留中) 提出履歴 差出人: Glenn Jocher [メールを表示] [v1] 2026年6月2日火曜日 15:01:13 UTC (8,589 KB) 全文リンク: 論文へのアクセス: Glenn Jocherと他の5人の著者による論文「Ultralytics YOLO26: 統合されたリアルタイムエンドツーエンドビジョンモデル」のPDFを閲覧 PDFを閲覧 HTML (実験的) TeXソース ライセンスを表示 現在の閲覧コンテキスト: cs.CV < prev | next > new | recent | 2026-06 に閲覧を変更: cs cs.AI 参照および引用 NASA ADS Google Scholar Semantic Scholar BibTeX引用をエクスポート 読み込み中... BibTeX形式の引用 × 読み込み中... 提供データ: ブックマーク 書誌ツール 書誌・引用ツール 書誌エクスプローラー 書誌エクスプローラーを切り替える (エクスプローラーとは?) 関連論文 関連論文を切り替える (関連論文とは?) Litmaps Litmapsを切り替える (Litmapsとは?) scite.ai scite Smart Citationsを切り替える (scite Smart Citationsとは?) コード、データ、メディア この記事に関連するコード、データ、メディア alphaXiv alphaXivを切り替える (alphaXivとは?) コードへのリンク CatalyzeX Code Finder for Papersを切り替える (CatalyzeXとは?) DagsHub DagsHubを切り替える (DagsHubとは?) GotitPub Gotit.pubを切り替える (GotitPubとは?) Huggingface Hugging Faceを切り替える (Huggingfaceとは?) ScienceCast ScienceCastを切り替える (ScienceCastとは?) デモ デモ Replicate Replicateを切り替える (Replicateとは?) Spaces Hugging Face Spacesを切り替える (Spacesとは?) Spaces TXYZ.AIを切り替える (TXYZ.AIとは?) 関連論文 レコメンダーと検索ツール Link to Influence Flower Influence Flower (Influence Flowersとは?) Core recommender CORE Recommenderを切り替える (COREとは?) この論文の著者のうち誰が推薦者ですか? | MathJaxを無効にする (MathJaxとは?)