HN 日本語サマリー

← 一覧へ戻る
AI・機械学習

YOLO26の紹介

An Introduction to YOLO26 (blog.roboflow.com)

8 pointsby teleforce0 コメント

要約

YOLO26は、2026年1月にリリースされたエンドツーエンドの物体検出およびマルチタスクモデルファミリーであり、5つのサイズバリアントで検出、インスタンスセグメンテーション、姿勢推定、指向性物体検出、画像分類をサポートします。非最大抑制(NMS)を排除して低レイテンシを実現し、Distribution Focal Loss(DFL)モジュールを削除してエッジおよび低電力ハードウェアとの互換性を向上させています。本記事では、YOLO26のアーキテクチャ、COCOベンチマーク結果、ダウンロードリンク、およびRF-DETR、LW-DETR、D-FINEなどの他のモデルとの比較を詳しく解説しています。

全文翻訳

ブログ YOLO26とは何か? はじめに 寄稿者 2026年1月14日公開 • 5分読了 要約 YOLO26は、エンドツーエンドの物体検出およびマルチタスクモデルファミリーであり、NanoからExtra Largeまでの5つのサイズバリアントで検出、インスタンスセグメンテーション、姿勢推定、指向性物体検出、画像分類をサポートします。2026年1月にリリースされ、低レイテンシのために非最大抑制を排除し、エッジおよび低電力ハードウェアとの互換性を向上させるためにDistribution Focal Lossモジュールを削除しています。この記事では、アーキテクチャ、COCOベンチマーク結果、ダウンロードリンク、およびRF-DETR、LW-DETR、D-FINEなどのモデルとの比較について説明します。\nYOLOモデルは、物体検出、セグメンテーション、姿勢推定、分類、指向性物体検出など、幅広いタスクを処理するように設計されたリアルタイムコンピュータビジョンモデルのファミリーです。人気のあるアーキテクチャを活用し、これらのモデルは並外れた速度と精度を提供し、エッジデバイス、クラウドAPIなどのアプリケーションに非常に適しています。このブログでは、2026年1月にリリースされたYOLO26を検証し、その主要な改善点、重要な機能、および他の主要なコンピュータビジョンモデルとの比較を明らかにします。\n💡Roboflowは、ラベリング、トレーニング、デプロイメントでYOLO26をサポートしています。詳細はこちらをご覧ください。\nYOLO26とは?\nYOLO26は、物体検出、インスタンスセグメンテーション、画像分類、姿勢推定、指向性物体検出など、幅広いコンピュータビジョンタスクを処理するように設計されたマルチタスクモデルファミリーです。このラインナップには、さまざまなパフォーマンスとデプロイメントのニーズに対応するために、Nano(N)、Small(S)、Medium(M)、Large(L)、およびExtra Large(X)の複数のサイズバリアントが含まれています。\n以前のYOLO世代と比較して、YOLO26はエッジデプロイメント向けに最適化されており、CPU推論の高速化、よりコンパクトなモデル設計、および多様なハードウェア環境での互換性を向上させるための簡素化されたアーキテクチャを特徴としています。注目すべき改善点には、NMSを削除することによるレイテンシの低下と、fp16およびfp32で結果の一貫性を保つことが含まれており、最適化された低レイテンシの方法でモデルを実行し、トレーニング中に得られたのと同じ高い精度を得ることが可能になります。\n⚡RF-DETRニューラルアーキテクチャサーチ(NAS)はYOLO26よりも高速で正確です。ブログ記事はこちらをご覧ください。\nYOLO26を画像で試す\nCOCOデータセットに含まれる一般的なオブジェクトに対してYOLO26がどのように動作するかを画像で確認してください。以下のデータでモデルがどのように処理するかをテストしてください。\nYOLO26をダウンロードする\n以下の表は、物体検出用のYOLO26のダウンロードリンクを提供し、Ultralyticsが報告したYOLO26モデルファミリーのパフォーマンスベンチマークを、nanoからextra-largeまでのバリアントで、精度(mAP)、レイテンシ、計算コストなどの主要なメトリクスで比較しています。\nモデルサイズ(pixels)mAPval50-95SpeedCPU ONNX(ms)SpeedT4 TensorRT10(ms)params(M)FLOPs(B)\nYOLO26n64040.938.9 ± 0.71.7 ± 0.02.45.4\nYOLO26s64048.687.2 ± 0.92.5 ± 0.09.520.7\nYOLO26m64053.1220.0 ± 1.44.7 ± 0.120.468.2\nYOLO26l64055.0286.2 ± 2.06.2 ± 0.224.886.4\nYOLO26x64057.5525.8 ± 4.011.8 ± 0.255.7193.9\nこの比較は、推論速度と検出精度のトレードオフを強調しており、特定のハードウェア制約に最適なモデルサイズを選択できるようにします。他のモデルタスクタイプについては、YOLO26 Githubにアクセスしてください。\nYOLO26アーキテクチャ\nYOLO26はいくつかの主要な改善点をもたらします。\nより広範なデバイスサポート: Distribution Focal Loss (DFL) モジュールを削除することで、推論を簡素化し、複数のエクスポート形式 (TFLite、CoreML、OpenVINO、TensorRT、ONNX) を可能にし、エッジおよび低電力デバイスのサポートを広げます。\n強化された小オブジェクト認識: ProgLossおよびSTAL損失関数を利用し、特に小オブジェクトの検出精度を向上させ、IoT、ロボット工学、航空画像アプリケーションに大きな利点を提供します。\nエンドツーエンド予測: 後処理ステップとしての非最大抑制 (NMS) を排除し、予測を直接生成することでレイテンシを削減し、実世界システムでのデプロイメントをより高速、軽量、信頼性の高いものにします。\nより高速なCPU推論: モデル設計とトレーニングの最適化により、YOLO26はYOLO11と比較してCPUで高速化されています。たとえば、YOLO26-NバリアントはYOLO11-Nよりも最大43%高速なCPU推論を実現し、YOLO26はGPUのないデバイスでのリアルタイムパフォーマンスに最適です。\n改善されたトレーニング: Kimi K2 LLMのブレークスルーに触発されたSGDとMuonのハイブリッドであるMuSGDオプティマイザを導入し、大規模言語モデルの最適化の進歩をコンピュータビジョンに転送することで、安定したトレーニングと高速な収束を保証します。\nYOLO26の代替案\nYOLO26以外にも、いくつかのマルチタスクコンピュータビジョンモデルが積極的に使用され、物体検出リーダーボードでベンチマークされています。\nRF-DETR\nRoboflowによって開発され、2025年3月にリリースされたRF-DETRは、セグメンテーション、物体検出、および分類タスクをサポートするリアルタイム検出モデルのファミリーです。RF-DETRは、YOLO26をベンチマーク全体で上回り、ドメイン全体で優れた汎化能力を示しています。\nRF-DETRは、Inferenceを使用してエッジで実行できるほど小さく、強力な精度とリアルタイムパフォーマンスの両方を必要とするデプロイメントにとって理想的なモデルです。\nLW-DETR\nLight-Weight Detection Transformer (LW-DETR) は、2024年6月にリリースされたリアルタイム物体検出アーキテクチャであり、Vision Transformer (ViT) とDETRデコーダの強みを組み合わせています。\nこのモデルは、ViTを使用して画像をより小さなパッチに分割し、マルチレベルの特徴表現を統合して、より正確で堅牢な予測を生成します。この設計を活用することで、LW-DETRはYOLO11を精度と推論速度の両方で上回ります。\nD-FINE\nD-FINEは、2024年10月にリリースされたリアルタイム物体検出アーキテクチャであり、より優れた局所化精度のためにバウンディングボックス分布を繰り返し改善するFine-grained Distribution Refinement (FDR) メカニズムを導入しています。\nこの改善プロセスは、ナビゲーションや意思決定アプリケーションにとって重要なリアルタイムパフォーマンスを維持しながら、モデルが小さなオブジェクトや重なり合うオブジェクトを検出する能力を高めます。\nYOLO26論文\nUltralyticsはYOLO26の正式な研究論文を公開しておらず、公開する予定もありません。コーネル大学とカンザス州立大学の研究者は、「YOLO26: Key Architectural Enhancements and Performance Benchmarking for Real-Time Object Detection」というタイトルのYOLO26論文を執筆しました。\nYOLO26の作成者による公式論文ではありませんが、モデルを理解するための役立つリソースとなります。\n結論\nYOLO26は、物体検出、インスタンスセグメンテーション、姿勢推定、指向性物体検出(OBB)、画像分類の5つのコアコンピュータビジョンタスクをサポートする、エンドツーエンドのエッジ最適化モデルです。このフレームワークは、これらすべてのタスクにわたって包括的な機能を提供し、ユーザーはすべてのモデルバリアントでトレーニング、検証、推論、およびエクスポートをシームレスに実行できます。YOLO11、RF-DETR、LW-DETR、D-FINEなどのモデルと比較すると、YOLO26はパラメータの効率的な使用と高速な推論速度が際立っています。Distribution Focal Loss (DFL) モジュールの削除は、幅広いエッジおよび低電力デバイスとの互換性をさらに強化します。\nこれらの強化により、YOLO26はエッジコンピューティング、ロボット工学、IoTアプリケーション、および計算リソースが限られたその他のシナリオに最適です。\nYOLOモデルの詳細はこちらをご覧ください。\nこの投稿を引用する\nこの投稿を研究で引用するには、次のエントリを使用してください。 寄稿者。(2026年1月14日)。YOLO26とは何か? はじめに。Roboflowブログ:https://blog.roboflow.com/yolo26/\nつながりを保つ\nコンピュータビジョンの最新情報をいち早く入手 いつでも購読解除できます。プライバシーポリシーをご覧ください。\n執筆者 寄稿者 その他の投稿を見る\nトピック コンピュータビジョン コンピュータビジョンの詳細を見る すべてのコンピュータビジョン投稿を見る\nRoboflowによるプラノグラムコンプライアンス検出 2026年6月22日 • 10分読了\nAI搭載ロボット溶接欠陥検出システムの構築 2026年6月22日 • 8分読了\n自己ホスト型Roboflow推論におけるワークフローキャッシング 2026年6月18日 • 6分読了\n産業用コンピュータビジョンにおける既製モデル vs カスタムモデル 2026年6月18日