AI・機械学習
Laion Big Video Dataset
Laion Big Video Dataset (projects.laion.ai)
要約
LAION-BVDは、CommonCrawlから収集した13億件のプラットフォーム固有の動画URLからダウンロードされた8000万件の動画(合計1000万時間)を含む、大規模なオープン動画データセットです。このデータセットは、動画、音声、画像のマルチモーダル学習のための事前学習を目的としており、抽出されたクリップには合成キャプションが生成されています。LAION-BVDで学習されたモデルは、標準的な動画・テキスト、音声・テキスト、画像・テキストのベンチマークで競争力のある性能を示し、研究コミュニティにマルチモーダル動画へのオープンアクセスを大幅に拡大します。
全文翻訳
オープンリサーチデータセット LAION Big Video Dataset
Andreas Hochlehnert1,* · Marianna Nezhurina2,3,* · Mehdi Cherti2,3 · Andrej Radonjic4 · Thaddäus Wiedemer5,1 · Christoph Schuhmann2 · Romain Beaumont2 · Wieland Brendel5 · Bernhard Schölkopf5 · A. Sophia Koepke1,6,◇ · Jenia Jitsev2,3,◇ · Matthias Bethge1,◇
論文を読む データセットをダウンロード GitHub
* 共同筆頭著者 · ◇ 共同最終著者
1 Tübinger AI Center, University of Tübingen
2 LAION
3 JSC, FZJ
4 Wynd Labs
5 MPI for Intelligent Systems, ELLIS Institute Tübingen
6 MCML, Technical University Munich
提携機関
概要
要旨
私たちは、LAION-BVD(LAION — Big Video Dataset)を発表します。これは、CommonCrawlから収集した13億件のプラットフォーム固有の動画URLを含む、マルチモーダル学習のための大規模オープン動画データセットです。これらのURLから、合計1000万時間の動画8000万件をダウンロードしました。このデータセットは、動画、音声、画像のモダリティを横断するマルチモーダル事前学習のために設計されています。コンテンツを認識するシーン検出を使用してクリップを抽出し、動画と音声のキャプションを合成生成します。これらのデータで学習されたモデルは、標準的な動画・テキストおよび音声・テキストのベンチマークで競争力のある性能を達成し、学習またはモデルのスケールが増加するにつれて一貫した改善が見られます。さらに、シーン変化フレームを抽出することにより、動画フレームを画像・テキストデータソースの代替として探求します。これらのフレームは、標準的なウェブ画像コーパスとは異なる視覚的分布を示し、このデータセットで学習されたモデルは強力な画像・テキスト検索性能を達成します。私たちはLAION-BVDを研究コミュニティに公開します。これは、前例のない規模でのマルチモーダル動画へのオープンアクセスを大幅に拡大します。
数字で見る
前例のない規模
マルチモーダル学習研究のための最大のオープンアクセス可能な動画コーパス
🔗 0 動画URL
Common Crawlから収集されたプラットフォーム固有のURL
🎬 0 ダウンロードされた動画
正常にダウンロードおよび処理された動画
⏱️ 0 総時間
すべてのダウンロードにわたる動画コンテンツの合計
✂️ 0 アノテーション付きクリップ
動画キャプションが生成されたクリップ
🖼️ 0 抽出されたフレーム
画像・テキスト事前学習のための動画フレーム
ベンチマーク
実験結果
LAION-BVDで学習されたモデルは、動画、音声、画像・テキストのベンチマーク全体で競争力のある性能を達成します
ViCLIP
動画・言語ベンチマーク
LAION-BVDで学習されたViCLIPモデルは、標準的な動画・テキストベンチマークにおいて、InternVidで学習されたモデルを最大2.1%上回り、学習スケールが1000万から5000万クリップに増加するにつれて一貫した改善が見られます。
InternVid (FLT) ベースラインを最大 +2.1% 上回る
1000万〜5000万クリップ全体で一貫したゲイン
5500万クリップ(合成動画キャプション付き)
CLAP
音声・言語ベンチマーク
LAION-BVDで学習されたCLAPモデルは、動画から直接抽出された豊富なイン・ザ・ワイルドなサウンドスケープを活用し、他の大規模な非キュレーション音声データセットに対して競争力のある性能を達成します。
非キュレーション音声データセットと競争力がある
多様な動画から抽出された音声・テキストペア
モデルとデータスケールを増加させた際の良好なスケーリング傾向
CLIP
画像・テキストベンチマーク
フレームベースのCLIPモデルは、標準的なベンチマークで強力な画像・テキスト検索性能を達成します。動画フレームは、典型的なウェブコーパスとは異なる視覚的分布を示し、既存の画像事前学習ソースを補完します。
標準的なベンチマークで強力な検索性能
3億フレーム(ユニークな視覚的分布)
標準的なウェブ画像データセットを補完
責任ある利用
倫理とリリース声明
LAION-BVDは、大規模なオープンで再現可能なマルチモーダル研究を支援するためにリリースされます。大規模な動画データセットとその上で学習されたモデルは、ますます少数の、主にプロプライエタリなテクノロジー企業に集中しており、独立した科学的調査と再現性を制限しています。学術研究のためのオープンリソースを提供することにより、私たちはマルチモーダル学習データへのアクセスを拡大し、大規模な動画、音声、画像モデルのより透明性の高い評価を可能にすることを目指しています。LAION-BVDは研究目的のみにリリースされ、商業目的ではありません。このデータセットは、科学研究、再現性、安全性分析、およびマルチモーダル基盤モデルとその関連システムの研究をサポートすることを目的としています。私たちは、コンテンツクリエイターの権利と著作権を尊重し、データセットを責任を持って、適用される法律およびプラットフォームの規約に従って使用することをユーザーに奨励します。他の大規模なウェブデータセットと同様に、LAION-BVDにはバイアス、ステレオタイプ、言語、地域、トピック間での不均一な表現が含まれている可能性があります。このデータで学習されたモデルは、そのようなバイアスを継承する可能性があります。データセットを使用する研究者は、これらの制限を認識し、関連する場合は、モデルの機能とともに評価および報告する必要があります。
参考文献
引用
BibTeX
コピー
@misc{laionbvd2026,
title={LAION-BVD: A 10-Million-Hour Open Video Dataset for Multimodal Pre-training},
author={Andreas Hochlehnert and Marianna Nezhurina and Mehdi Cherti and Andrej Radonjic and Thaddäus Wiedemer and Christoph Schuhmann and Romain Beaumont and Wieland Brendel and Bernhard Schölkopf and A. Sophia Koepke and Jenia Jitsev and Matthias Bethge},
year={2026},
eprint={2608.24845},
archivePrefix={arXiv},
primaryClass={cs.CV},
url={https://arxiv.org/abs/2608.24845},
}