AI・機械学習
Seedance 2.5の紹介:ワンテイク制作、柔軟な参照
Seedance 2.5 (seed.bytedance.com)
要約
ByteDanceは、次世代ビデオ生成モデルSeedance 2.5を発表しました。このモデルは、最大30秒の高品質ビデオを生成し、複数回の延長に対応することで、長編ストーリーテリング能力を大幅に向上させています。また、画像、ビデオ、音声の参照機能を強化し、より複雑なクリエイティブの意図を捉えることが可能になりました。さらに、タイムスタンプレベルでの編集機能も精度と安定性が向上し、プロフェッショナルな映像制作の要求に応えます。
全文翻訳
ワンテイク制作、柔軟な参照:Seedance 2.5の紹介
日付
2026-07-31
カテゴリ
モデル
本日、新世代ビデオ制作モデルであるSeedance 2.5を正式にローンチします。Seedance 2.0のリリース以来、ユーザーはビデオ制作モデルに単にクリップを生成するだけでなく、クリエイティブな作品を完成させることを期待するようになっていることに気づきました。Seedance 2.0の統一されたマルチモーダル音声・ビデオ共同生成アーキテクチャを基盤とするSeedance 2.5は、基盤となる生成と参照ベースの生成に焦点を当て、長編ストーリーテリング、マルチモーダル参照、編集において大きな進歩をもたらします。実際のユースケースに基づき、より大きなクリエイティブな想像力とコントロールを開き、生産性をさらに解き放ちます。
主なハイライトは以下の通りです。
生成ごとに最大30秒、複数回の延長に対応:Seedance 2.5は、1回のパスで高品質な30秒の音声・ビデオクリップを生成でき、複数回の延長をサポートします。また、ショット遷移とシーン変更を改善し、長尺ビデオの連続性を強化し、画像、音声、モーションの品質で顕著な向上をもたらし、AI生成ビデオで一般的に見られるものよりも自然で洗練されたビジュアル品質を実現します。その結果、ユーザーは一貫した視聴覚言語で高品質な数分間のコンテンツを制作し、ワンテイクで完全なストーリーを生き生きと描くことができます。
完全にアップグレードされたマルチモーダル参照:ユーザーは現在、1回のパスで最大30枚の画像、10本のビデオクリップ、10本の音声クリップを参照資料として入力できます。このモデルは、クレイレンダー、モーション、クリエイティブ参照など、さまざまな参照機能を強化し、クリエイターの意図をより良く把握し、複数の被写体、シーン、ショット変更にまたがる複雑なアイデアを実現できるようにします。
より正確で安定した編集機能:Seedance 2.5は、タイムスタンプレベルのコントロールを提供し、音声およびビデオコンテンツのターゲット編集を可能にし、効率と制御性を著しく向上させます。このモデルは、グリーンバック、カメラアングル、参照ベースの編集などの高度な編集機能も強化し、映画や広告などの専門的で複雑な分野の厳格な要求に応えます。
長編ストーリーテリング、マルチモーダル参照、編集の進歩により、Seedance 2.5は単なる長尺ビデオ生成を超えています。このモデルはクリエイティブな意図をより良く理解し、アイデアから完成したビデオまでの旅をより大きなコントロールで提供します。それでは、Seedance 2.5によってエンドツーエンドで制作された短いクリエイティブフィルムをご覧ください。
お使いのブラウザはビデオ再生をサポートしていません。
本日、Seedance 2.5はJimeng AI、Doubao Proなどのプラットフォームで展開され、APIアクセスはBytePlus ModelArkを介して近日中に提供される予定です。ぜひお試しいただき、フィードバックをお寄せください。
プロジェクトホームページ:
https://seed.bytedance.com/seedance2_5
アクセス方法:
Jimeng Web -> ビデオ生成 -> Seedance 2.5を選択
Doubao Pro -> ビデオ生成 -> Seedance 2.5を選択
30秒の長編ストーリーテリングと複数回の延長:ワンテイクで完全なストーリーを提示
Seedance 2.5は、ワンテイクビデオ生成を15秒から30秒に延長し、長尺ビデオでのストーリーテリングをさらに強化します。30秒以内では、モデルは複数の論理的に接続されたショットを組織化し、単に1つの瞬間を延長するのではなく、セットアップ、展開、転換点、解決を経てストーリーが展開するようにします。例えば、歌手のステージパフォーマンスのワンテイククリップでは、モデルは、ステージに上がる瞬間だけでなく、楽屋でスタッフと交流し、バックステージの廊下を歩き、ダンサーたちと会い、彼らと一緒にステージに上がるという、歌手の完全なストーリーを描写します。
お使いのブラウザはビデオ再生をサポートしていません。
T2Vプロンプト:ワンテイクハンドヘルドジンバル追跡ショット。カメラは重い赤いカーテンの隙間をゆっくりと押し込み、暖色系の楽屋に入る。カメラに背を向けた若い女性歌手がイヤホンを調整しており、スタッフが声をかける。彼女はカメラの方を向き、シティポップを歌い始める。カメラは引き戻され、彼女がカーテンを抜けて薄暗いバックステージの廊下に入り、ダンサーたちと自然に交流するのを追う。スタッフの一人がマイクを渡す。彼女とダンサーたちはステージに上がり、カメラは後ろに円を描くように動き、赤と黒のステージデザイン、LEDスクリーン、スポットライト、ハズ、反射する床を徐々に明らかにする。カメラは最終的にアリーナのワイドショットに引き戻され、満員の観客、ライトボード、サイリウム、歓声の crowd を示し、コンサートの若々しく自由なクライマックスを捉える。
モデルの複数回延長機能のおかげで、ユーザーは既存のビデオ出力に後続のショットをスムーズに追加できます。延長プロセス全体を通して、主要なキャラクター、環境、ナレーションのペースの一貫性を維持します。これにより、ユーザーは一度に数分間のビデオを出力でき、クリップの分割、映像の繰り返しスプライシング、遷移の修正にかかる労力を削減できます。
お使いのブラウザはビデオ再生をサポートしていません。
R2Vプロンプト:ビデオを延長してください。@Video 1のビジュアルと被写体から継続し、キャラクター被写体、シーン、ビジュアルスタイル、サウンドエフェクトを一致させたまま、さらに30秒のクリップを生成してください。小さな男の子がサッカーボールを持って列車車両に沿って走る。地下鉄が止まると、側面のドアが開き、彼はすぐに飛び出す。二人はプラットフォームを横切り、通りに出る。通行人や車両を驚かせながら。男性リードはついに追いつき、彼を捕まえる。男の子は不満そうに見上げる。男性リードの怒りはゆっくりと消え、男の子の頭を撫で、無力な笑顔を見せる。
ビジュアルプレゼンテーションの面では、モデルはカメラの動き間の遷移をよりスムーズに実現します。主要な被写体は複数のカットで安定しており、音声とビジュアルは同期したまま、非常に一貫性のある長尺ビデオを実現します。例えば、京劇のシーンでは、カメラはリード俳優の流れるような袖を追って優雅な円形のパンを実行し、主要な被写体と背景は完全に一貫したままです。袖のスイングは空中に自然な弧を形成し、現実世界の物理法則に厳密に従います。
お使いのブラウザはビデオ再生をサポートしていません。
R2Vプロンプト:16:9ワイドスクリーン、シネマティックテクスチャ、シングル連続テイク、スムーズなカメラワーク、カットなし。シーン参照:@Image 4。0〜5秒:@Image 2のオーバーロードのクローズアップで開く。カメラは彼の胴体をゆっくりと円を描いて動き、ミディアムショットに移行する。オーバーロードは回転して向きを変え、彼の体と背中の旗がレンズの前を素早く通過して自然な遮蔽を形成し、カメラは@Image 1のユイ妃の側まで追従する。6〜10秒:カメラは@Image 1のユイ妃をミディアムショットで安定して円を描き、彼女の水袖を弧に沿って追う。彼女は腕を上げ、手首をひねり、袖を広げ、半回転する。その後、袖を後ろに引き、ポーズを保ち、オーバーロードの方を横目に見る。11〜20秒:@Image 3の男性戦士が宙返りで登場する。オーバーロードが中央に立ち、戦士は反対側で前後に動き、戦闘を繰り広げる。ユイ妃はオーバーロードのやや後ろ、横に立ち、水袖の動きを織り交ぜて強さに対比する柔らかさを設定する。カメラは戦士のミディアムクローズアップショットからステージ全体のビューへとゆっくりと引き戻される。最後に、三人は観客に向き合い、同期した京劇のフィナーレポーズをとる。
さらに、AI生成ビデオでしばしば見られる過度に人工的な外観に対処するため、Seedance 2.5はオブジェクトのテクスチャ、肌や目の特徴、照明、色の彩度などの詳細を体系的に最適化します。また、字幕やBGMの制御不能な発生を最小限に抑え、実写映像のシネマティック品質に非常に近い最終製品を提供します。
マルチモーダル参照の包括的なアップグレードにより、複雑なクリエイティブタスクに対するコントロールが向上します。