AI・機械学習
AIアニメはどのように作成されるか
How an AI Anime Is Created (aventos.dev)
要約
この記事は、AIを活用してアニメーション制作プロセスを効率化する方法について説明しています。ストーリーの適応、ディレクション、アニメーション&FX、ポストプロダクションの4つの段階に分け、特にAIがアニメーション生成を担う一方で、ストーリーテリングや最終的な品質向上は人間が行うことを強調しています。これにより、制作コストを抑えつつ、アーティストへのより良い報酬と、アメリカ国内でのアニメ産業の発展を目指しています。
全文翻訳
01 01 / 04 適応
ヒューマン・ストーリー・ライティング&アダプテーション
適応作業は困難ですが、それだけの価値があります。読者がスクロールし続けた一つの要因を見つけ出し、それを中心にタイトな20分間のエピソードを構築します。それ以外の要素はすべてカットします。私たちはLLMをライティングには一切使用しません。試したときはいつも、ひどいライティングになります。
主なツール: ライターズルーム、AIなし
Gen Z・Gen Alphaの視聴者を対象に構築
02 02 / 04 ディレクション
ヒューマン・ディレクション
すべてのショットを絵画のように
ビートシートは、各シーンのアクション、ショットアングル、ペースを固定します。その後、安価なモデルを使用して、コミットする前にペースと感情が伝わるかどうかを確認するためだけの、速くてラフなクリップを生成します。
主なツール: ビートシート・安価なドラフト生成
手動で決定:
キャラクターの外見・ショットのペース
03 03 / 04 アニメーション&FX
AIアニメーション&FX
ここで実際のアニメが撮影されます。キャラクターと環境の参照を使用して、一貫性を保ちながら、各ショットが高品質で再生成されます。難しい部分はすでにディレクションで完了しているため、エージェントが以前のプロンプトを再実行し、私たちはドラフトを逃したショットをやり直すためにのみ介入します。
主なツール: キャラクター参照・環境参照
ステージタイプ: AI生成
04 04 / 04 ポストプロダクション
ヒューマン・ポストプロダクション
生成されたものが生成されたように見えなくなる場所。映像はフレームごとにアップスケールされ、クリーンアップされ、AIがまだ間違っている部分を修正します。その後、ダイアログ、音楽、サウンドエフェクトが最終的なミックスにまとめられ、字幕が付けられ、出荷前にチェックされます。
主なツール: Topaz・DaVinci・Reaper
人間の手による作業:
キュレーション・コンポジット・グレーディング・ミックス
アニメにとって最も重要なのはストーリーです。ストーリーが悪ければ、ショーも悪い。それだけです。
なぜ私たちはこれを行うのか
なぜ本物のアニメーターを雇わないのか?なぜ何も手を抜くのか?根本的な理由: エンターテイメントは財政的に制約されており、それがクリエイティブな決定を形作ります。ハリウッドの業績が悪化すると、より多くのレイオフと、私たちの見解ではより一般的なショーを目にします。私たちの賭けは、アニメを財政的に実行可能にできれば、2つのことを達成できるということです。1つ目は、ここアメリカのファンが実際にアニメを作れるようになることです。日本に飛んで、日本語を話し、できれば日本人である必要がなくなることです。2つ目は、従業員(アーティスト)により良く支払うことです。日本の制作委員会システムとそれがアーティストをどのように扱っているかについて、詳細を知りたい場合は調べてみてください。しかし、要するに、アニメスタジオは破産しており、システムはすぐに変わることはなく、独立した請負業者を非常に安い賃金で働かせることになります。AIスタジオは業界の多くの問題を解決すると考えています。より小さく、より速いということは、より財政的に実行可能であることを意味するため、アーティストにより良い賃金を支払い、アメリカで新しい産業を繁栄させることができます。
1. ストーリーライティングと適応
物語を選択したり、自分で書いたりするときは、常に消費者のことを考えなければなりません。通常、それは標準的なアニメウォッチャー、典型的にはGen ZまたはGen Alphaを対象とし、高校や試験のような普遍的な経験を中心に書くことを意味します。私たちが書くほとんどの物語は、若い視聴者、男性寄り(私たちは男たちなので)を対象としており、私たちが若い頃に経験した同様の問題や苦闘を追っています。韓国のコミックのような既存の物語がある場合、それをアニメにどのように適応させるかを考えなければなりません。私たちにとって、これはかなりのプリプロダクション作業です。なぜなら、物語には非常に多くのコンテンツと詳細があり、それを20分間のエピソードに落とし込む必要があるからです。そうでなければ、ペースが遅くなりすぎて、面白いシーン(戦闘シーン、初キスなど)にたどり着けなくなります。プロンプトを入力したり、ショットについて考え始めたりする前に、誰かがソース全体を最初から最後まで、少なくとも1シーズンに相当するものを読みます。私たちは、読者が午前2時にスクロールし続けた一つの要因を探しています。なぜ彼らはこの物語を気に入ったのか?良いビジュアル?良いライティング?良いキャラクター関係?それが何であれ、それが適応が構築される「肉」となります。サブプロット、サイドキャラクター、遅いアークなど、他のすべてはそれに対してテストされます:このシーンは肉に役立つのか、それともオリジナルにあったからそこにあるだけなのか?後者であれば、そのコンテンツをカットします。少ない方が多いのです。ペースと密度を変える必要もよくあります。コミックを読んだりスクロールしたりするときは、自分のペースで進みます。アニメーションというメディアの性質上、私たちは皆に私たちが決めたペースで進むことを強制するため、必然的にストーリーが遅すぎると感じる人もいれば、速すぎると感じる人もいます。そのため、私たちはコアストーリーを保護しようとします。それはサイドキャラクターをカットしたり、サブプロットを完全にスキップしたりすることを意味するかもしれません。適応作業では、それは避けられない部分です。予算ではすべてのサイドストーリーを探求することはできません。
ここでLLMをどのように使用するか
使用しません。それは本当に、本当にひどいです。超平凡で、超ジェネリックです。スロップ(スラッジ)でさえなく、むしろ悪いハリウッドライティングとChatGPT 3を組み合わせたようなものです。
私たちのミュージックビデオのアニメーションのビートシートのスクリーンショット。Googleドキュメントには勝てません。
2. 初稿
ストーリーに満足したら、「ビートシート」と呼ぶものを作成します。これは別のスクリプトですが、より広範なストーリーではなく、アクションとショットを詳細に記述します。ビートシートと呼ぶのは技術的には間違いですが、ストーリーの「ビート」を名前付けしているため、定着しました。ビートシートの後、初稿を作成します。キャラクターの外見を決め、安価なモデルを使用して、アニメーションのペースを確認するためだけの、速くてラフなクリップを生成します。アニメーション自体を初稿として作成することで、各シーンのアクションと感触を素早く反復処理できます。合っていますか?感情は伝わりますか?キャラクターがこれを行うのは理にかなっていますか?そして、それはエピソードのビジュアルとスタイリングを取得することを可能にします。それはどのように見えますか?照明でどのようなムードを呼び起こしたいですか?初稿はシンプルで、クリップを配置し、クリップをカットし、クリップを拡張してシーンの雰囲気に合わせます。
3. アニメーション
AIアニメーション
初稿に満足したら、各ショットを取り出し、720pの品質で再生成します。アニメーションでは、キャラクター参照、環境参照、ビデオの拡張など、さまざまなプロンプト技術を使用して、同じキャラクターと環境の一貫性を実現します。難しい部分、つまりドラフトを正しく取得することはすでに完了しているため、これは最も時間のかからない段階になります。私たちは文字通りエージェントに以前のすべてのプロンプトを再実行させ、私たちは時折ドラフトに従わなかったショットを再実行するためにチェックインするだけです。
4. ポストプロダクション
生の生成物はアップスケールされ、クリーンアップされます。
アップスケーリングとは、解像度を向上させることです。720pで生成しますが、ほとんどのプラットフォームは1080pを期待するため、DaVinci ResolveまたはTopaz Labs(現在はAdobeの一部)を使用して解像度を上げます。クリーンアップは、AIアニメーションスタジオが特に処理する必要のある新しいタスクです。AI生成クリップをほぼ一時停止すると、何かおかしな点が見つかるでしょう:色が奇妙に変化する、照明が一貫しない、口が完全に意味をなさないように動く。それを修正するのが私たちの仕事で、ほとんどはPhotoshop/フォトエディタを開いてこれらのAIアーティファクトを修正することで行われます。(ポストプロダクションで詳細に説明するSFXやボイスなど)まだ処理する必要があるものがいくつかあります。
最終ドラフトはビデオエディタでは恐ろしく見えますが、単なるオーディオトラックといくつかの追加のビデオトラックです。信じてください、見た目よりは簡単です。
ボイス
ダイアログは、現在ロックされているビジュアルに対して記録/プロンプトされ、テストされます。キャラクター、予算、タイムラインに応じて、人間の声優がセッションで録音するか、AIボイスがパフォーマンスを生成します。どちらの場合も、感情的に正しく感じられる必要があります。同じキャラクターの2つの笑い声は、2回同じように聞こえるべきではなく、それぞれがその下の感情を運ばなければなりません。
音楽
AI生成音楽を使用します。私たちはミュージシャンではなく、オリジナルの良い音楽を作るのは膨大な作業です。ライセンスされた良い音楽を入手することもできますが、せいぜい10〜15秒しか再生されないものに手間をかける価値はありません。ほとんどのアニメでは、音楽は特定の感情を呼び起こすために短いセグメントで表示され、オープニングとエンディングソング以外では、ほとんどのファンはそれにほとんど注意を払わないため、現時点では私たちにとって投資する価値はありません。将来的には、