HN 日本語サマリー

← 一覧へ戻る
AI・機械学習

Krea 2 技術レポート

Krea 2 Technical Report (krea.ai)

18 pointsby mattnewton2 コメント

要約

この記事は、幅広い美的多様性とユーザーの創造的制御に焦点を当てた基盤モデルシリーズであるKrea 2を紹介しています。モデルのアーキテクチャ、多段階のトレーニングパイプライン、データキュレーションの原則、および分散インフラストラクチャを詳細に説明しています。Krea 2は、プロンプトエキスパンダーとスタイルリファレンスシステムを通じて、探索的な生成体験を可能にしながら、競争力のあるパフォーマンスを実現しています。

全文翻訳

リサーチ Krea 2 技術レポート この技術レポートでは、幅広い美的多様性とユーザーの創造的制御の両方のために設計された基盤モデルのシリーズであるKrea 2を紹介します。私たちは以下を提示します。(1) データキュレーションの原則。(2) モデルアーキテクチャ。(3) 多段階のトレーニングパイプライン。(4) 分散インフラストラクチャ。(5) 将来の作業。Sangwu Lee, Erwann Millon, Le Zhuo, Matthew Newton, Andrei Filatov, Abhinay Devarinti, Elea Zhong, Avram Djordjevic, Gabriel Menezes, Will Beddow, Titus Ebbecke, Mihai Petrescu, Owen Fahey, Gian Saß, Felix Gil, Victor Perez · 2026年6月23日 · 58分読破 リリースページ 公式ウェブサイト Hugging Face ウェイトとライセンス GitHub コードとライセンス モデルのウェイトと推論は、寛容なライセンスの下でリリースされています。はじめに 過去数年間、画像生成は目覚ましい進歩を遂げました。拡散モデル(Diffusion models)とフローマッチングモデル(flow-matching models)は、高解像度の画像を生成し、鮮明なフォトリアリズムと安定した構造を生み出し、高密度なテキストをレンダリングし、広範な世界知識をエンコードし、ユーザーのプロンプトに正確な詳細で従うことができます。これらの改善は、スケーラブルなトランスフォーマーアーキテクチャ、改良されたキャプショニングとテキストエンコーダー、より良い潜在表現、およびパイプライン化された後処理技術を含むいくつかの相互作用する要因によって推進されてきました。しかし、この分野がこれらの能力の信頼性を最適化するにつれて、多くのシステムは狭いデフォルトの美学に収束してしまいました。これらは効果的な制作ツールではあるものの、ユーザーが単一の洗練されたデフォルトを受け取るのではなく、スタイル、ムード、構図、視覚的方向性を探索する必要がある創造的な探求のエンジンとしては効果が低下します。これらの制限に対処するために、私たちは創造的な探求に焦点を当てた基盤モデルのシリーズであるKrea 2を発表します。Krea 2のモデルは、画像生成が探索的なメディアであるべきだという信念に基づいて構築されています。それは、多くの美学にまたがるのに十分な表現力を持ち、クリエイターがそれらをナビゲートするのに十分な制御性を持つべきです。私たちは、広範な世界知識とスタイルカバレッジを持つ包括的な事前学習データセットをキュレーションするために、大規模なデータインフラストラクチャと分散トレーニングフレームワークを一から構築しました。このインフラストラクチャを使用して、私たちは事前学習、中間学習、教師ありファインチューニング(SFT)、選好最適化(preference optimization)、強化学習(RL)にわたる多段階パイプラインを通じて表現力豊かなモデルを訓練します。各段階は、モデルの出力分布を段階的に洗練するように設計されています。私たちは、徹底的なアブレーションを通じて、シンプルでありながら高性能な拡散トランスフォーマー(DiT)アーキテクチャを開発しました。私たちのモデルは、iREPA、改良されたVAE、Qwen3-VLを含む、収束を加速するいくつかのコンポーネントを組み込んでいます。また、グループ化クエリアテンション(GQA)、シグモイドゲート付きアテンション、軽量タイムステップ変調、およびテキストエンコーダー特徴のための多層特徴集約など、いくつかのアーキテクチャ上の改善も統合しており、これらが訓練の安定性と効率を向上させます。強力なベースモデルは、ユーザーがその分布の関心のある部分に確実に到達できる場合にのみ有用です。訓練において、モデルは高密度の視覚的詳細で画像を記述する豊富で慎重に構築されたキャプションから学習します。しかし、実際には、ユーザー入力はより短く、より曖昧で、多くの異なる表現習慣によって形作られます。一部のユーザーは自然言語でシーンを記述し、他のユーザーはムード、スタイル、または参照画像を指し示します。これにより、モデルが学習した条件付け空間と、推論時に創造的な意図が表現される方法との間にギャップが生じます。このギャップを縮めるために、私たちはKrea 2をテキスト入力と画像入力の両方からより探索的で操縦可能にする2つのシステムを構築しました。プロンプトエキスパンダー(prompt expander)とスタイルリファレンスシステム(style-reference system)です。プロンプトエキスパンダーは、ユーザーの意図を上書きすることなく、シンプルまたは詳細が不足したユーザープロンプトをより豊かな視覚的方向性にマッピングします。これは、オープンソースのLLMの上に2段階のSFTとRLパイプラインを通じて訓練され、目的は画像品質を向上させるだけでなく、創造的なバリエーションと制御可能な探索を促進することです。このテキストインターフェースを補完するのがスタイルリファレンスシステムです。これは、言葉だけでは不十分な場合に、ユーザーが画像を通じて視覚的意図を表現できるようにします。これにより、最小限のコンテンツ漏洩で1つ以上の参照画像のスタイルやムードを注入でき、スタイル強度と重み付けされたスタイルミキシングを細かく制御できます。これらのコンポーネントが組み合わさることで、Krea 2は探索的生成のための基盤モデルとして定義されます。Krea 2は、単一の洗練されたデフォルトのみを最適化するのではなく、幅広い視覚空間を露出し、テキストと画像ベースのコントロールの両方を使用してユーザーがその中を移動するための実践的な方法を提供するように設計されています。Krea 2は、テキストから画像への生成における「Artificial Analysis」リーダーボードでトップ10モデルに入っており、独立系ラボのモデルの中で2位にランクされています。Krea 2は包括的なベースラインとして機能し、競争力のあるパフォーマンスを維持しながら、創造的な生成体験を可能にします。データ データキュレーションの原則 データパイプラインを詳しく説明する前に、私たちの目的に合った優れたデータミックスが何であるかを確立することが重要です。優れたミックスは、「高品質」の画像のみで構成されるわけではありません。表現力豊かで、様式的に多様なモデルを構築するという私たちの目的を考慮すると、多様性と広範なドメインカバレッジは不可欠です。私たちは、美的スコア(aesthetic-score)と画像品質評価(IQA)モデルを使用する従来のモデルベースのフィルタリングは、暗黙のバイアスを導入すると主張します。たとえば、そのような方法は、モーションブラーや柔らかさが意図的な芸術的選択である場合でも、ぼやけた画像を低品質と分類する可能性があります。さらに、私たちは、キャプションがその画像を正確に記述している限り、望ましくない画像であっても下流のユースケースで役立つ可能性があると主張します。なぜなら、モデルが望ましくない挙動を正確に理解するため、そのようなサンプルは後で生成をその分布から遠ざけるために使用できるからです。これらの理由から、私たちは以下のものだけをフィルタリングして事前学習データセットを構築します。重複したサンプルと過剰に表現された概念。VLMが画像における重要な側面を捉えることに一貫して失敗するサンプル。望ましくないバイアスやアーティファクトを誘発するサンプル。低解像度で確実にモデル化するには難しすぎる高い視覚的複雑性を持つサンプル。AI生成サンプル これらの条件は、テキストから画像へのアラインメントの悪さやアーティファクトを避けながら、広範なカバレッジを持つ事前学習データセットを形成します。重要なことに、私たちは事前学習ミックスにAI生成画像を一切使用していません。合成データと蒸留は、モデルの能力を獲得するための効果的な近道となり得ます。しかし、ごく一部のAI生成画像でもモデルの出力分布にバイアスを導入することを発見しました。合成画像は学習が容易である傾向があり、これはモデルの品質に実質的な上限を課すことになります。したがって、私たちはそのような画像をフィルタリングするために社内分類器を設計しました。キャプショニング 私たちはキャプションを生成するために多段階アプローチを採用しています。まず、各ターゲット画像に対してOCRモデルを実行し、目に見えるテキストを抽出します。第2段階では、OCR結果と利用可能なメタデータ(カメラ設定、既知のエンティティなど)の両方をキャプションモデルに提供し、これにより抽出されたテキストとともに世界知識を組み込んだ豊かなキャプションが生成されます。一般的なキャプショニングパイプライン 文脈が豊富で長文の自然言語キャプションが一度取得されると、より安価なLLMを使用して、さまざまな長さと形式に再フォーマットし、モデルを多様なプロンプトスタイルに露出させます。経験的に、長いプロンプトで訓練すると、密な教師信号が提供され、より速い収束と低い訓練損失が得られることがわかりました。しかし、多くの下流および応用ユースケースでは、短文および中程度の長さのプロンプトでのパフォーマンスが依然として重要です。したがって、私たちは主に長いキャプションで訓練しつつ、訓練全体を通じてモデルが短文および中程度の長さのプロンプトに露出するようにしています。私たちの全体的な訓練パイプラインとデータステージ 事前学習データ 事前学習データは、256px、512px、1024pxの解像度ステージにわたります。解像度を段階的にスケールアップすることでカリキュラムが形成されます。