AI・機械学習
AppleによるLensVLM-9B
LensVLM-9B by Apple (huggingface.co)
要約
Appleは、LensVLMという新しいフレームワークを発表しました。これは、圧縮された画像内のテキストを、関連部分を選択的に展開する学習済みツールを用いて処理することで、Vision-Language Model (VLM) の精度を維持する技術です。この手法により、高い圧縮率でも精度を損なわずに、従来の圧縮手法を大幅に上回る性能を発揮します。
全文翻訳
LensVLM: 圧縮された画像表現のための選択的コンテキスト拡張
Vision-Language Model (VLM) は、テキストをレンダリングされた画像として処理できるというエキサイティングな可能性を提供し、長いトークンシーケンスへのトークン化の必要性を回避します。VLMの画像エンコーダーは固定サイズの画像を固定数のビジュアルトークンにマッピングするため、レンダリング解像度の変更はきめ細かな圧縮ノブとして機能します。しかし、圧縮が増加するにつれて精度は急速に低下します。文字はビジョンエンコーダーの効果的な解像度を下回り、識別不能になります。
これに対処するため、私たちはLensVLMを提案します。これは、VLMが圧縮された画像をスキャンし、学習済みのツールを介して関連する画像のみを選択的に非圧縮形式に展開することを可能にする推論フレームワークおよびポストトレーニングレシピです。Qwen3.5-9B-Baseを基盤とするLensVLMは、4.3倍の効果的な圧縮率でフルテキストの上限に匹敵する精度を維持し、7つのテキストQAベンチマーク全体で最大10.1倍の効果的な圧縮率において、検索ベース、テキストおよびビジュアル圧縮ベースラインを上回ります。
LensVLMは、マルチモーダルドキュメントおよびコード理解タスクにも一般化し、圧縮が増加するにつれてベースラインに対する精度の向上も大きくなります。私たちの分析はこのアプローチを検証しています。トレーニングにより、ビジュアル圧縮はレンダリングの選択に対してロバストになり、圧縮が増加するにつれてモデルは信頼性の低いビジュアルリーディングではなく、展開されたコンテンツにますます依存するようになります。分析からは実用的なツール選択のガイダンスも得られます。レンダリングされたテキストにはテキスト展開が好ましく、一方、ネイティブドキュメントには高解像度画像展開が適しており、そのレイアウトキューはタスク関連情報を含んでいます。