HN 日本語サマリー

← 一覧へ戻る
AI・機械学習

Mistral OCR 4

Mistral OCR 4 (mistral.ai)

113 pointsby meetpateltech29 コメント

要約

Mistral OCR 4は、抽出されたテキストに加えてバウンディングボックス、ブロック分類、インラインの信頼度スコアを提供する最新のOCRモデルです。170言語に対応し、単一コンテナで完全にセルフホスト可能であり、エンタープライズ検索やRAGの取り込みコンポーネントとして機能します。独立した評価者によるテストでは、他の主要なOCRシステムを平均72%の勝率で上回り、OlmoCRBenchで85.20のトップスコアを記録するなど、画期的なパフォーマンスを実現しています。

全文翻訳

リサーチ OCR 4を発表 2026年6月23日 Mistral AI Blogに戻る 10分読書 この投稿を共有 クリップボードにコピー済み タイトル サブタイトル テキスト 画像 表 本日、Mistral OCR 4をリリースします。抽出されたテキストに加えて、バウンディングボックス、ブロック分類、インラインの信頼度スコアを特徴としています。このモデルは10の言語グループにわたる170言語をサポートし、完全にセルフホスト型のデプロイメントのために単一コンテナで実行され、エンタープライズ検索、RAG、ドメイン固有の検索パイプラインのための取り込みコンポーネントとして機能します。OCR 4は小型で特化したモデルであり、この投稿では、新機能、公開ベンチマークと内部ベンチマークでのパフォーマンス、それらのベンチマークの既知の制限、およびモデルAPIとDocument AIのどちらを使用すべきかについてのガイダンスを説明します。ハイライト 画期的なパフォーマンス。独立した評価者は、テストされたすべての主要なOCRおよびドキュメントAIシステムよりもOCR 4を好み、平均72%の勝率を記録し、OlmOCRBenchで最高の全体スコア(85.20)を獲得しました。方法論と既知のスコアリング制限については、以下のベンチマークを参照してください。テキストだけでなくセグメンテーションも。抽出されたテキストに加えて、OCR 4はバウンディングボックス、タイプ別ブロック分類(タイトル、表、数式、署名など)、およびインラインの信頼度スコアを返します。最も要望の多かった機能であるバウンディングボックスは、コンテキスト内でのハイライト表示と信頼性の高いデータパイプラインのためにテキストを局所化します。同時に、ブロックタイプと信頼度スコアは、ソースに基づく引用、墨消し、およびヒューマン・イン・ザ・ループ検証を推進します。Mistral Search Toolkitと統合(パブリックプレビュー)。OCR 4は、AI Now Summitで発表されたMistralのオープンソースで構成可能な検索フレームワークであるSearch Toolkitの取り込みコンポーネントです。その構造化された出力は、RAGおよびエンタープライズ検索のためのツールキットの取り込み、検索、および評価ワークフローに引用可能な入力を提供します。多言語対応。10の言語グループにわたる170言語をサポートし、いくつかの競合システムが劣化する稀少言語および低リソース言語で測定可能な改善が見られます。独自のインフラストラクチャで実行。OCR 4は単一コンテナでデプロイできるほどコンパクトで、文書データを自社環境に保持し、レジデンシー、主権、コンプライアンスを確保しつつ、費用対効果の高い高スループットのバッチ処理をサポートします。セルフマネージドデプロイメントはエンタープライズ顧客に利用可能です。\n\n概要 Mistral OCR 4は、広範囲のドキュメントからコンテンツを抽出し、構造化します。以前の世代がページをクリーンなテキストとテーブルに変換することに焦点を当てていたのに対し、OCR 4はドキュメントの構造化された表現を返します。各ブロックはバウンディングボックスで局所化され、タイプ別に分類され、ページごとおよび単語ごとのインライン信頼度スコアが生成されます。したがって、ダウンストリームシステムは、ドキュメントに何が書かれているかだけでなく、各要素がどこに配置され、どのような役割を果たし、モデルが各領域でどれくらい確信しているかにもアクセスできます。この構造は、いくつかのダウンストリームワークロードをサポートします。RAGのためのセマンティックチャンキング:クリーンで分類されたブロックは、より良い検索単位となります。エージェントのための構造的プリミティブ:エージェントはドキュメントを読むことから、それに基づいて行動することに移行します(フォーム入力、請求書処理、コンプライアンスチェック)。コネクタのための構造化コンテンツ:取り込みおよびインデックス作成パイプラインのための一貫した、型付きの出力。OCR 4は、PDF、DOC、PPT、OpenDocumentを含む一般的なエンタープライズ形式を受け入れ、多くのシステムがうまく処理できない稀少言語や低リソース言語を含む、10の言語グループにわたる170言語をサポートします。単一コンテナでデプロイ可能なコンパクトなモデルとして、費用に敏感なデプロイメントと高ボリュームのデプロイメントの両方に適しています。完全にセルフホストで実行できるため、データ主権要件を持つ組織はドキュメントデータを独自のインフラストラクチャ内に保持できます。開発者はAPIを介してモデルを統合し、チームはMistral StudioのDocument AIを使用して、同じエンジンへのアプリケーションレベルのノーコードパスを利用できます。APIを介したMistral OCR 4の価格は1,000ページあたり4ドルで、50%のバッチAPI割引が適用され、1,000ページあたり2ドルに削減されます。Document AIの価格は1,000ページあたり5ドルです。ベンチマーク 「当社の既存プロバイダーと比較して、Mistral OCRは1ページあたり約4倍高速です。これは、速度がお客様のIPタイムライン管理に不可欠な高ボリュームのドケットワークフローにとって印象的な結果です。」 - Aidan Donohue、AIエンジニア、Rogo OCR 4を評価するために、主要なAIネイティブOCRモデル、フロンティア汎用モデル、エンタープライズドキュメントサービス、および独自のMistral OCR 3と比較しました。人間による評価 自動化されたベンチマークには上記のようなスコアリングアーティファクトが含まれるため、実際の使用状況を反映するように選ばれたドキュメントで、人間による直接対決評価を補完しました。12以上の言語にわたる600以上のドキュメントを、実際の業界ユースケースを代表するためにサードパーティベンダーから調達し、独立した評価者に、各競合他社の出力をOCR 4の出力とドキュメントごとに盲目的にランク付けするよう依頼しました。評価者は、テストされたすべてのシステムにおいて、大半のドキュメントでOCR 4を好みました。これらは固定された参照との文字列比較ではなく、実際のドキュメントに対する人間による判断であるため、自動スコアに影響を与える注釈や書式設定のノイズの多くを回避します。全体的なパフォーマンス 「Mistral OCRは、当社の既存プロバイダーと比較して1ページあたり約4倍高速であり、速度がお客様の知的財産タイムラインを管理する上で極めて重要な、大量のドケットワークフローにとって印象的な結果です。」 - Ivan Mihailov、AIエンジニア、Anaqua 人間による評価で1位になったことに加えて、OCR 4は公開のOlmOCRBench(85.20)でテストしたモデルの中で最高の全体スコアを達成し、AIネイティブおよびエンタープライズソリューションの両方を上回る内部のCrawl Multilingual評価(.98)をリードしています。OmniDocBenchでは、OCR 4は93.07のスコアを達成しています。この数値には注意点があります。OlmOCRBenchとOmniDocBenchの両方には、特定の出力をスコアリングする方法に既知の制限があり、単一の集計数値は実際のパフォーマンスを過小評価することも過大評価することもあります。スコアの不一致を監査したところ、ほとんどがモデルエラーではなく、ベンチマークが出力を比較する方法のアーティファクトでした。繰り返し見られるカテゴリは以下の通りです。正解データのエラー。一部の参照注釈自体が間違っています。欠落または余分なテキスト、墨消し領域の転写、または誤字(たとえば、参照では引用された著者の名前が間違ってスペルされているが、モデルはページから正しく読み取っている場合)。出力はソースドキュメントと一致しているのに、間違っているとマークされます。同等の数式表記。同一にレンダリングされる異なるLaTeXは不一致としてカウントされます。レンダリングされた数式は正しいのに、文字列比較はそうではありません。数式セグメンテーション。式が単一の数式として出力されるか、いくつかのインライン断片に分割されるかは、レンダリングされたコンテンツが同一であっても、マッチングがピースを揃えられないため、一致に影響します。複数列の読み取り順序。列境界をまたいで分割された単語(例:「certifi-cates」)や列の順序に関する仮定により、正しい抽出が読み取り順序の失敗としてスコアリングされます。ブロックタイプ属性。ベンチマークはヘッダー/フッターが出力に含まれることを想定していません。これを解決するために、スコアリング前に出力からヘッダー/フッターを削除しています。しかし、テストはページタイトルでもある文字列(本来は存在すべき)をチェックし、誤ってフラグを立てます。これらのアーティファクトは、数学的、科学的、および複数列のドキュメントに集中しており、間違った出力を報奨するよりも、正しい出力にペナルティを与えることの方が多くあります。したがって、集計スコアは決定的なものではなく、方向性を示すものとして扱います。これらの数値を報告するのは、OCR 4の位置を示すためであり、ご自身のドキュメントで評価することをお勧めします。パフォーマンス詳細 Crawl Multilingualの内訳。当社の内部多言語評価では、OCR 4は、英語、西ヨーロッパ、東ヨーロッパ、中東、中国語、東アジア、東南アジア、および稀少言語(ヒンディー語、日本語、グルジア語、ベンガル語、アルメニア語、ヘブライ語)を含むすべての8つの言語グループでリードしています。