HN 日本語サマリー

← 一覧へ戻る
AI・機械学習

Mistral Large 4: 「Le Chonk」

Mistral Large 4: "Le Chonk" (mistral.ai)

296 pointsby j-bu32 コメント

要約

Mistral AIは、1兆パラメータを持つネイティブマルチモーダルモデル「Mistral Large 4」(通称「le Chonk」)のパブリックプレビューを発表しました。このモデルは、コーディング、エージェントワークフロー、マルチモーダル理解において最先端の性能を発揮し、特にサイバーセキュリティや法務などのエンタープライズワークロードでオープンモデルとして最高水準に達しています。欧州のデータセンターでトレーニングされ、オープンウェイトでの提供を目指しており、AIの主権を重視するユーザーにコントロールを提供します。

全文翻訳

Le chonk Mistral Large 4の紹介 ブログに戻る 12分で読めます 2026年10月6日 Mistralより この記事をシェアする URLをクリップボードにコピーしました コピー済み Le Chonk 本日、Mistral Large 4のパブリックプレビューをローンチします。非公式にはML4、公式には: le Chonk。ML4はオープンウェイトのパフォーマンスのフロンティアを押し広げます。Mistral StudioのプレビューAPIを本日よりお試しいただけます。ウェイトは今月末に公開されます。 フロンティアパフォーマンス ML4は、490億のアクティブパラメータを持つ、1兆パラメータのネイティブマルチモーダルモデルです。これは当社のこれまでで最も大きく、最も有能なモデルであり、改良を続けるにつれて急速に性能が向上しています。 このモデルは、コーディング、エージェントワークフロー、マルチモーダル理解において卓越したパフォーマンスを示します。すでに世界で最も強力なオープンソースモデルに匹敵するパフォーマンスを達成しており、米国または欧州で開発されたあらゆるオープンウェイトモデルを大幅に上回っています。サイバーセキュリティ、金融、法律を含む重要なエンタープライズワークロードでは、オープンモデルの中で最先端であると評価しています。視覚的グラウンディングなどの一部のドメインでは、さらに進んでおり、フロンティアのクローズドモデルさえも凌駕しています。 ウェイトは今月末にリリースします。それまで、サイバーセキュリティのリーダー、信頼できるパートナー、および国家当局と協力して、実際の環境でモデルのレッドチーミングを行っています。これらの関係者は、モデレーションを減らし、サイバー能力を拡張した同じモデルにアクセスできます。 コーディング - DeepSWE コーディング - Terminal Bench 4.0 サイバーエージェントの挙動 金融エージェント Harvey's Legal Agent グラウンディング * DeepSWE v1.1、Terminal-Bench 4.0、およびSWE-Atlas-QnAのスコアは、ハーネスの公開ローンチに先立ちArtificial Analysisによってプライベートに評価された数値を使用しており、これらの結果はハーネスのリリース時にArtificial Analysis Coding Agent Indexに含まれる予定です。 ヨーロッパで鍛造。AI主権のために構築。 ML4は、Mistral独自の欧州データセンターにある3,800基のNVIDIA Grace Blackwell GPUでゼロからトレーニングされました。パブリックプレビューは、同じインフラストラクチャ上で提供されます。これは、インフラストラクチャ、研究、製品開発における当社の長期的な投資における重要なマイルストーンです。重要な垂直分野における最先端のパフォーマンスを、オープンウェイトを通じて提供し、顧客にAIのコントロールを与えるように設計されています。 これは特にサイバーセキュリティにおいて重要です。プロバイダーレベルの拒否は、正当な脆弱性研究やインシデント対応を妨げる可能性があり、インシデント中に機能へのアクセスを失うこと自体が重大なセキュリティリスクになる可能性があります。ML4は、トップクラスのサイバーパフォーマンスとオープンウェイト、セルフデプロイメントを組み合わせることで、組織に高度なセキュリティ作業を独自のポリシーの下で実行するための能力と自律性の両方を提供します。 このモデルは、Mistralがエンドツーエンドで運用し、他のデジタルサービスプロバイダーから独立して、欧州の法律の下で運用される欧州のデプロイメントを含む、世界中の複数の地域で利用可能になります。豆知識: ML4のトレーニングデータのかなりの部分は多言語であり、欧州連合のすべての公式言語を含む160以上の言語にまたがっています。当社は、金融、エンジニアリング、製造、物流、製薬、科学、海運、公共部門、その他のミッションクリティカルな産業の世界的リーダー企業と緊密に協力してML4をトレーニングしてきました。実際、このモデルは、Mistral Forgeを通じて顧客に提供するトレーニング、カスタマイズ、RL環境と同じものを使用しています。本日お試しください。 まだ、さらに多くのことが待っています。ウェイトのリリースに向けて、モデルアーキテクチャ、追加のベンチマーク、およびトレーニング後の方法論に関する詳細を共有します。 このモデルは、新しい世代の特殊化され最適化されたMistralモデルの基盤としても機能します。それまでの間、プレビューAPIをお試しいただき、ソーシャルメディアでフィードバックをお寄せください。 機能の詳細 サイバーセキュリティ ML4は、サイバーセキュリティのための世界で最も強力なAIモデルの1つです。実際のソフトウェアのセキュリティ上の欠陥をAIモデルがどれだけうまく見つけ、修正できるかを評価する独立した評価であるArtificial Analysis Cyber Indexにおいて、世界のトップ5モデルにランクインしており、中国以外で開発されたオープンウェイトモデルを大きく引き離しています。インデックスのテストの1つで、モデルにオープンソースソフトウェアの実際の脆弱性を再現させ、それをパッチするように求めるものがありますが、ML4はこのテストで82%のスコアを獲得しており、どのモデルよりも高いスコアです。また、セキュリティコンペティションから抽出された40の演習セットであるCybenchの課題の93%を解決しており、オープンウェイトモデルとしては報告されている最高スコアの1つです。 このトップスコアは、実用的な利点を反映しています。Claude Opus 5.5やGPT-6 Astraを含むいくつかの主要なクローズドモデルは、このタスクの実行を拒否するため、同じテストでほぼゼロのスコアになります。しかし、ソフトウェアの防御は、欠陥が現実であることを証明することから始まることが多く、クローズドモデルのセーフティフィルターがブロックする可能性のある作業です。これは、脅威アクターが攻撃的なサイバー活動をサポートするために、これらのモデルをますますジェイルブレイクしているため、さらに重要になります。防御者は、同じ拒否によって制約されることなく、それらの能力に匹敵するシステムを必要としています。ML4はその作業を行うことができ、その能力は明示的にトレーニングされた範囲を超えています。内部テストでは、マルウェアの分析、脆弱性の優先順位付け、検出ルールの作成に役立つことが証明されました。セキュリティ運用に主権があり、監査可能なAIを必要とする組織にとって、プライベートクラウドまたはオンプレミスで実行できるようになります。 ML4対フィールド: 多様な複雑な課題に対する効率的な推論 マルウェアのリバースエンジニアリング: 分布外の調査タスクを解決する AA Cyber Index CyberGym-E2E Cybench エージェントコーディング ML4は、ソフトウェアエンジニアリング、リポジトリの理解、および複雑なターミナルワークフロー全体で優れており、DeepSWE v1.1で61.7%、SWE-Atlas-QnAで59.4%、Terminal-Bench 4で28.3%のスコアを獲得しています。その統合されたCoding Agent Indexスコア49.8%は、DeepSeek V4 Pro 0813およびQwen3.8 Maxを上回っています。 DeepSWE 1.1 Terminal Bench 4.0 SWE Atlas QnA * DeepSWE v1.1、Terminal-Bench 4.0、およびSWE-Atlas-QnAのスコアは、ハーネスの公開ローンチに先立ちArtificial Analysisによってプライベートに評価された数値を使用しており、これらの結果はハーネスのリリース時にArtificial Analysis Coding Agent Indexに含まれる予定です。 また、Surge AIとのブラインドヒューマン評価を実施し、コーディング品質を評価しました。プロの注釈者がモデルの出力を1〜5のスケールで評価し、モデルのIDは非公開でした。ML4 Previewは5モデル中2位(3.74)で、Kimi K3(3.59)、GLM-5.3(3.60)、GLM-5.2(3.40)を上回り、Claude Opus 5(4.22)に次ぐ結果でした。 エージェントワークフロー ML4は、情報を収集し、ツールを使用し、複雑なワークフロー全体で完了した成果物を生成する汎用エージェントを実行します。Gmail、Google Sheets、Slack、Salesforceなどのアプリにわたる657のビジネスワークフローであるAutomationBenchでは、Kimi K3、MiMo-V2.6-Pro、DeepSeek V4 Proを上回る59.9%のスコアを獲得しています。 知識労働が実際に生み出すプロフェッショナルな成果物であるスプレッドシート、スライド、PDFでも同様に強力です。長期間の知識作業を評価するAA-Briefcaseでは、DeepSeek V4 Proを上回る1,393 Eloに達しています。 マルチモーダル ML4は、当社のモデルの画像を理解する能力における段階的な進歩です。複雑なドキュメント、チャート、自然画像を強力に推論し、エンジニアリング、製造、地球観測などの知覚が重要な産業にビジョンをもたらします。 このモデルは、視覚的グラウンディングとエージェント機能をさらに組み合わせることができます。例えば、ギガピクセル衛星画像を検査して、時間的制約のある災害対応チームを支援したり、エンジニアリング図面を分析して、ズームイン、検査、正確な答えが得られるまで検証したりできます。上記のデモでは、ML4は高密度な自然シーンをグラウンディングし、技術図面内の機械部品を検証し、PDFから証拠を取得し、最も見つけにくいオブジェクトのために巨大な地理空間画像をスキャンします。 特に視覚的グラウンディングにおいて、ML4はテストした中で最も有能なモデルの1つであり、例えばDense 200でGPT-6-Astraを上回っています(42%対41%)。 Dense 200 ChartQA Pro GDP.pdf 科学と数学 ML4は強力な科学的能力をもたらします