AI・機械学習
9Bオープンモデルの500ドルでのRLファインチューニングが、カタログレビューでフロンティアモデルを上回る
A $500 RL fine-tune of a 9B open model beat frontier models on catalog review (fermisense.com)
要約
90億パラメータのオープンソースモデルを、わずか500ドルで強化学習(RL)を用いてファインチューニングしたところ、カタログレビューのタスクにおいて、最先端の商用モデルを大幅に上回る性能とコスト効率を達成しました。このアプローチは、企業が独自のデータとプロセスを活用してAIのROIを最大化するための鍵となります。
全文翻訳
コスト対品質:カタログ整合性
この記事は、一枚の写真で表されます。同じカタログレビューワークフロー、同じツール、画像、スコアラーを使用した場合、9Bオープンソースモデル(ピンク)のGRPOファインチューニングは、テストしたすべてのフロンティア構成を、1,000件あたり0.50ドルで上回ります。これは、最も安価なフロンティア設定の40倍、最も高価な設定の約340倍安価です。
パートI
誰もが同じ質問をした
2022年にChatGPTがローンチされて以来、ビジネスリーダーは同じ質問をしています。「AIは何をしてくれるのか?」
その答えは、低リスクのタスクから始まりました。文書の要約、メールのドラフト作成、人間が編集する最初のドラフトの生成です。
それはすぐに、ソフトウェア開発やコンテンツ生成のような、より高価値の認知作業へと移行し、AI企業脳、内部知識、データ、ツールに接続されたシステムを構築する試みのような、より野心的なプロジェクトへと成長しました。これは、作業を調整し、最終的にはビジネスの一部を自律的に運用できるシステムです。
AI導入には多くの時間、エネルギー、トークンが投資されてきましたが、測定可能な成果はほとんど規模で達成されていません。
しかし、一部の企業はAIファーストであることを受け入れ、生産性、収益、コストで巨大な利益を上げましたが、他の企業は遅れをとったり、高いROIを達成するために組織を十分に変化させられませんでした。
企業経費管理プラットフォームRampからの最近のデータは、パフォーマンスの著しいコントラストを示しています。AIに投資している企業のトップ四分位は、2022年11月から2025年12月の間に収益が2倍以上に増加しましたが、AI支出ゼロの企業はわずか15%の増加しか経験しませんでした。
AI採用のトップ企業は、業界全体でアウトパフォームしています
AI支出のトップ四分位の企業
AI支出ゼロの企業
同じ3年間、同じ経済状況:Rampの顧客ベース全体でのデータでは、最もAIを採用している企業は収益を2倍以上にしましたが、AIに何も費やしていない企業は約15%成長しました(インデックス表示、2022年11月=100;報告された終点から描画された曲線)。
この記事の残りは、AIを多用するグループが実際に行ったことについてです。
AIが一部の企業にとって驚異的な成果を上げた一方で、他の企業が投資収益を見るのに苦労した理由はたくさんありますが、研究は主に5つの方向に示唆しています。
01 タスクだけでなくプロセスを再設計する
AIファーストであることは、人を中心に構築されたワークフローにモデルを投入するのではなく、作業の構造を再考することを意味します。何が承認され、誰が何をレビューし、どの引き継ぎにまだ人間が必要かです。
プロセスが変更されない場合、レガシーのボトルネックが損益計算書に到達する前に生産性の向上を吸収します。
McKinseyの2025年のジェネレーティブAIを使用している組織の調査では、ワークフローの再設計がEBITインパクトと最も相関の高い属性であり、それらのわずか21%がワークフローを再設計していました。
02 実験を奨励する
モデル、ツール、ベストプラクティスは毎週変化するため、昨四半期のセットアップが正しいことはめったにありません。
これは、人々が物事を試して失敗したことを報告することで報酬を得られる場合にのみ拾われます。出荷することだけではありません。
技術チームは自然な出発点です。なぜなら、彼らは機能全体で同じ問題が繰り返されるのを見ており、モデルが実際に引き継げる問題を特定できるからです。
03 テーラードされたビジネスコンテキストを提供する
プロンプトエンジニアリングと検索は、呼び出し時にビジネスコンテキストを注入できますが、それをうまく行うことは独自のエンジニアリングプログラムです。データへのアクセス、各リクエストが見ることができるものへのアクセス制御の実施、適切な証拠を提示する検索の構築、そしてモデルが成長するにつれて不均一に使用するコンテキストウィンドウの管理です。
04 使用状況とインパクトを測定する
すべてのAI項目は最終的にCFOの質問に直面します。「何が変わったのか、そしてそれは価値があったのか?」
ほとんどのデプロイメントでは、誰も答えることができません。モデルのパフォーマンス、意思決定コスト、効率への影響を追跡するインフラストラクチャがなく、自己申告の時間節約はしばしば不正確です。
独自のデータでのスコアリングされた評価なしでは、「雰囲気評価」が主張できる上限であり、擁護するためのハードバジェットです。
05 AI予算内で明確なビジネス目標を設定する
AIは、ほとんどの企業が慣れていない価格モデルをもたらしました。
シートあたりではなくトークンあたりの支払いにより、コストは使用量に応じてスケーリングするため、コスト計画を立てたり、内部ワークロードの資本効率の向上を推定したりすることが困難になります。
Uberは年間エンジニアリング予算を4か月で使い果たし、Microsoftはコストを管理下に置くためにClaudeライセンスのほとんどをキャンセルしました。
今日の価格は問題を過小評価しています。なぜなら、ほとんどのAIラボは市場シェアを獲得するためにトークンコストを補助しており、フロンティアモデルの価格は上昇すると予想されるからです。
この記事では、勝利グループが収束しているデプロイメント技術の詳細な概要を提供します。強化学習によるオープンソースモデルのファインチューニングです。
これは上記の最後の3つの課題にどのように対処するか、そしてあなたの組織だけが持つ知識(すなわちデータ、ツール、プロセス)を、ベンダーAPIでは達成できないモデルに、わずかなコストでどのように変えるかについて説明します。
TL;DR
2.2倍収益成長。Rampのデータによると、2022年11月から2025年12月の間にAI支出のトップ四分位の企業は収益が2倍以上に増加しました。同じ経済状況下で、同じ3年間でAI支出ゼロの企業は約15%成長しました。AIを多用する企業は8倍多く成長しました。
1勝者が収束するプレイブック:オープンソースモデル、独自のタスクデータ、そしてワークフローのスコアリングされたコピーに対する強化学習。
Bridgewaterのトレーニング済みモデルは、最高のフロンティアモデルよりも約30%少ない間違いを犯します。Harveyの法律エージェントは、独自のルーブリックでGPT-5.5とClaude Opus 4.8を上回り、IntercomのFin Apexは、より低いコストでより多くのサポート問題を解決します。
87.3%最大達成可能スコアの割合。当社のGRPOトレーニング済み9Bオープンソースモデルは、カタログレビューで87.3%を達成しました。一方、最高のフロンティア構成は76.9%でした。これは、フロンティアに対する相対的な改善が13.5%、トレーニングされていないベースライン(64.2%)に対する相対的な改善が36%です。
5つのフロンティアモデルは、最適化されたプロンプトを使用しても、互いに0.1ポイント以内にプラトーに達しました。トレーニングされたスペシャリストは、その天井をクリアしました。
68倍レビュー済みリストあたりのコスト優位性:スペシャリストでは1,000件あたり0.50ドル、最強のフロンティアモデルでは34ドル、それでも最も安価なフロンティアオプションより40倍安価です。
1日あたり約4000万回の決定で、これは約700万ドル/年ではなく5億ドル/年となり、98%のコスト削減になります。
パートII
勝者が異なること
AIレースをリードしているほとんどの企業は、同じ発見をしました。独自のインテリジェンスを所有することが、パフォーマンスとコストの両方で勝利します。
特定の環境で特定のワークフローを完了するようにトレーニングされたモデルは、会社の内部を見たことのない汎用モデルよりも優れたパフォーマンスを発揮する可能性が非常に高いです。
さらに、特定の環境で動作するように設計されたモデルに、それほど多くの汎用機能を詰め込む必要がないため、実行コストが桁違いに安い、より小さなモデルで済むことがよくあります。
独自のインテリジェンスを所有することは、ChatGPTまたはClaudeサブスクリプションをキャンセルすることを意味しません。
ほとんどのワークフロー自動化は、依然としてフロンティアモデルから始まります。そして、それは正しい最初のステップです。それは、技術的に何が可能かのベースラインを確立し、すべての呼び出しは、スペシャリストモデルが後でトレーニングするデータ(入力、決定、修正)を生成します。
自動化がプロトタイピング段階を離れたら、優先順位はコストとパフォーマンスのボリュームに移ります。そして、そこで強化学習によるオープンソースモデルのファインチューニングが登場します。
それに加えて、あなたのFable 5またはChatGPTモデルは、あなたの内部知識を必要とするワークフローの部分を処理するためにスペシャリストモデルを呼び出すことができ、スペシャリストモデルは、高い汎用性を必要とするタスクのためにフロンティアモデルを呼び出すことができます。
モデルがあなたの環境で動作する方法を学習する
モデルはあなたのツールとデータと対話し、ルーブリックが結果をスコアリングし、報酬信号がモデルを更新します。
何万ものタスクで繰り返されることで、ワークフローの判断は重みに落ち着きます。一方、変化する事実(価格、在庫、ポリシーテキスト)は、それらが属するツールに残ります。