HN 日本語サマリー

← 一覧へ戻る
AI・機械学習

Clef: オープンウェイトの決定モデルと新しいRLファインチューニングプラットフォーム

Clef: Open-weight decision models, and new RL fine-tuning platform (blog.cloudflare.com)

622 pointsby jasondavies215 コメント

要約

Cloudflareは、決定モデル「Clef」と「Clef-flash」をWorkers AI上で公開しました。これらは、Jev Decision Indexでトップクラスの性能を示し、高速かつ低コストで構造化された出力を生成します。画像入力にも対応し、64kのコンテキストウィンドウを持ちます。Apache 2.0ライセンスでオープンソース化され、ローカルでの実行や、新しいRLプラットフォームによるファインチューニングが可能です。

全文翻訳

ここ数週間、Typesafe AIのJev System Oneモデルのような決定モデルに関する多くの話題がありました。分類モデルは以前から存在していましたが、JevはAIの世界に新しい決定モデルの概念を導入しました。これは、決定が必要な場合にワークフローに追加できる、安価で高速かつ一貫性のある、境界付けられた構造化出力を生成するモデルです。これらのモデルは、新しい分類カテゴリを取り込むためにモデルを常に再トレーニングすることなく、あらゆる入力セットで機能する能力を持っています。これは、主に非決定的ですが、エージェントワークロードのためのテキスト生成やツール呼び出しを推論するのに十分なオープンエンドである大規模言語モデル(LLM)の世界とは対照的です。本日、Cloudflareがトレーニングした2つの決定モデル、ClefとClef-flashをWorkers AI上で公開します。Clefは現在、Jev Decision Indexに対して評価された結果でリーダーであり、ライブベンチマークデモサイトで完全な結果を確認できます。これらのモデルはよりスマートで、より高速であり、Jev-APIと完全に互換性があるため、これらのホスト済みモデルを簡単に試すことができます。私たちはこれらのモデルをHugging Face上でApache 2.0ライセンスの下で完全にオープンソース化し、ローカルで実行してご自身で試せるようにします。最後に、お客様がClefをユースケースに合わせてファインチューニングできる新しい強化学習(RL)製品を発表できることを嬉しく思います。 決定モデルとは何か? 決定モデルは、エージェントが確率に基づいてどのように行動するかを決定するのに役立つ分類を行います。例えば、カスタマーサポートのメッセージ(入力)を渡し、それが緊急かどうか、どのチームが処理すべきかを尋ねることができます。決定モデルは、確率(出力)を伴う型付けされた回答を返します。これは、チケットをルーティングしたり、エスカレーションをトリガーしたり、人間に委ねたりするためにコードで使用できます。これは、エージェントの決定において、必ずしも人間がループ内にいる必要がなくなったことを意味します — エージェントはプログラムでコンテキストを収集し、決定を下し、タスクを実行したり、必要に応じて人間に委ねたりできます。 具体的にはCloudflareでは、新しいClefモデルを脅威インテリジェンスチームでウェブサイトドメインを分類するためにテストしています。Clefにドメイン(ブラウザ実行付き)を渡すと、ドメインが属するカテゴリを迅速に特定できます — 例えば、ドメインがファッションウェブサイトである確率が95%、Eコマースが85%、フィッシングが1%未満などと分類できます。この分類は、Clefモデルがウェブサイトを取得、レンダリング、分類するのに2.2秒かかりました。対照的に、私たちの最速の汎用LLMであるgpt-oss-120bは、同じワークフローで4.7秒かかり、2つの分類しか返しませんでした。ユーザーとして、レイテンシと結果の2倍の節約が、脅威インテリジェンスワークフローを改善し、悪意のあるドメインまたは正当なドメインをより迅速に特定するのにどのように役立つかを想像できるでしょう。これを、迅速なプログラムによる決定が必要なあらゆるユースケースに一般化すると、自律的に決定、推論、実行できる強力なエージェントワークフローがアンロックされます。 音楽理論では、クレフは五線譜の先頭に置かれる記号で、線とスペースに特定の音名を割り当てます。決定モデルは、コンテキストのドメインとそれに続くノート(アクション)を定義するのに役立つため、音楽のクレフに類似しています。私たちはClefを決定モデルファミリーの名前として選びました。それは同様の目的を果たし、CFはCloudflareを連想させるからです。 Clefは他の決定モデルとどう違うのか? 市場には決定モデルがますます飽和していますが、Clefには公開するのを興奮させるユニークな特性がいくつかあります。第一に、ビジョンエンコーダーを備えているため、画像を入力として受け取り、視覚コンテンツを分類できます。これは、今日テキスト分類のみを行うJevとは異なります。第二に、私たちのモデルは64kのコンテキストウィンドウ(Jevの32kと比較して)を持っており、ユーザーはモデルが分類するためのより多くの入力状態を絞り込むことができます。 第三に、私たちのモデルは正確で強力であり、さまざまな品質ベンチマークで市場の他の決定モデルと比較して競争力のあるスコアを獲得しています。決定に重要な評価の一部をJev Decision Indexで定義されたものとして短縮し、市場でより人気のあるモデルのいくつかにスコアを付けました。以下の表でベンチマークを確認するか、ライブ決定インデックスデモサイトでスコアを表示してください。 ベンチマーク | Clef | Clef-flash | Jev | Diffusion | Gemma Jev | Kev 9B | Laya BF ---|---|---|---|---|---|---|--- CL · case exact | 98.47 | 98.76 | 95.75 | 96.52 | 94.51 | 38.13 | ToolRet · nDCG@10 | 69.19 | 66.43 | 65.28 | 61.21 | 64.26 | 12.69 | API-Bank · accuracy | 91.93 | 93.11 | 88.19 | 83.66 | 56.30 | 11.41 | Home appliances · case exact | 82.95 | 97.73 | 52.27 | 42.05 | 25.00 | 0.00 | When2Call · accuracy | 72.37 | 65.58 | 80.97 | 75.44 | 49.62 | 11.94 | BANKING77 · macro-F1 | 94.20 | 90.93 | 79.74 | 74.28 | 84.83 | 14.29 | CLINC150+OOS · macro-F1 | 97.43 | 66.77 | 89.27 | 83.49 | 79.03 | 3.19 | BRIGHT · nDCG@10 | 45.91 | 39.26 | 47.52 | 42.94 | 38.53 | 19.90 | Amazon ESCI · macro-F1 | 57.48 | 57.39 | 55.21 | 53.37 | 49.22 | 24.40 | PhishNChips · accuracy | 79.60 | 75.05 | 62.55 | 85.35 | 50.75 | 50.15 | また、Typesafe独自の評価スイートでベンチマークを実行したところ、Clefモデルは4つの領域のうち3つでJevを上回りました。特に、Clef-flashは非常に高速であることを考えると、例外的に優れたパフォーマンスを発揮します。 ワークフロー | Clef | Clef-flash | Jev ---|---|---|--- Invoice processing | 64.75 | 7.16 | 1.8 Customer service | 76.37 | 77 | 76.0 Security incidents | 62.9 | 61.7 | 1.7 Agent trace observability | 68.5 | 69.8 | 71.6 実行した43の評価ベンチマーク全体で、Clefモデルはレイテンシ(上記のベンチマークで品質を犠牲にしているLayaを除く)を除いて、決定モデルを上回りました。 ベンチマーク | Clef | Clef-flash | Jev | Diffusion | Gemma Jev | Kev-9B | Laya ---|---|---|---|---|---|---|--- Median latency · ms | 209.3 | 38.85 | 24.18 | 4.45 | 1.4 | 5.8 | p95 latency · ms | 238.6 | 122.45 | 36.02 | 11.21 | 87.92 | 22.5 | モデル自体のレイテンシの利点に加えて、ClefモデルはWorkers AI上でホストされています。Cloudflareのインフラストラクチャ上でホストされているため、エッジでのGPUを活用でき、ネットワークレイテンシが低く、より高速な決定が可能になります。これは、Clefをエージェントが決定を下すためのホットパスに配置し、Workers AI上のLLMのいずれかと組み合わせてアクションを実行できることを意味します。 curl https://api.cloudflare.com/client/v4/accounts/$CLOUDFLARE_ACCOUNT_ID/ai/run/@cf/cloudflare/clef \ -X POST \ -H "Authorization: Bearer $CLOUDFLARE_AUTH_TOKEN" \ -d '{ "model": "clef", "state": "Checkout has been failing for every customer for the last hour.", "questions": { "urgent": { "type": "noul", "instructions": "Is this support request urgent?" }, "team": { "type": "choice", "instructions": "Which team should handle this request?", "criteria": { "billing": "Payments, invoices, and refunds", "technical": "Outages, errors, and configuration", "sales": "Plans and upgrades" } }, "severity": { "type": "score", "instructions": "How severe is the customer impact?", "criteria": ["No impact", "Minor", "Major", "Critical"] } }' Clefは、Jevと同様に厳密に型付けされた出力を生成し、APIと完全に互換性があるため、非常に簡単に切り替えることができます。より大きなClefモデルは、より強力な精度モデルであり、Clef-Flashモデルはレイテンシが重要な決定に最適です。これらのモデルは、お客様のリクエストや応答を読み取ったり、保存したり、トレーニングしたりしないという保証付きでエンタープライズ対応となっています(ファインチューニング製品を使用する場合を除く)。開発者向けドキュメントから始めたり、Hugging Faceリポジトリのオープンソースモデルで遊んだりして、Clefモデルを今日から使い始めることができます。 特定のワークロードに合わせてClefを調整するのに役立つ場合は、ファインチューニングサービスも提供しています。まず、フォワードデプロイエンジニア(FDE)チームとのハンズオンパートナーとして、次に、お客様がモデルをトレーニングしてCloudflareに再デプロイするためのセルフサービスファインチューニングプラットフォームとして提供します。 Clefのトレーニング方法 Jevが登場した週に、自社開発の決定モデルで行った実験について投稿しました。デモでは、大規模言語モデルによって生成されるlogprobを公開することで、DiffusionGemmaモデルを決定的な確率を出力するように適応させた方法を説明しています。私たちの最初の試みは、機械学習(ML)の分野で活動しているMatt Mastracciによる独立した研究に基づいています。