AI・機械学習
Show HN: CUA-S1 – コンピュータ利用のためのシステム1モデル
Show HN: CUA-S1 – A System One Model for Computer Use (github.com)
要約
CUA-S1は、コンピュータ利用におけるタスクを、汎用的な大規模言語モデル(LLM)ではなく、限定的な意思決定に特化した小規模モデルで処理することを目指すシステムです。このモデルは、与えられた選択肢に対して確率を返すことで、フォーム入力などのタスクを効率的に自動化します。
全文翻訳
こんにちはHN!私たちはCuaのDillonとFrancescoです。
コンピュータ利用のタスクのうち、どの程度のものが、その全ての決定とステップを考え抜くために、完全な汎用LLM(例: gpt-6-astra、claude-opus-5など)を必要とするのか疑問に思っていました。一部のタスクは、計画を立て、様々な経路を探索し、失敗から回復することを必要とします。他のタスクは、この値はここに配置すべきか、このチェックボックスにチェックを入れるべきか、あるいはこの要素は無視すべきか、といった局所的な決定を行う問題です。
これらの種類の決定のみを行うように訓練された小規模モデルで、どこまで到達できるか疑問に思いました。
私たちのインスピレーションは、TypesafeのJevとそのシステム1モデルのフレームワークでした。これは、ダニエル・カーネマンが説明した、速く、自動的に、直感的に思考する(システム1)ことと、遅く、分析的に思考する(システム2)ことの二分法への言及です。
私たちにとって興味深い質問は、モデルに現在のコンテキストのインターフェースと、可能な選択肢のセットを与え、各選択肢に確率を返すように求めたらどうなるか、ということでした。この種のモデルは、ほとんどのLLMが行うようにトークンごとにテキストを生成するのではなく、あなたが提示したオプションをスコアリングします。あなたはそれをチェックし、信頼し、アプリの動作を駆動するために使用できます。
CUA-S1は、コンピュータ利用のための狭く専門化された意思決定モデルに対する私たちの答えです。最初のリリースはCUA-S1-FORMSです。私たちはjevlikeのアイデアとコードからこれを構築し、フォームの操作のみを処理するために2番目のモデルを訓練しました。このモデルは706kのパラメータを持ち、元のチェックポイントは2.8MBです。
最初の訓練イテレーションは、合成データ上で30分未満で完了しました。ドキュメントから抽出された構造化された要素と値のセットが与えられると、各要素に対して、指定された値を使用するか、CHECK、CLICK、またはSKIPするかを予測します。テキストフィールドの新しい値を予測せず、スクリーンショットも考慮しません。要素の決定はまとめてスコアリングされ、あなたのコードはアクションを順序付けでき、Cua Driverはそれらを一つずつ実行します。
このスペシャリストとホストされたJevのフォームタスクにおける最初の評価:
- 全ての決定セットに対して: 99.7% 正解 vs 83.6%。
- アクションを必要とするステップのサブセットに対して: 100% 正解 vs 96%。
- 単に既に埋められたフィールドをそのままにするステップのサブセットに対して: 100% 正解 vs 74%。
スペシャリストはこのタスクと慣習(既に埋められたボックスの場合はスキップを押すだけ)のために特別に訓練されましたが、ホストされたJevはそれにファインチューニングされていないため、これはスコープされた専門化の実験です。
ローカルでフォームをスコアリングするために7-9ミリ秒を測定しました。ホストされたJevへの1回の呼び出し(ネットワーク遅延を含む)では260-280ミリ秒でしたが、これらのサンプルは異なるものを測定しており、エンドツーエンドのフォーム完了時間ではありません。
私たちの関心は、壊れやすいスクリプトと汎用エージェントループの間の空間にあります。フォームフィールドの内容とレイアウトは十分に変化するためスクリプトは扱いにくくなりますが、利用可能な決定のセットは狭く、適切にスコープされたままにすることができます。私たちは、汎用エージェントが新しいものに遭遇し、スペシャリストに理解しやすい決定を渡す可能性を探求したいと考えています。
これは私たちが探求している方向性です。現在のリリースはフォーム専用です。合成データ生成、訓練、評価、およびDriver統合をlibs/cua-s1の下でMITライセンスでオープンソース化しました。
コメントをお待ちしています!特に、コンピュータ利用エージェントを構築していて、スクリプト化するには変動が大きすぎるが、別のLLMを呼び出すには狭すぎる、といった繰り返し発生する決定に遭遇したことがある場合は、ぜひお聞かせください。