HN 日本語サマリー

← 一覧へ戻る
AI・機械学習

Jev: 新しいフロンティアモデル、40~400倍安く、20~200倍高速

Jev: New frontier model 40-400x cheaper and 20-200x faster (typesafe.ai)

223 pointsby albelfio79 コメント

要約

TypeSafe AIは、構造化された意思決定に特化した新しいAIモデルクラス「System One」と、その最初のモデルである「Jev」を発表しました。Jevは、従来のLLMと同等の知能を持ちながら、40~400倍安く、20~200倍高速に動作し、構造化された出力のみを生成するため、誤情報(ハルシネーション)を起こしません。これにより、AIをソフトウェアに直接組み込むことが容易になり、自動化ワークフローやリアルタイムアプリケーションへの応用が期待されます。

全文翻訳

TypeSafe AIはSystem OneモデルとJevを発表しました Read More TypeSafe AI Manifesto Our Team Join Waitlist TypeSafe AIはSystem OneモデルとJevを発表しました Read More TypeSafe AI Manifesto Our Team ∵ Back Company News Sep 14, 2026 Introducing System One Models and Jev Diogo Almeida, founder, TypeSafe モデルは長年チャットにおいて人間を超えてきましたが、では自動化はどこにあるのでしょうか? これは私が過去4年間追い求めてきた問いです。OpenAIでは、言語モデルが指示に従ったり人と会話したりするのに役立つ手法を構築するのを手伝いました。その成果はChatGPTの研究の基盤となりました。当時、チャットモデルがAGIにつながるかもしれないと思いましたが、誇大広告にもかかわらず、何かが非常に欠けていることが私には明らかになりました。 2年間のステルス期間、数え切れないほどの技術的課題、そして研究のブレークスルーを経て…本日、TypeSafe AIが最初のSystem One Modelをリリースできることを非常に嬉しく思います。これは、ソフトウェアが直接利用できる、高速で構造化された意思決定を行うために構築された新しいクラスのフロンティアモデルです。 私たちは自動化に完全に焦点を当てた新しいスタックを構築しました。新しいモデルアーキテクチャ、最大の効率のための並列サンプラー、そしてReinforcement Learning for Calibrated Decisions(RLCD)と呼ぶトレーニング手法を備えています。 私たちの最初の公開モデルはJevで、本日より早期アクセスで利用可能です。JevはSystem Oneタスクにおいて既存のLLMと同等の知能レベルを達成しながら、2桁(2桁)高速かつ効率的です。Jevは文字列生成を諦めていますが、構造化された出力に最適化されており、誤情報を生成することはありません。Jevをフロンティア知能の関数呼び出しと考えてください。非構造化状態を入力として、型付けされた確率的決定を出力します。並外れた主張には並外れた証拠が必要なので、詳細は以下をご覧ください。💅 フロンティア、古きものと新しきもの 既存のLLM System One + Jev 最適化手法 Reinforcement Learning with Human Feedback (RLHF) / Reinforcement Learning with Verifiable Rewards (RLVR) Reinforcement Learning for Calibrated Decisions (RLCD) 最適化対象 人間が好むもの:人間評価者が好む書き込みやチャット応答。 検証可能な報酬:プログラムで検証可能な出力。 キャリブレーションされた決定:System Oneタスクにおいて、認識論的に正直な確率を持つ回答。 入力 逐次メッセージを重視した非構造化データ(例:テキスト)。 構造化されたプログラム状態を重視した非構造化データ(例:テキスト)。 出力 文字列/生成されたテキスト。文字列は柔軟で、チャット応答、コード、誤情報、拒否、あるいは型安全な構造化値など、何にでもなり得ます。ソフトウェアで使用するには、応答を解析して検証する必要があります。また、AIが暴走するリスクも常に存在します。 型安全な構造化値。可能な出力と構造は事前に定義されています。モデルは型エラーを起こしません。すべての回答には、キャリブレーションされた確率と信頼度スコアが伴います。 サンプリング 逐次的。1トークンずつ生成し、各トークンは前のトークンに条件付けられます。 並列。単一のクエリで全ての出力を生成します。信じられないほど効率的で、ハードウェアを意識しています。 コスト 入力トークン:$0.20~$10/MTok。 出力トークン:入力トークンの約5倍のコスト。 入力トークン:$0.042/MTok ($42/10億トークン)。 出力トークン:無料(メーター不要なほど安い)。 速度 フロンティアモデルのエンドツーエンド応答時間は3~329秒です。人間とのインターフェースには十分な速度ですが、コードに統合する際には大きなボトルネックとなります。 TypeSafeのエンドツーエンド応答時間は70ms~500msです。System One形状のクエリに対する同じレベルのフロンティア知能に対して、これは40倍~200倍高速になります。 信頼性 信頼度推定値を要求しても、モデルは過度に自信過剰で一貫性がなくなる傾向があります。モデルがタスクを95%の時間実行できるのに、その5%の時に言及しない場合、そのタスクを自動化することはできません。 すべての出力で信頼度と不確実性を常に伝達します。キャリブレーションされている:高い信頼度は高い精度を意味します。より一貫性がある:類似した入力に対して類似した回答を返します。 ユースケース 人間参加型タスク(チャットボット、コパイロット、コーディングエージェント)。一般的で強力ですが、自由度が高いため暴走する可能性もあるため、人間の監督が必要です。 検証可能な問題(数学的証明、カーネル最適化)。正確性が安価かつ自動的にチェックできる場合、LLMは生成、テスト、反復して機能するものを見つけることができます。 デモ。文字列の柔軟性により、時々しか機能しないプロトタイプを迅速に作成するのに非常に役立ちます。 AI駆動ワークフロー/スマートif文。構造化された出力は、通常のソフトウェアにファジーな決定ルールとしてスロットインされます。手書きのロジックが脆すぎる場合に、分類、ルーティング、スコアリング、抽出、または分岐を行います。周囲のコードがその自由度を制限するため、信頼性の高いシステムへの構成が容易になります。 ビッグデータのマッピング・リデュース。ペタバイト級のデータを特徴量と洞察に変換します。 リアルタイムアプリケーション。100msの速度は、UXが重要なアプリケーションでAIを使用できることを意味します。 すべてを検証する。LLMプロンプト、推論トレース、および/または出力のスコアリング、ジャッジ、検証、ガードレール、ジェイルブレイク検出。 証拠/技術結果 私たちは懐疑論者を愛しており、私たち自身も懐疑論者です。 簡単に検証できる主張がいくつかあります。 1回の呼び出しあたりの速度:私たちは本当にそれほど高速ですが、公開されている評価は通常、私たちのラップトップ(サービスが現在拠点を置いている場所)で実行されています。これは、私たちのサービスが現在拠点を置いている場所です。 1回の呼び出しあたりのコスト:価格設定は透明です。これが補助金を受けていないことを証明することはできません。価格設定の持続可能性を証明するには、長期的な視点が必要になります(価格は上がるのではなく、下がることを期待しています)。 型エラーなし:これは、単一の反例で簡単に偽造できるものですが、数学的には不可能です。 より大胆な主張については、可能な限り多くのニュアンスを提供したいと思います。 サイドバイサイドデモ 私たちのサイドバイサイドデモは、私たちのモデルとLLMの主な違いを示しています。Jevは、トークンごとにautoregressiveに生成するのではなく、すべての確率を並列で出力します。文字列は非常に強力で汎用的ですが、コストがかかります。「文字列を諦める」ことは、実際には多くの超能力を与えてくれます! ニュアンス: TypeSafeの早期アクセスユーザー向けに、実際のクエリを以下に示します。 クエリは高度に簡略化されており、画面上の出力が理解しやすいように、質問は説明的な人間が読めるキーを持つように選択されました。 状態も短く、密で詳細な段落であり、サンプリング方法の違いを強調しています。比較的短い入力は、私たちのモデルを有利に見せます。 鋭い目を持つ方のために、記録された実行では、GPT-5.6 Terraとの唯一の意見の相違は「解約可能性レベル」に関するものです。実際の答えは私たちにとっても本当に曖昧なようです。 この例では、GPT-5.6 Terraをデフォルトの推論で使用しました。これは、平均してJevと最も比較可能な知能を持っていることがわかったからです。 豆知識:同様のデモが、私たちがSystem One Modelsの方向にすべてを賭けることを決意させたきっかけでした! ワークフロー評価 コード内でAIがどのように機能するかを測定するために、新しいタイプの評価を作成しました。私たちは、正解の分類を最適化せず、ハーネスとモデルを変更できるようにします(潜在的にハーネスエンジニアリングによる過学習を許容します)。代わりに、正しい計算グラフ(コードで表される「ワークフロー」)が存在すると仮定し、最大、最もスマートで、最も高価な外部モデルの予測を参照確率として使用します。 言い換えれば、すべてのモデルに同じワークフローが与えられます。最もスマートなモデル(この場合、AstraとFable)の平均と比較して、それらがどのように機能するかをテストします。 Jevは、ほぼ2桁の範囲で、パレートフロンティアを独占しており、グラフを飛び越えています。また、チェーンオブソートでロジック全体を実行する生成されたプロンプトを持つモデルとも比較しますが、これはワークフロー自体を使用するよりも大幅にパフォーマンスが低下する傾向があります。 ここで呼び出されるものは、上記のサイドバイサイドデモよりも大幅に複雑です。これは、真のビジネス自動化に必要な本番ワークロードのタイプをより代表しているためです。以下は、公開している4つのワークフローの中で最も単純なものです。 最も信頼性の高い実世界のワークフローは、多くの場合、独立して分解された多くの質問を含んでいます。