HN 日本語サマリー

← 一覧へ戻る
AI・機械学習

Tokenless (YC S26) – モデルの自動切り替えでコストを節約

Launch HN: Tokenless (YC S26) – Automatic model switching to save money (usetokenless.com)

63 pointsby rohaga57 コメント

要約

Tokenlessは、AIモデルのAPIゲートウェイであり、複数のAIモデル間でトラフィックを動的にルーティングすることで、AI利用コストを削減します。高価な最先端モデルと安価で改善中のオープンソースモデルを組み合わせ、必要に応じて賢いモデルに切り替えることで、コスト効率と性能を両立させます。同社は、この技術によりClaude Fable 5と同等の性能を半額で実現できると主張しています。

全文翻訳

HNの皆さん、こんにちは。Tokenless (<a href="https://usetokenless.com/">https://usetokenless.com/</a>) のRohitです。共同創業者であるAndrewとKevと共に開発しています。 私たちは、エージェントのトラフィックをターンごとに動的に異なるモデル間でルーティングし、AIの支出を節約するAPIゲートウェイを構築しています。 AIトークンのコストは多くの人にとって最優先事項です。UberやSalesforceのような企業は、予想よりも早く年間のAI支出を使い果たしていると不満を漏らしています。 最先端モデルは開発作業には素晴らしいですが、非常に高価です。オープンソースモデルは安価で急速に改善しており、最先端モデルとの差を縮めていますが、まだそこまで到達していません。 Tokenlessは、両方の長所を提供します。より難しいタスクは、必要に応じてのみより賢いモデルにルーティングすることで、コストを低く抑えます。 Tokenlessを開発する前、私はプリンストン大学で博士号を取得していました。コーディングやその他のエージェントを使用する際、AIの支出を学術用のCursorアカウントで最大限に活用するために、モデルの選択に常に苦悩していました。 同時に、LLMの研究をしており、NeurIPS提出シーズンからの回復中に開発した小さなテクニックが、非常に早くSOTA(State-of-the-Art)に到達したようです。このような単純なアイデアがルーティングをうまく実行できることに驚きました。 私たちは、Claude Fable 5の性能に匹敵し、コストを半額に抑えるルーターのバージョンを開発することができました。当社のウェブサイトのブログ記事では、その方法に関する技術的な詳細を説明しています (<a href="https://usetokenless.com/blog/building-tokenless/">https://usetokenless.com/blog/building-tokenless/</a>)。 ハイライト: - 私たちのアプローチは、複数のモデルを同時にクエリし、その進捗状況を使用して決定を下します(このテクニックは私が知る限り新しいものです。もし他にこのようなことをしている人がいれば教えてください)。 - ルーティングアルゴリズムがキャッシュのホット/コールド状態を認識している場合、モデルの切り替えはキャッシュを破壊しません。 今後: - ルーターにKimi K3、その他のGPT関連の取り組みなどを追加予定です。 usetokenless.comでサインアップして、Tokenlessをエージェントと共にお試しください。20ドルの無料クレジットが付与されます。使い方のデモはこちらです: <a href="https://youtu.be/sjZWriclcls">https://youtu.be/sjZWriclcls</a> Tokenlessは、より安価に最先端レベルの知能を提供します。そのため、使用感、ルーターが誤ってルーティングするコーナーケース、そしてルーティングの問題が興味深いかどうかについて、ぜひフィードバックをお寄せください!