HN 日本語サマリー

← 一覧へ戻る
AI・機械学習

CerebrasでQwen 3.8 27Bが1500トークン/秒で利用可能に

Qwen 3.8 27B available on Cerebras at 1500 tokens/s (inference-docs.cerebras.ai)

508 pointsby altertable156 コメント

要約

Cerebrasは、同社のプラットフォーム上で大規模言語モデルQwen 3.8 27Bが利用可能になったことを発表しました。このモデルは、64Kまたは128Kのコンテキストウィンドウを持ち、毎秒約1500トークンという高速な推論速度を実現します。Cerebrasは、モデルの圧縮技術についても説明しており、公開エンドポイントではオリジナルの非圧縮モデルを提供し、研究目的で圧縮モデルをHugging Faceで公開していることを明記しています。

全文翻訳

Cerebrasの公開エンドポイント上のモデルは、無料トライアルおよび従量課金ティアで利用可能ですが、レート制限と価格設定の対象となります。追加のモデルファミリー、予約容量、より高いスループット、および本番環境のSLAについては、専用エンドポイントを参照してください。 初めての方はこちら。クイックスタートに従って、最初��APIコールを行ってください。ユースケース別にモデルを選択するには、モデル選択ガイドを参照してください。各モデル名の詳細な仕様、機能、およびティアごとの制限については、モデル名をクリックしてください。 利用可能なモデル モデル名 モデルID パラメータ数 コンテキスト(無料/有料) 速度(トークン/秒) OpenAI GPT OSS gpt-oss-120b 1200億 65k / 131k 約3000 Qwen 3.8 27B qwen-3.8-27b 270億 64k / 128k 約1500 さらに多くのモデルをお探しですか?専用エンドポイントを通じて、さらに多くのモデルファミリーが利用可能です。 モデル圧縮 このセクションでは、当社のプラットフォームで利用可能な各モデルの圧縮状態に関する透明性を提供します。私たちはコミュニティから様々なオープンソースモデルをホストしています。現在、公開エンドポイントでプルーニングされたモデルはホストしていません。公開エンドポイントを通じて提供されるすべてのモデルは、オリジナルの非プルーニングバージョンです。REAP(Router-weighted Expert Activation Pruning)のようなプルーニング技術に関する研究を行っていますが、これらのプルーニングされたモデルはHugging Faceで研究コミュニティと共有されており、共有APIでは利用できません。REAPについては、当社の研究ブログで詳しく読むことができます。当社の公開モデルはすべて非プルーニングです。 Cerebrasは、品質を最大限に維持するために、ストレージ中のみ選択的な重みのみの量子化を使用します。これは、重みが部分的な16ビット/8ビット/4ビットで保存されることを意味し、業界標準に準拠しています。品質のために、機密性の高いレイヤーはフルプレシジョンで保存され、オンザフライでデ量子化されるため、操作は高プレシジョンで行われます。アクティベーション、アテンション、およびKVキャッシュは、フルプレシジョンおよび非量子化のままです。 よくある質問 モデルのアーキテクチャを予告なく変更しますか? いいえ。既存のエンドポイントすべてに対して、変更なしでオリジナルのモデルを提供することをお約束します。ホストされているポートフォリオでプルーニングによるモデルアーキテクチャを変更することはありません。将来的にプルーニングのような追加の圧縮技術を検討する場合、プルーニング固有の名前を持つ別のエンドポイントとして提供され、完全な透明性を確保し、ニーズに最適なバージョンを選択できるようにします。 REAPでプルーニングされたモデルはどこで見つけられますか? 当社のREAPでプルーニングされたモデルは、研究および実験目的でHugging Faceで利用可能です:Cerebras REAP Collection。これらのモデルは当社のプルーニング研究を示していますが、本番APIでは提供されていません。 圧縮、量子化、プルーニングとは何ですか? 圧縮は、モデルサイズまたは計算要件を削減する技術の総称です。一般的な圧縮技術には以下が含まれます。 量子化:モデルの重みを表すために使用される数値の精度を下げること(例:FP16からFP8への変換)。これにより、アーキテクチャを変更せずにメモリ使用量を削減できます。 プルーニング:モデルの一部(レイヤーやエキスパートなど)を永続的に削除して、モデルサイズを削減すること。これにより、アーキテクチャが変更され、異なるモデルが作成されます。 このページは役に立ちましたか? はい いいえ