AI・機械学習
大規模言語モデルを自宅で、BitTorrentスタイルで実行する
Run large language models at home, BitTorrent‑style (petals.dev)
要約
Petalsは、BitTorrentのような分散ネットワークを利用して、個人のGPUやGoogle Colab上でLlama 3.1、Mixtralなどの大規模言語モデル(LLM)を実行・ファインチューニングできるプラットフォームです。モデルの一部をロードし、他の参加者が提供する残りの部分と接続することで、ローカル環境でLLMを活用できます。これにより、チャットボットやインタラクティブなアプリケーションに必要な速度でテキスト生成が可能になります。
全文翻訳
Petals 大規模言語モデルを自宅で、BitTorrentスタイルで実行する
Llama 3.1(最大405B)、Mixtral(8x22B)、Falcon(40B+)、またはBLOOM(176B)でテキストを生成し、コンシューマーグレードのGPUまたはGoogle Colabを使用してタスク向けにファインチューニングします。
モデルの一部をロードし、その残りの部分を提供している人々のネットワークに参加します。シングルバッチ推論は、Llama 2(70B)で最大6トークン/秒、Falcon(180B)で最大4トークン/秒で実行されます。これは、チャットボットやインタラクティブなアプリケーションには十分です。
従来のLLM APIを超えて、任意のファインチューニングおよびサンプリングメソッドを使用したり、モデルを通過するカスタムパスを実行したり、その隠れ状態を表示したりできます。PyTorchと🤗 Transformersの柔軟性でAPIの利便性を得られます。
購読ありがとうございます!本当にエキサイティングなアップデートがある場合のみメールをお送りします。
今すぐ試す Colab ドキュメント GitHub
現在のトップ貢献者:読み込み中... おっと、ネットワークステータスを読み込めませんでした...
• およびその他
私のGPUに貢献する Discord またはメールで開発をフォローする:購読する
数ヶ月に一度アップデートを送信します。スパムはありません。
送信中... 確認メールを送信しました。アドレスを確認するにはクリックしてください。これで登録完了です!
注目の記事:このプロジェクトはBigScienceリサーチワークショップの一部です。