プログラミング
llama.cpp
要約
llama.cppは、ローカル環境で動作するオープンソースのAI実行フレームワークです。APIキーやテレメトリなしで、プライベートかつ完全にローカルで最先端のAIモデルを実行でき、ユーザーは自身のモデルと会話データを完全に所有できます。あらゆるハードウェアで最適化されており、多様なGPUやCPUに対応しています。Qwen、Gemma、GPT-OSSなどの様々なモデルを実行可能です。
全文翻訳
llama.cpp AIがあなたのコンピュータ上で動作します。オープンソース、プライベート、そして常にローカルです。最先端のAIを完全にあなたのマシンで実行してください。APIキーなし、テレメトリなし、制限なし。あなたのモデルと会話データを所有しましょう。
curl -LsSf https://llama.app/install.sh | sh
BrewやWingetを好みますか?パッケージマネージャー · ソースからビルドしたいですか?手順に従ってください
ローカルのコーディングエージェントとペアリングしましょう。llama serveを実行し、pi-llamaプラグインをインストールしてPiを起動してください。ローカルモデルを自動的に検出します。設定不要、APIキー不要です。ファイルはあなたのマシンに留まり、リクエストは決してそれを離れません。
# 1. モデルをサーブする
llama serve
# 2. pi-llamaプラグインをインストールする
pi install git:github.com/huggingface/pi-llama
# 3. Piを実行する、すべて設定済みです
pi
あらゆるハードウェアに最適化されています。ラップトップからクラスターまで、llama.cppはあなたが持っているもので動作します。同じバイナリ、同じモデル、あらゆるGPUとCPUのために手作業で調整されたカーネルです。
Apple Silicon M Ultra RTX 5090 CPU Jetson H100 MI300 RTX 4090 A100 M Pro M Max DGX Spark T4 Radeon RX B200 Intel Arc RTX 3090
最初��モデルを実行する
Qwen 3.6
Alibabaの次世代ネイティブマルチモーダル推論モデル。コーディングおよびビジョンタスクで、数倍大きいモデルに匹敵するDenseおよびMoEバリアントです。
Gemma 4
Googleの最も高性能なオープンモデルで、Gemini 3テクノロジーから構築されています。マルチモーダル推論、エージェントワークフロー、および140以上の言語をサポートします。
GPT-OSS
GPT-2以来のOpenAI初のオープンウェイトモデル。推論、エージェントタスク、および関数呼び出しとツール使用機能を備えた開発者向けに構築されています。
Gemma 3
Geminiテクノロジーから構築されたGoogleのマルチモーダルモデル。140以上の言語、ビジョン、テキストタスクをサポートし、エッジからクラウド展開まで最大128Kのコンテキストに対応します。
すべてのモデルをブラウズする