HN 日本語サマリー

← 一覧へ戻る
Web開発

AIモデルの選択:1つのプロンプト、11のモデル、異なる結果

Choosing an AI model: one prompt, 11 models, different results (netlify.com)

197 pointsby toddmorey80 コメント

要約

NetlifyはOpenRouterとの提携により、AI Gateway経由で多様なAIモデルを提供開始しました。これにより、開発者は用途や予算に合わせて最適なモデルを選択できるようになります。記事では、同一プロンプトを11の異なるモデルで実行し、その結果、生成されたウェブサイトの見た目、問題点、そしてクレジット消費量を比較分析しています。

全文翻訳

OpenRouterとの提携により、2つの新しい機能が利用可能になりました。第一に、NetlifyのAI Gatewayを通じてOpenRouter上のあらゆるモデルを使用できるようになり、WebアプリのAI推論機能に幅広い選択肢を提供します。第二に、Agent Runnersで利用できる最先端のコーディングモデルの選択肢が拡張され、Kimi K3、GLM 5.2、DeepSeek V4といった人気のオープンモデルが追加されました。 Agent RunnersはNetlify内のチャットプロンプトボックスで、新規プロジェクトの構築や既存プロジェクトの改良に役立ちます。これらのエージェントは、Netlifyの機能(Netlify Database、AI Gateway、Identityなど)に関するコンテキストと追加スキルを提供され、利用方法を理解します。多様なモデルに対応するため、人気のオープンソースであるOpenCodeが新しいエージェントとして追加されました。 しかし、選択肢が増えるにつれて、「どのモデルが自分に合っているのか?」「もっと優れた、あるいはコスト効率の良いモデルはないのか?」といった疑問が生じます。この記事では、同一プロンプトを様々なモデルで実行した際に得られた洞察を共有します。 Netlifyでは、モデル評価ツールAXIS(最近オープンソース化)を内部で使用しています。AXISには、サイト構築や反復処理のテストケースが与えられ、指定されたエージェントとモデルでテストを実行し、生成されたサイトの機能性をスコアリングします。例えば、データベースが必要な場合に適切に使用されているか、静的サイトで十分な場合に過剰に設計されていないかなどをチェックします。 今回は、より実用的な情報として、異なるクレジット消費量を持つモデルがどのような結果を生成するかを検証します。テストケースは3つです。 1. 地元のコーヒーショップ用サイト:シンプルなプロンプトで、データベース不要の静的サイトを生成し、その後、座席予約機能の追加を試みます。 2. To-DoリストWebアプリ:複数ユーザーがタスクを表示・追加できるアプリで、初期段階から共有データベースが必要であり、その後、写真アップロード機能の追加を試みます。 3. 「何が作れる?」Webアプリ:ユーザーが自宅の材料を入力するとAIがレシピを提案するアプリで、AI Gatewayを正しく使用しているかを確認します。 各ケースで、生成されたサイトの外観、特筆すべき問題点、そして生成にかかったクレジット数を比較します。テストはすべてNetlifyのデフォルト設定で行われました。 特に、GPT 5.6 Solはデフォルトで低負荷設定となっており、Opusよりも経済的でありながら良好な結果を提供します。ただし、この設定はユーザー制御可能であり、デフォルトは変更される可能性があります。 この記事では、最初のシナリオ「コーヒーショップの静的ページ」に焦点を当て、今後の記事でより複雑なユースケースを取り上げます。 シナリオ1:地元のコーヒーショップ プロンプト:「近所のコーヒーショップの1ページサイトを構築してください。営業時間、住所、簡単なメニュー、写真を含めてください。自分で編集しない限り、何も変更されないようにしてください。」最後の文は、高度なCMSが不要であることをモデルに示唆するためのものです。 モデルごとのクレジット消費量比較(3回実行の平均): Claude Opus: 551, 249, 1055 クレジット Claude Sonnet: 143, 81, 103 クレジット GPT 5.6 Sol (低負荷デフォルト): 173, 158, 92 クレジット Gemini 3.6 Flash: 103, 109, 91 クレジット Kimi K3: 102, 125, 95 クレジット Gemini 3.1 Pro: 53, 57, 52, 49 クレジット GPT 5.6 Terra: 39, 43, 23, 49 クレジット DeepSeek V4 Pro: 37, 47, 30, 33 クレジット GLM 5.2: 27, 15, 42, 24 クレジット Kimi K2.7 Code: 19, 21, 18, 17 クレジット DeepSeek V4 Flash (最新リビジョン - 0731): 2.4, 3.4, 1.3, 2.5 クレジット Claude Opusの平均値は、1回の実行で1055クレジットを消費したため、大きく引き上げられています。無料プランは300クレジット、個人プランは1000クレジット、プロプランは3000クレジットが含まれます。 Claude Opus 5の1055クレジットを消費した実行結果は、デザインのディテール(アニメーション可能なコーヒー豆のスタンプ風要素など)やカスタムマップを含み、非常に詳細で魅力的でした。ダークモードも標準で動作します。ただし、コーヒーショップの具体的な情報は提供されていませんでした。 Opusの他の2回の実行(253クレジットと249クレジット)も、悪くない結果でした。