HN 日本語サマリー

← 一覧へ戻る
AI・機械学習

GLM 5.3 Flashで1ヶ月コーディング

One month coding with GLM 5.3 Flash (wagtail.org)

182 pointsby ThibWeb142 コメント

要約

著者は9月いっぱい、効率的なオープンモデルであるGLM 5.3 Flashのみを使用してコーディングするという挑戦を行いました。結果として、目標の半分しかこのモデルを使用できず、他のモデルに10億トークンが費やされました。特に、プロトタイプ開発でのモデル選択ミスやインフラの利用可能性の問題、実験・研究開発のためのコストが課題となりました。

全文翻訳

GLM 5.3 Flashで1ヶ月コーディング 設定した挑戦は、9月いっぱい、効率的なオープンモデルのみで過ごすというもので、当時は素晴らしいアイデアだと思われました。実際には、それほどでもありませんでした。20億トークン後、どのように進んだかをお伝えします。 今月トークンがどこへ行ったか AIの使用状況を把握するためのエージェンティックエンジニアリングの推奨事項の一つであるAgentsViewによると、トークンの分布は以下の通りです。 モデルの分割に特化してズームインすると: 目標は、ティール色で示されたGLM 5.3 Flashのみで1ヶ月を過ごすことでした。うまくいった点は以下の通りです。 月の前半は、そのモデルだけで過ごすことに成功しました。 そのモデルの使用量は、予算内(68ドル、約4kWhのエネルギー使用量 / 365グラムの炭素排出量)でした。 月の後半はうまくいかず、10億トークンが他のモデルに費やされました。 予期せぬハードル 警告 - これらは予期できたはずです! バイブコーディングのコスト 実験的なWagtail MCPサーバーは、バイブコーディングされたプロトタイプであることを、私たちはかなり透明性をもって公開しています。バイブコーディングは、私たちが通常目指すものではありませんが、プロトタイプとしては的確です。残念ながら、それには依然として結果が伴います。プロトタイプに「間違った」モデルを選択してしまい、私たちはほぼ一晩で4億5000万トークン / 150ドル / 5kWhのエネルギーを費やしました。MCPサーバー自体はうまく機能し、現在ではその機能の素晴らしいデモがありますが、無駄ではありませんでした。 nonetheless、モデル選択とエージェンティックパターンに注意することの重要性を思い出させてくれます。おそらく、それほど労力をかけずに、5倍以上のコストで同等の結果を得られたでしょう。教訓になりました!これを予算化し、より注意する必要があります。予期できたかもしれませんが、今ではわかっています。 インフラの苦労 もう一つの予期せぬハードルは、インフラの利用可能性の問題でした。推論プロバイダーの比較については、広範囲にわたって記述してきました。私たちの選択はほとんどの場合うまくいきますが、それらは非常に人気があり、すべてのGPUを買い占めている大手ラボと同じ容量を持っていないことが判明しました。特にGLM 5.3 Flashのパフォーマンスの低下に気づきましたが、これはおそらく、私たちの仕事に関連するモデルのパレートフロンティアの上位に位置しているためでしょう。 注:これは、ヨーロッパのデータセンターで利用可能であることを確認できたオープンモデルのみを表示するようにフィルタリングされています。もし他の場所での推論実行を許容するのであれば、あなたのパレートフロンティアは異なるかもしれません。 私たちにとって、利用可能なモデルでは、他の類似モデル(DeepSeek V4.1 Flash、Qwen 3.8 Flash)に切り替える必要がありました。これは非常に簡単なことですが、それでも予期せぬことでした! 実験と研究開発のコスト 最後になりましたが、日々のエンジニアリングで一つのモデルを使用することに加えて、プロバイダーがリリースしているものを常に把握し、幅広いモデルを実験し続けることが不可欠だと感じました。これは、特にWagtailタスクでのモデルのパフォーマンスをベンチマークし始める際に重要であり、幅広いモデルのデータが必要です。私たちのベンチマークのプレビューです。 このような具体的なデータがあれば、よりスリムなオプションを人々に案内しやすくなります。そして、エージェントスキルや、エージェントと良好に連携するように設計された新しいCLIプロトタイプで、これらのオプションをさらに実行可能にすることができます。 うまくいったこと すべてが悪かったわけではなく、確かにこの挑戦をより長く続けたいと思っていますが、それは通常の日常業務の50%以上、「プロダクション」のみであり、研究開発ではありません。GLM 5.3 Flash自体は素晴らしかったです!このような挑戦にどのように適しているか、モデル比較から改めて強調する価値があります。 1Mのコンテキストウィンドウ、つまり、あらゆる拡張されたコーディングタスクが可能です。 ビジョンサポート、スクリーンショットやQAを視覚的に構築できます。 幅広いプロバイダーで利用可能なので、健全な競争のメリットが見られます。 Wagtail自体、それを使って構築されたサイトで動作させました。UIタスク、AI研究開発、ドキュメント作成も少し。多くの評価。本当に多用途です。 テイクアウェイと今後の進め方 技術的には、この挑戦は失敗でした。ターゲットモデルの使用率は50%に過ぎず、20億トークンのうち10億トークンでした。エネルギー使用量は10kWhではなく約35kWhでした。しかし、私たちは多くのことを学びました。これは現在の状況にとって非常に重要です。 10月の振り返りとして、これを成功させるために必要なことは以下の通りです。 継続的なローカル使用量の測定と報告。トークンだけでなく、エネルギー使用量と支出、そして理想的にはこれらすべてが具体的な肯定的な成果にどのように繋がるかを見ていきます。 日々のタスクだけでなく、実験のための予算編成。どのプロトタイプが構築する価値があるか、そしてどのように構築するかについて、より集中的な決定を下します。 より良いプロンプト選択とマルチエージェント技術。オーケストレーター対スカウト対実装者対レビュー担当者エージェント。境界のある目標。ロケット科学ではありませんが、学ぶべきもう一つのことです。 より効率的な技術とモデルを追求し続けます。Jevスタイルの決定拡散モデルは、それらが非常に効率的に実行できるのであれば、非常に有望に見えます。最新のフラッグシップモデルも、その点では正しい方向への一歩のように見えます。 日々の開発者作業にとって、一つの、または二つのフラッシュティアの安価なモデルに焦点を当てることは完全に可能です。実行可能な目標は、おそらく、AI推論作業の大部分が、無意味なトークンではなく、コストまたはエネルギー使用量で測定される、そのような効率的なモデルで行われるべきだということです。それが10月の目標です!あなたも試してみてください、その過程で多くのことを学ぶでしょう。 そして11月のWagtail Space 2026で、その結果について聞くために挨拶に来てください! ニュース 2026年9月3日 オープンモデルのみ:学校に戻る挑戦 サブスクリプションを捨て、9月いっぱいをオープンウェイトモデルで過ごす エージェンティックエンジニアリングの推奨事項 LLM支援ソフトウェアエンジニアリングの一部として、私たちのAIガイドラインを遵守したい人向けの意見に基づいた推奨事項。