プログラミング
Claude.md、スキル、フックの価値を測定した
I measured what my Claude.md, skills and hooks are worth (github.com)
要約
config-drift-checkerは、AIエージェントの設定(CLAUDE.md、スキル、フック)が意図した通りに動作しなくなった場合に、その原因と変更点を特定するツールです。エージェントの設定をテストケースに変換し、継続的に実行することで、モデルの変更やコードの更新による予期せぬ挙動の変化を早期に検出します。これにより、開発者は設定ドリフトによる問題を迅速に特定し、修正することが可能になります。
全文翻訳
config-drift-checker CI for your agent setup. · site · demo dashboard · demo report
このツールは、あなたのエージェントセットアップ — CLAUDE.md、スキル、フック — が本来行うべきことを停止した際に、その理由と変更点をチームに通知します。これは、エイリアスの背後にあるモデルの変更、Claude Codeのリリース、あるいはチームメンバーによる編集が原因である可能性があります。
これは何ですか
あなたのCLAUDE.md、スキル、フックは、現在コードが記述される方法です。これらは、他の人があなたの知らないうちにあなたを変更する設定です。Claude Codeは、執筆時点から30日間で25バージョンをリリースしました。sonnetの背後にあるモデルは、変更ログなしでサーバーサイドで変更され、同僚はテストされていないPRでスキルを編集できます。今日、あなたは開発者が「コミット前にテストを実行しなくなった」と気づくのは、しばしば数週間後です。
config-drift-checkerは、あなたのセットアップが行うべきことをテストケースに変換し、それに対して実際の(real)エージェントを実行し、時間の経過とともにスコアを付けます。
Anthropic自身のclaude plugin evalフォーマットのケース — プロンプト、グレーダー(正規表現、ツール使用、ファイル、LLMルーブリック)、オプションの足場(スクラッチリポジトリを設定したり、実際のソースをコピーしたりする)。
/config-drift-checker:setup は、実際のセットアップから最初のケースを作成するため、空白のページから始める必要はありません。
Claude Codeの各リリース時(ウォッチャーがnpmをポーリング)、セットアップに触れる各PR、およびオンデマンドで実行されます — 使い捨てのワークスペースで、プラグインをロードし、ケースごとに数回実行されます。
スコアと理由:各グレーダーの判定とジャッジの説明、ツール呼び出し、完全な応答 — 数字だけではありません。
ベースラインとの差分 → 赤または緑のチェック、PRコメント、Slackアラート、HTMLレポート、およびすべてのClaude Codeバージョンにわたる各ケースのダッシュボード。これはGitHub Pagesから結果ブランチで提供されます。
そのコアの上に2つのものが乗っています。
アブレーション — 同じケースがプラグインありとなしで実行されます。デルタは、各スキルまたはフックが実際にどれだけの価値があるかを教えてくれます。デモでは、ガードフックは破壊的なコマンドを確実に停止する唯一のものであり、コンベンションスキルはコードベースとCLAUDE.mdがすでに持っていたもの以上の何も追加しないことが判明しました。
生成されたケース — セットアップスキルは設定を読み取り、それに対して実際のコードケース、ネガティブトリガーケース、およびフックケースを書き込み、その後、スモークランがパスするまで自身のグレーダーを修復します。
これは何ではありません:CLAUDE.mdのリンター(実際の(real)エージェントを実行します)、モデルの一般的な品質のテスト(タスクで設定をテストします)、またはホストサービス(あなたのマシンとあなたのCIであなたのキーで実行されます。何もどこにも送信されません)。
どのコードベースでも動作します — アプリではなく、エージェントの動作をテストします。
claude plugin evalが有効な場合は公式ランナーを自動的に使用し、それ以外の場合はバンドルされたランナーを使用します。
インストール
claude plugin marketplace add jameskomo/config-drift-checker
claude plugin install config-drift-checker@jameskomo
次に、保護したいセットアップのリポジトリで:
claude > /config-drift-checker:setup
CLAUDE.md、スキル、フックを見つけ、それらからスターター評価ケースを書き込み、スモークテストを実行し、GitHubワークフローを書き込みます。1つのシークレット(ANTHROPIC_API_KEY)を追加してプッシュします。それ以降、スイートはClaude Codeの各リリースとセットアップに触れる各PRで実行されます:赤いチェック、PRコメント、Slackアラート、および各グレーダーの理由を含むHTMLレポート。
すでにスイートをお持ちの場合、またはステージだけが必要な場合?
1つのステップ:
- uses: jameskomo/config-drift-checker/action@v0
with:
{ plugin-dir: . }
小さなSpring Bootサービスでエンドツーエンドで確認してください:config-drift-checker-demo。
ここにあるもの
config-drift-checker/
プラグイン:スキル(setup · run · write-case)とそれらが使用するツール
tools/
eval-shim.mjs
公式ランナーがゲートされている場合に `claude -p` を介してスイートを実行します
eval-diff.mjs
ベースライン vs 現在 → テーブル、リグレッションで終了コード1
eval-report.mjs
aggregate-result.json → 自己完結型HTMLレポート
eval-dashboard.mjs
結果履歴 → ダッシュボード(バージョンごとのケーススコア、実行リスト)
release-watch.mjs
「Claude Codeが新しいバージョンを公開したか?」
safety-net.mjs
PreToolUse フックがすべての評価実行に注入されます
action/
composite GitHub Action:インストール → 実行 → diff → 保存 → レポート → アラート
examples/komo-stack/
完全な評価スイートとベースライン結果を持つ例のプラグイン
docs/
ユーザーガイド · アーキテクチャ · 評価フォーマットとランナー · ランブック · セキュリティ
ドキュメント
ユーザーガイドから始めてください。完全なインデックスはdocs/にあります。
ライセンス
FSL-1.1-Apache-2.0:自由に使用、変更、セルフホスト可能。競合する商用サービスとして提供することはできません。各リリースは公開から2年後にApache-2.0になります。