キャリア
ゲージが壊れた:AIで開発者は20%速くなったと感じたが、実際は19%遅くなった
The gauge broke: devs felt 20% faster with AI, measured 19% slower (intrepidkarthi.com)
要約
AIツールは開発者の体感を20%向上させたものの、実際の作業速度は19%低下したという研究結果が示されました。特に経験豊富な開発者が既存のコードベースで作業する場合、AIはタイピング速度を向上させるものの、プロンプト作成、待機、不正確な出力のレビューといったオーバーヘッドを増加させ、結果的に開発プロセスを遅くする可能性があります。この「体感速度」と「実際の速度」の乖離は、多くのチームがAI導入の判断基準としている指標が、実態を正確に反映していない可能性を示唆しています。
全文翻訳
共有 → コピーしました!短い答えです。AIはタイピングを高速化しますが、それは経験者が既に知っているコードベースではボトルネックではありませんでした。AIは、すでに高コストだった段階に、オーバーヘッド、プロンプト作成、待機、そしてしばしば微妙に間違っている出力のレビューを追加します。制御された試験では、経験豊富な開発者が約20%速くなったと感じながら、実際には約19%遅くなったと測定されました。なぜAIは経験豊富な開発者を大規模なコードベースで遅くするのでしょうか?2023年12月に、私のチームでは体感速度と実際の速度が乖離していると書きましたが、それはまだ証明できない個人的な観察であると認めました。この夏、その観察にストップウォッチが当てられ、結果は私の推測よりも悪いものでした。METRは、経験豊富なオープンソース開発者を対象に、彼らがよく知っているコードベースで、最新の最先端AIツールを使用してランダム化比較試験を実施しました。作業前、開発者はツールが自分たちの速度を向上させると期待していました。作業後、彼らはツールが約20%速くなったと報告しました。時計で測定すると、彼らは約19%遅くなっていました。自己申告とストップウォッチは、約40ポイントもの差で反対方向を指していました。この研究は小規模で、246のタスクに対して16人の開発者が参加しており、著者らはAIがすべての人をどこでも遅くすることを証明するものではないと慎重に述べています。この効果は、ジュニア開発者や新規開発(グリーンフィールド)の作業ではプラスに転じます。注意点を読んでください。そして、注意点がない部分を読んでください:ツールが自分たちの速度を向上させていると最も確信していた人々が、測定上は遅くなっていた人々でした。それがゲージが壊れているということです。エンジニアリングリーダーが判断の基準とする計器、チーム自身の体感速度は、ノイズが含まれているだけではありません。それは逆に読み取っており、ほとんどの実際の作業が行われる条件、つまり経験豊富な人々が既存のコードで作業する状況下で、まさにそのように機能します。私は2年間この傾向を把握していましたが、私が間違っていた点を正確に述べたいと思います。私は、体感と現実の乖離は測定の問題であり、ダッシュボードをより注意深く見ることで修正できるものだと考えていました。それはそれよりも悪いです。体感は真実のノイズの多いバージョンではありません。それは積極的に誤解を招くものであり、AI導入に関するほとんどの決定が基づいている唯一の入力です。チームが今や2倍速くなったと主張するすべてのリーダーシップデッキは、データが逆転していると述べている読み取り値に基づいています。チームレベルのテレメトリは、小規模な試験では対応できない規模で、反対側から同じことを示しています。Faros AIは、10,000人以上の開発者を対象に調査した結果、プルリクエストのマージが98%増加し、プルリクエストのサイズが150%以上増加し、レビュー時間が91%増加しましたが、デリバリーにはほぼ変化がありませんでした。プルリクエストの31%がレビューなしでマージされました。DORAの研究では、AIの採用率が高いほどデリバリーの安定性が測定可能な低下と関連していることが判明し、そのダメージは今年まで続いています。GitClearは、2億行の変更を分析した結果、コピー&ペーストされたコードの増加、コードのチャーンの増加、リファクタリングの変更の10%未満への減少が見られ、2024年は開発者が整理するコードよりも貼り付けたコードの方が多い記録上初の年となりました。これらの調査結果のパターンはすべて同一です。生成されたものが増え、マージされたものが増え、チャーンしたものが増えました。提供された量は同じで、着地したときはより不安定になりました。私が2022年から指摘してきた文章は、今や測定結果を伴って真実となりました。生成は安価になりました。検証は高価になりました。私たちは古いボトルネックを取り除き、作業を新しいボトルネックに直接送り込みましたが、新しいボトルネックはレビューです。私たちが人員を増やさなかった唯一の段階で、作業量が爆発的に増加し、私たちが信頼するダッシュボードは、コストがインシデントやチャーン、レビュアーの燃え尽き症候群として下流に着地するため、誰もが称賛している速度チャートとは別のページにあるため、そのコストを認識できません。ツールの開発者が、この夏の資金の流れで同じ点を認めているのを見ることができます。私が1月から使用しているエディタであるWindsurfは、7月に週末だけで分解されました。Googleは、その創設者とコア研究者をDeepMindに移すために数十億ドルを支払い、残りはDevinのメーカーに吸収され、創設者が構築するために残したものはエージェントファーストIDEです。エージェントファーストのブランディングを剥がすと、静かな部分が声に出されます。キーボードに座って生成するのをやめ、エージェントが生成したものをレビューし、何を残すかを決定するダッシュボードに移動します。ツール市場で最も積極的な賭けは、仕事は今や検証であるという賭けです。彼らは、この研究がちょうどストップウォッチを当てたばかりのボトルネックのためのコックピットを構築しています。正直な反論、そしてそれは通常よりもここで重要です。これは、Jカーブのディップである可能性が最も高く、目的地ではありません。新しいツールは、支払う前にコストがかかり、体感と現実の乖離のほとんどは、ペイオフが現れる前に現れるコストです。この試験の効果は、ジュニア開発者や新規コードではプラスに転じます。これは構築されるものの増加するシェアです。DORAのスループットは安定性が遅れながらも回復しており、これはチームがディップから抜け出しているように見える状況です。私はツールが悪いと主張しているのではありません。ゲージが壊れていると主張しています。これは異なる、そしてより危険な主張です。なぜなら、悪いツールは最終的に気づきますが、壊れたゲージは信頼し続けるからです。したがって、これを通じてチームを運営している人々のための規律は1つだけです。体感速度で判断するのをやめてください。その体感は、今や逆に読み取ることがわかっている唯一の数値です。本番環境に到達し、維持されるものを測定し、実際に作業が積み上がる段階に人員を再配置し、ストップウォッチが同意するまで、体感に存在する生産性に関する主張は未証明として扱ってください。ゲージはこの夏壊れました。次の区間を勝ち抜くチームは、それに気づき、報告する前に交換するチームです。よくある質問大規模なコードベースでAIが開発者を遅くするのはなぜですか?AIはタイピングを高速化しますが、それは経験者が既に知っているコードベースではボトルネックではありませんでした。AIは、すでに高コストだった段階に、オーバーヘッド、プロンプト作成、待機、そしてしばしば微妙に間違っている出力のレビューを追加します。制御された試験では、経験豊富な開発者が約20%速くなったと感じながら、実際には約19%遅くなったと測定されました。AIはすべての開発者を遅くしますか?いいえ。METR試験の効果は、ジュニア開発者や新規開発(グリーンフィールド)の作業ではプラスに転じます。遅延は、経験豊富な開発者が既存のコードベースで作業する場合に集中しており、AIの提案は実際の時間を節約することなくレビューのオーバーヘッドを増加させます。AIが開発者を遅くするのに、なぜ速く感じるのですか?体感速度と測定された現実が乖離しました。開発者は約20%速くなったと報告しましたが、ストップウォッチは実際には約19%遅いことを示しました。判断の基準となるゲージは、ほとんどの実際の作業が行われる条件で逆に読み取っています。共有 → コピーしました!