HN 日本語サマリー

← 一覧へ戻る
AI・機械学習

AIが私の宿題をすべてこなせるようになった後、私が教育を変えた方法

How I changed teaching after AI managed to do all my homework assignments (thelastsoftwareengineer.substack.com)

305 pointsby azhenley287 コメント

要約

著者は、AIが宿題をすべてこなせるようになったため、大学の「本番環境での機械学習」コースの評価方法を大幅に変更しました。従来の低リスクの課題やレポート提出を廃止し、TAとの対面での質疑応答やビデオデモ、試験に重点を置くようにしました。これは、AIの普及により、従来の教育手法が通用しなくなった現状への適応策です。

全文翻訳

AIが私の宿題をすべてこなせるようになった後、私が教育を変えた方法 Christian Kästner 2026年9月23日 5465 シェア 2021年頃、ChatGPTが登場するずっと前に、Vincent Hellendoornは私のコースの読解クイズでGPT-3を試すように勧めてくれました。それは、割り当てられた論文を見ることなく、私たちの評価基準をパスする説得力のある回答を生成しました。当時、私は何も変更しませんでした。5年後、AIエージェントは私のすべての課題をこなせるようになり、私はそのコースのほとんどの評価を再設計しました。学生に学んでほしい内容はほとんど変わっていないにもかかわらずです。戦略は常に同じです。自宅でできることはもう理解度をテストせず、代わりにTAとのやり取り、試験、ビデオデモに焦点を当てます。これらの変更の一部は、エビデンスに基づいた最良の教育実践に違反していますが、それでも私はそれらを行いました。 ここ数年、私は主に「本番環境での機械学習」というコースを教えてきました。これは、MLモデルを中心とした本番対応のソフトウェア構築に関する上級コースで、MLOpsに重点を置いており、通常は100〜170人の学生が受講します。最近、他の教育関係者と話す際によく聞かれる質問は、生成AIとコーディングエージェントの時代にどのように教育を変えたかということです。そこで、私たちが何をしたかを概説しましょう。 私たちは、変化するAIのイノベーションとツールに合わせて、扱われるトピックをシフトさせましたが、学習目標全体にはほとんど触れていません。このコースが初級コースではなく、学習目標がコードを書くことや特定のツールを使うことではないことを幸運に思っています。それらは、エンジニアリングのトレードオフ、リスクの予測と軽減、チームワークに関するものです。これらは、一部がモデルによってシミュレートされたりオフロードされたりする可能性があるとしても、依然として習得する価値のあるスキルだと考えています。(初級コースや従来のソフトウェアエンジニアリングコースを改訂する場合、学習目標はもっと大きくシフトするでしょう。) おそらく重要な点として、私たちは学生に、書面および口頭試験を除き、すべての設定で、あらゆる形式で、帰属表示なしでAIを使用することを許可しています。多くの場所でAIツールの使用を奨励さえしています。たとえ私たちが望んだとしても、AIを監視することは不可能だと思いますし、さらに重要なこととして、学生はこれらの技術の責任ある使用方法を anyway 学ぶ必要があると考えています。 AIは私にエビデンスに基づいた最良の実践を放棄させています まず、この点を明確にしておきます。これは、私たちが実際に行っていることよりも重要です。残念ながら、AIは、エビデンスに基づいたいくつかの教育実践(例:「How Learning Works」や「The ABCs of How We Learn」を参照)を積極的に損なっています。例えば、エビデンスは、少数の高リスクな評価(例:試験)よりも、フィードバックを伴う頻繁な低リスクな評価(例:宿題、クイズ)を支持していますが、AIは低リスクな設定での実践を損ない、私たちを試験へとさらに押しやっています。 同様に、私は常に、学生が間違いを犯し、失われたポイントを取り戻すために限定された数の課題を再提出できるセーフティネットを提供していましたが(仕様評価や公平性のための評価のコア推奨事項であり、プロセスではなく学習成果に焦点を当てる)、AIによってこのプロセスが悪用されたと感じました。まず、何も考えずに生成された課題の解答を提出し、再提出のために評価で指摘された問題点だけを見るというものです(AI使用コストの外部化の典型的な話)。その結果、私たちはそれ以来、再提出に10%のペナルティを課しています。 また、授業中のやり取りは、早期の低リスクな設定で教材に取り組むことを可能にしますが、AIを使用すると、多くの学生グループがディスカッションの質問をモデルにオフロードしているのを目にしました。ペンと紙での提出でこれを修正することは可能ですが、評価の負荷が増えることに加えて、学生へのストレスが増加し、低リスクな環境から遠ざかり、フィードバックが遅れることになります。 一般的に、これはバランスを取る行為であり、悪用される可能性があるにもかかわらず、私は低リスクで反復的なやり取りを維持する方に傾いています。はい、一部の学生は深い学習なしでクラスを通過するでしょうが、それは学びたい学生にとってより良い環境を提供します。私は、ドイツで学生時代に経験した、ほとんど任意で宿題があり、学期の終わりに成績の100%を占める単一の試験しかなかったモデルに戻りたくありません。それは、自発的で試験学習が得意な学生(私のような)には良かったかもしれませんが、失敗率と中退率が50〜80%でした。 読んでくれてありがとう!新しい投稿を受け取り、私の仕事をサポートするために無料で購読してください。 購読する 書面による考察 → 15分間の会話 さて、コースの実際の変更点に移りましょう。私は、書面での回答を必要とする課題のすべての部分を諦めました。私はまだソリューションを説明し、関連するコードフラグメントへのリンクを貼るレポートを求めていますが、それは単にソリューションをナビゲートするためであり、それらのためのAI生成ドキュメントを受け取ることに問題はありません。対照的に、「困難だった点は何か?」「チームワークをどのように改善するか?」といった考察文書や、読解クイズでの「シナリオXについて、論文で議論されている4つのデータカスケードのうちの1つに関連する、予想される可能性のあるデータ品質の問題を1つ特定してください…」といったものは無意味になり、完全に委任できるようになりました。評価ルーブリックを隠すことを除けば、LLMに完全にオフロードできるような良い回答に期待することを述べる方法はありません。 私がほぼすべての課題の一部としていた書面による考察については、今ではTAとの対面でのやり取りに移行しました。各課題の後、各学生はTAとの15分間のミーティングをスケジュールし、ライブでの会話でいくつかの質問に答える必要があります(スタンフォード大学のcs221が今学期、同様のアプローチを管理された実験で評価しているようです)。私はまだ課題で考察のプロンプトを、私たちが尋ねる質問の例として共有しています。学生はまだLLMで最初の回答を生成できますが、その一部を暗記する必要があるかもしれません。そして、私たちはフォローアップの質問で彼らに挑戦しようとします。チェックインミーティングは課題の一部であり、現在、課題ポイントの20%を占め、合格/不合格で採点されます。失敗した場合、学生は再試行でき、私はTAにかなり高い基準を持つように奨励しています。通常、最初の試行でかなりの数の学生が不合格になります。 この設計には欠点がありますが、全体として、私はトレードオフに満足しています。ペナルティなしの再試行は、口頭でのやり取りのTAによる採点に関する公平性の懸念を減らします。より厳格なTAは学生の時間を使いますが、ポイントは使いません。口頭でのチェックインは、不安のある学生にはより多くのことを要求しますが、筆記試験も同様であり、正式な障害者対応は両方のケースで道を提供できます。実際、技術的な作業に関する専門的なコミュニケーションは学習目標であり、口頭でのチェックインは書面による考察よりもそれを訓練します。規模に関して:私たちは、学生とTAの比率が20:1で、TAあたり週に約10時間の作業量でコースを実行しています(幸運なことに知っています)。そのため、チェックインは2週間ごとにTAあたり約300分に相当し、これは実行可能です。 読解クイズについては、私はただ諦めました。授業での対面式のペンと紙のクイズは、ストレスや不必要な暗記作業の原因となるほど価値があるとは思いませんでした。私は実際にかなりの間、オンラインの読解クイズを維持していましたが、それは私が学生に論文を見てほしいというシグナルを送るためだけで、ほとんどの学生がLLMに尋ねるだろうと完全に理解していました。最近では、まだ読書課題を出していますが、その数は半分になり、ポイントは付いていません。代わりに、読書からの教訓を授業中の議論に統合しようとしています。それでもほとんどの学生は読書をせず、クラスでその時点に達したときにLLMに尋ねるだけですが(だからその点では何も変わっていません)、そうする人はそれからより多くを得るかもしれません。 些細な注意:一部の学生がライブディスカッション中にAIを使用したことを観察しました(例:Cluely)。その結果、将来的には対面式のチェックインのみを提供する可能性があります。 コーディングタスクについて:コード + ビデオ + 対面での知識チェック 私たちは毎週ラボを実施しており、新しいツール(例:Kafka、Grafana、Docker、Weights and Biases)を探索するための低リスクで小規模なタスクです。これらのタスクは必然的に小規模にスコープされており、初心者の学生を支援する必要があります。そのため、明らかに簡単に...