9月24日、The Last Software Engineerが「How I changed teaching after AI managed to do all my homework assignments」と題した記事を公開した。カーネギーメロン大学の講師がAIによる課題代行を受けて授業設計を根本から作り直した経緯を詳述した内容で、TAとの口頭面談への切り替えや採点コストの50〜80%削減など、具体的な数字を伴う実践知が紹介されている。「AIを禁止するのではなく、家で行う評価そのものをやめる」という逆説的な結論が、エンジニアリング教育の現場でどのように機能しているかが読みどころだ。
AIが課題を全部やってしまった
2021年、ChatGPT登場以前に、研究者のVincent Hellendoornが講師にGPT-3を使った実験を提案した。結果、GPT-3は実際の論文を読まずに読解クイズの模範解答を生成し、採点基準をパスしてしまった。そのときは何も変えなかった。だが5年後、AIエージェントはすべての課題をこなせるようになり、講師は多くの評価方法を作り直すことになった。
筆者が担当するのはMachine Learning in Production(MLIP)——MLモデルを本番システムに組み込んで設計・運用するいわゆるMLOpsを中心に扱う上級コースで、受講者は100〜170名規模だ。学習目標はコードを書くことではなく、エンジニアリングのトレードオフの判断、リスクの予測と軽減、チームワークであり、この点はほとんど変えていない。
戦略のコア:「家でやる評価」をやめた
変更の基本方針は一貫している。
「家で行う課題では理解を評価しない。TAとの対話、試験、ビデオデモに集中する。」
書面による振り返りをTAとの面談に置き換えた
最も大きな変更が、課題ごとの「振り返り文書」の廃止だ。「難しかった点は?」「チームワークをどう改善するか?」といった問いはLLMに完全委任できてしまう。現在は、各課題の後に学生がTAと15分の1対1の面談を設定し、口頭で質問に答える形式に切り替えた。
- 面談は課題全体の20%分の配点(パス/フェイル方式)
- TAは高い基準を設け、初回不合格者は多い
- 再挑戦はペナルティなし(TAの採点基準が厳しくても点数ではなく時間のコストになるだけ)
なおZoom上でのライブ討論中に学生がAIツール(Cluelyなど、会話内容をリアルタイムで読み取り回答を提示するAIアシスタント)を使うケースが確認されたため、今後はオンサイトの面談のみに限定する方向だ。
読解クイズは廃止
証拠に基づく教育学では、低リスクの頻繁なフィードバック(クイズや宿題)が高い学習効果をもたらすとされる(参考:How Learning Works)。しかしAIはこの「低リスク設定での練習」を骨抜きにする。読解クイズはほとんどの学生がLLMに丸投げしているとわかっていても長らく残していたが、現在は完全に廃止。課題数を半減し、授業内ディスカッションに組み込む形に移行した。
試験の比重を引き上げた
自宅で行う課題(宿題)から、授業内で行う評価(試験・参加)への比重シフトも進めている。試験の比率は15%から25%に引き上げ、今後さらに上げる可能性があるとしている。なお、ドイツの大学で著者自身が経験した「任意の宿題+学期末の一発試験で100%」という方式には戻りたくないとも言及している——学習意欲の高い学生には合うが、脱落率が50〜80%に達していたからだ。
採点にもLLMを使う「LLM-as-a-judge」
学生がAIで大量のコードや文書を生成できるようになると、採点側のコストが上がる。転機は1年前、TAが「コミットメッセージに『Authored by Claude Code』と書かれたコードを採点していて虚しくなった」と打ち明けたことだった。
ここで筆者が導入したのがLLM-as-a-judgeと呼ばれるアプローチだ。LLM(大規模言語モデル)を採点者として使い、ルーブリック(採点基準表)に照らして提出物を自動評価させる手法で、人間のレビューコストを大幅に削減できる一方、判定精度の担保が課題となる。筆者の実装ではルーブリック項目とソリューションの一部をLLMに与えて「パス/要レビュー」を判定させる仕組みを構築しており、TAの採点時間は50〜80%削減され、その分を学生との対面インタラクションに充てられるようになった。ただし、点数の減点は必ず人間のレビューを経てから行うというルールは守っている。
同様のアプローチを授業内ディスカッションの自動フィードバックにも展開。Slackのブレイクアウトセッションで学生が投稿した回答に対し、カスタムSlackボットがLLMを使ってフィードバックを返し、学生が回答を改善できる仕組みを整えた。プロンプトと動作例はgistで公開されている(※URLは元記事記載のものをそのまま転記。アクセス時にIDを確認されたい)。
課題のスコープをAIが詰まるレベルまで広げた
学生がAIを使えば小さなコードやテキストは簡単に生成できる。そこで課題の規模を「現状のAIエージェントが、より細かい誘導なしには解けない水準」まで拡大している。
例として、Instagramクローン(albumy、約1.2万行)にAI機能を追加する課題が取り上げられている。小規模なコードベースであればAIが単独でこなしてしまうため、複雑なシステムを対象にすることでAIだけでは完結しない状況を意図的に作り出している。
証拠に基づく教育学との矛盾を認めつつ
記事の冒頭で筆者が率直に述べているのが印象的だ。
「これらの変更のいくつかは、証拠に基づくベストプラクティスに反する。それでも実施した。」
低リスクの繰り返し評価が学習効果に優れることは研究で支持されているが、AIはその仕組み自体を機能不全にする。再提出による学び直しの仕組みも本来は有効とされており、specifications grading(「合格/不合格」の二値評価と再提出を組み合わせてより深い習熟を促す採点手法)でも推奨されている。しかしこのコースでは「とりあえずAIで提出→採点結果を見てからAIで修正」という行動に悪用されるようになったため、再提出には10%のペナルティを課すことにした。
AIによる課題代行の問題は日本の大学でも顕在化しており、対応策を模索する教育者は多い。この記事が示す「AIを禁止しない代わりに評価設計を根本から変える」というアプローチは、エンジニアリング教育に限らず参考になる視点だ。
詳細はHow I changed teaching after AI managed to do all my homework assignmentsを参照していただきたい。