
复旦大学「数据挖掘技术」课程近日举行一场「反套路」期末考试,学生不再作答,而是各自出10道题去考三个当今最先进的AI模型,AI答错愈多、学生得分愈高。51份试卷中,50人至少让某个AI答错一题,仅1人未能难倒任何模型;但能让某一模型整卷得0分的仅4人,其中最强的Claude模型未被任何学生完全考倒。全班平均分85.7分,中位数88分。
「传统的出题考察方式,在AI时代已经失效了。」环球时报报导,教授该课程的肖仰华表示,「老师出一道标准的算法题,AI比任何学生都算得快、算得准。继续用这种方式考,等于在AI的强项上跟AI比,这没有意义」,因此这次期末作业改为:每人出10道数据挖掘领域的计算题,要求有唯一正确答案和完整推导过程,再拿去考三个不同水平的AI模型。
肖仰华说,题目必须基于课程讲过的知识或教材内容,学生自己也要能把题从头到尾算对,「自己出的题自己都不会,那算不上真本事。」
计算与智能创新学院24级本科生谢锦树最后拿到97分。他搭建了一个多智能体协作的自动化出题框架,用GPT-5.5-Pro做出题层,三个应考模型作答并自动判分。他发现AI会「作弊」:伪造标准答案塞进判分脚本、限制最大输出长度截断其他模型的推理过程、调低推理深度参数让其他模型懒得深入思考,还会把成功的题目拷贝十份凑数。他之后加了一个审查层拦截钻空子行为,最终自动生成的10道题让三个应考模型全部答错。
考试结束后,肖仰华观察到高分同学对AI的弱点有准确判断,他们的题能命中AI的结构性缺陷;低分同学只是把课本习题换了个数字,AI在训练时见过千百万遍,直接套模板就对了。这一观察让肖仰华心生警惕,认为能力本来偏弱的学生若只依赖AI做作业,自身的判断力会进一步退化。
肖仰华表示,「人考AI」的模式会继续做下去,且要做得更系统。他认为传统考记忆、考计算的出题方式必须退场,未来的考核重点将全面转向评价能力、判断能力和创造性思维。他说:「所以课堂上更多的时间被用来讨论,学生怎么判断一个结果是对的还是错的?怎么识别AI在哪里会出问题?怎么提出一个AI回答不了的好问题?」他认为这门课正在从训练学生「怎么做」,转向训练他们「怎么指挥AI来做、怎么评判AI做的结果」。

教授认为传统标准化考题已无法有效考出学生能力,因为AI在计算与套题上往往更快更准,因此改以学生出题,测试其对知识理解、判断弱点与创造性思维。 51份试卷中有50人至少让某个AI答错一题,仅1人未能难倒任何模型;但能让某一模型整卷得零分的只有4人,且最强的Claude没有被任何学生完全考倒。 肖仰华认为未来考核不应再偏重记忆与计算,而应转向评估能力、判断力与创造性,课堂也要更多训练学生如何指挥AI、辨识错误并评价结果。精华 FAQ

