
51 个学生,510 道题,三款大模型轮流答卷。
50 个人成功让至少一款模型翻了车。4 个人更彻底,把其中较弱的那款整张试卷考了 0 分。
这是复旦计算与智能创新学院肖仰华教授”数据挖掘技术”课的期末考。规则反了过来——学生出题考 AI,AI 答错越多,你分越高。他们在同一门专业课里练了整整一学期,才拿出这 10 道题。
510 道题指向的问题就一个:在 AI 能答大多数题的时候,人到底该学什么。

AI 能答题之后,出题考倒它有多难
有一件事你早就知道:ChatGPT 考过医师执照。通过了司法考试,通过了一门 MBA 课程的期末考。每出一条这类新闻,你叹口气,然后接着背书。
但问题没消失。你备考四年的知识,AI 几秒钟能给出,还比你给得准。那你这四年,到底在练什么?
肖仰华教授把这个问题直接放进了考卷。考的不是算法,是你对 AI 的判断力。
要让 AI 答错,你得搞清楚它怎么处理这类问题——它在哪里会自信地给错答案,哪些地方看着懂了但没真懂。靠背答案做不到,你得理解它的推理逻辑。
这门课测试了三款大模型,510 道题逐一过了一遍。相当于一次系统性的 AI 知识边界摸排。50 个人找到了至少一个缺口。三款模型里,有一款没被任何人完全击垮。
AI 不是无懈可击的。但你得主动去找,才看得见。
有人看到”50/51 成功”,第一反应是 AI 挺弱的。但这 51 个学生在复旦数据挖掘专业课里学了整整一学期,题目范围限定在课程教材内,而且必须有唯一正确答案——学生得先自己算出来才能出题。这是一个有限定条件的课程实验。
他们能找到缺口,是因为这门课逼着每个人在自己熟悉的知识范围里,认真去想 AI 到底会在哪里出错。那个缺口一直都在,只是你平时不去找。

答案不值钱了,验答案才值钱
我看完这个实验,第一反应是答案越来越不值钱了。
学生过去靠答题。AI 能替你答之后,稀缺的能力变了——你能不能发现答案哪里有问题,这比答题本身难。给答案,从脑子里提取已有的知识就行。检验答案,你得先知道它在哪里会出错,才能找到漏洞。
这 51 个学生设计那 510 道题,就是在画 AI 的错误地图。
在 AI 能答大多数题的今天,知道它哪里会答错,才是真的懂它。
想一下今后的工作。初稿、基本分析、代码框架,AI 越来越多地在做。这已经在发生。那人的价值在哪里?判断那份初稿哪里写错了,发现代码逻辑有问题,看出数据汇总可能带偏了结论。
这和期末考”出题让 AI 翻车”的逻辑很相近。你得知道它在哪里会出错,才能发现它出错了。这个能力没有捷径,是练出来的。
复旦这门课有它的前提——一门专业课、一个学期的训练、限定的题目范围。这个条件不是人人都有。但方向是清楚的:在你最熟的领域里去找 AI 的缺口,至少你知道它能帮你做什么、做不了什么。

肖仰华教授这门课,大概就是在试这条路。传统教育一直在考”你记住多少”。这场期末考换了个思路——AI 能答大多数题了,那就练怎么出题考倒它。
提出一个好问题,比背下一个标准答案,难多了。
复旦这 51 个学生,提前练了一遍。
你试过在自己最熟的领域出一道题,看看 AI 能不能答对吗?
数据来源
上观新闻(解放日报旗下)、复旦大学官网:《复旦”考倒 AI”期末:51 名学生出题测试三款大模型》(2026-07-05)
AIbase:《复旦数据挖掘技术课考倒 AI 期末数据报道》(2026-07-06)
NIH/PubMed:系统性综述《大语言模型在临床医学中的表现:系统评价与 meta 分析》(GPT-4 医学执照考试整体通过率 81%)
ABA Journal:《ChatGPT Passes the Bar Exam》(GPT-4 美国统一律师考试位列第 90 百分位)