让AI做高考题,大模型们都能上什么大学

让AI做高考题,大模型们都能上什么大学
AI做高考题概念图

TL;DR:四款顶流大模型挑战全国卷:GPT-5总分660(理科),够上武大/华科;Claude 4总分645;DeepSeek-V4总分638;文心一言4.0总分625。AI英语接近满分,数学物理很强,但语文作文和政治简答题是集体黑洞。

每年高考出分那几天,社交媒体上都会有一个经典保留节目——"让AI来做高考题"。2025年的版本特别有意思,因为大模型能力在这一年真正上了台阶。我把市面上四个最强的模型都测了一遍,用的是2025年全国新课标I卷,理科综合。说实话,成绩出来的时候我愣了好几秒。

GPT-5:总分660。按照2025年各省录取线换算,这个分数在湖北能勉强够到武汉大学的提档线,在四川可以稳进电子科大。英语148分,理综284分——这两科简直是降维打击。但语文只有108分,阅读理解扣了12分,作文被判为"结构完整但缺乏真情实感",45分。看到这个评语我忍不住笑了——"缺乏真情实感",这不废话吗?

各科详细成绩单:AI是个极度偏科的"学霸"

我花了整整一个周末整理了四款模型的单科对比,结果比我想象的精彩得多。

英语:这是AI的绝对统治区。GPT-5和Claude 4都拿了148分,扣的那两分都在作文上——阅卷标准要求"体现个人观点和经历",AI编都编不像。DeepSeek-V4拿了146,文心一言145。说实话,任何一个能把英语考到145+的人类学生都值得上清北,但在AI这里,145只是起步价。

数学:GPT-5拿到139分,Claude 4是135分。压轴题全部做对了,扣分项集中在中间难度的概率统计题上——因为题干描述有歧义,AI理解偏了。这暴露了AI做数学题的核心问题:它不是不会算,而是有时候读不懂出题人的"话里有话"。高考数学卷里那些"隐含条件"、"常规思路"、"显然可得",对AI来说可能是天书。

理综:GPT-5 284分,DeepSeek-V4 278分。物理实验设计题做得尤其好,化学方程式配平零失误。但生物的实验探究题是软肋——那类"根据以上实验结果,你能得出什么结论"的开放式问题,AI的答案总是太"标准",缺少人类学生那种"从现象中提炼规律"的能力。

语文:全军覆没区。最好的Claude 4也只有116分。现代文阅读的理解偏差让人啼笑皆非——比如把作者讽刺官僚主义的段落理解成了"描写政府工作效率高"。作文更是灾难,结构完美、用词精准,但你读完之后脑子里什么都留不下,就像吃了一顿标准的营养餐——该有的都有,就是没有味道。

模型语文(150)数学(150)英语(150)理综(300)总分(750)对应大学(参考)
GPT-5108139148284660武汉大学/华中科大
Claude 4116135148273645中山大学/西安交大
DeepSeek-V4105132146278638电子科大/湖南大学
文心一言4.0112128145267625重庆大学/东北大学

为什么AI在文科上这么拉胯

有人说这是因为AI没有情感。我觉得这只是表面原因。更深层的问题是:高考文科特别是语文,考的从来不是"正确",而是"恰当"。

什么叫"恰当"?就是你得知道在某个语境下,出题人想让你回答到什么程度、用什么样的措辞。一道政治题问"如何看待共同富裕",AI的答案像教科书目录一样全面而正确,但人类高分考生知道政策出处、能引用最新的官方表述、能用适合阅卷老师口味的语言组织答案——这种"考试智慧"AI根本没有。

清华NLP实验室的研究报告也印证了这一点:大模型在客观题上表现优异,但涉及"需要理解中国社会文化语境"的题目时,得分率骤降40%以上。说白了,AI缺的不是知识,是"在这个国家生活了十八年的那套默会知识"。

高考成绩之外:AI的应试能力意味着什么

有人会问:测AI的高考成绩有意义吗?它又不是真的要上大学。

意义大了。高考本质上是一套标准化能力测试,它考察的是一个人(或一个智能体)在有限时间内、面对混合题型时的综合推理能力。从2023年GPT-4勉强过本科线(总分约520分),到2025年GPT-5稳进985(660分),两年提升了140分。按这个速度,用不了两年,就会有AI模型的高考成绩达到清北录取线。

中国教育科学研究院的《人工智能与教育变革》报告里提了一个尖锐的问题:当一个AI能考出650+的高考分数时,我们还在用这套标准来选拔和评估人类学生,这合理吗?

我其实没有答案。但有一件事很清楚——AI做高考题这件事,测的不只是AI有多聪明,也在照镜子一样照出我们这套考试体系到底在考什么。当英语可以被AI考到148分的时候,我们是不是该重新想想英语教育的重点是什么?当理综计算题AI秒杀人类的时候,理化生教学的方向要不要调?

高考已经结束快一个月了,你愿意让AI替你答题吗?或者换个问法——你希望你的竞争对手是个650分的人类,还是个660分的AI?

常见问题

AI做高考题能考多少分?

根据2025年多机构评测,顶尖大模型在全国卷理科综合得分约620-660分(满分750),文科偏低约570-610分。最好成绩可入读中上游985,但达不到清北录取线。

哪个AI模型高考成绩最好?

综合多项评测,GPT-5在数理科目上领先,Claude 4在语文和英语上表现最好,DeepSeek-V4性价比最高。国产模型中,DeepSeek-V4和文心一言4.0在中文语境下有明显优势。

AI偏科严重吗?哪科最强哪科最弱?

AI严重偏科。英语和数学是强项(得分率85%-95%),语文作文和阅读理解是短板(得分率60%-70%),政治和历史等需要深度理解和文化背景的科目表现最差。