如果把一整套高考数学卷交给当前主流大模型,并且禁止联网、禁止互相抄答案、只允许提交一次,它们能考多少分?
这一次,我没有问大模型几个零散的数学问题,而是认真布置了一间“AI 高考考场”。
统一试卷、统一规则、同时开考,甚至还安排了一个单独的模型担任监考官。
最终结果有些出乎意料:
- GPT-5.6:150 分
- Opus 5:150 分
- Kimi K3:150 分
- Codex:143 分
- Cursor Grok 4.5:141 分
- GLM 5.2:94 分
同一张试卷,最高分与最低分相差了 56 分。
高考数学考场
一、先准备一张所有模型都能读懂的试卷
本次使用的是 2025 年普通高等学校招生考试(新高考 I 卷)数学,适用地区包括山东、广东、湖南、湖北、河北、江苏、福建、浙江、河南、江西、安徽。
原始 PDF 不只是文字和公式,还包含表格、坐标图与立体几何图形。如果直接读取 PDF,部分模型可能遇到根号、分数、希腊字母或图形信息识别错误。
因此,正式开考前,我先把整套试卷整理成统一的 Markdown:
- 全卷共 19 题;
- 数学公式统一使用 LaTeX;
- 表格转换为结构化 Markdown 表格;
- 原卷图形保留为图片;
- 每张图额外补充纯文字描述;
- 清除 PDF 文字层中的乱码、断行和 OCR 错误。
所有模型读取的都是同一份文件:
exam_2025_math_clean.md
这一步非常重要。否则最后比较的可能不是模型的数学能力,而是谁更擅长猜测乱码。
二、考场规则:不联网、不互抄、只能交一次
为了尽量接近一次真实的限时考试,我给所有参赛模型设置了相同规则。
我的原始要求
- 所有模型统一使用
exam_2025_math_clean.md; - 考试期间禁止网络检索答案;
- 只能依靠模型自身能力完成试卷;
- 目标答卷时间为 5 分钟;
- 禁止读取或参考其他模型的答案;
- 每个模型只允许提交一次;
- 提交后不允许二次演算或修改答案;
- 只提交最终答案,不展示完整推理过程;
- 不允许修改原始试卷文件;
- 由 Composer 2.5 担任独立监考官。
原计划参赛阵容包括:
- GPT-5.6
- Opus 5
- Kimi K3
- Codex
- Gemini 3.5 Flash
- GLM 5.2
- Cursor Grok 4.5
不过,实际执行时 Gemini 3.5 Flash 不在当前可用模型列表中。为了不擅自更换型号,本次没有用其他 Gemini 版本代替,所以最终共有 6 名考生入场。
三、开考:6 个模型同时作答
6 个模型在同一个并行批次中启动,分别独立读取试卷。
监考官 Composer 2.5 不参与答题,只负责核对规则和记录可观察到的行为。它确认了试卷路径有效,并且自身没有修改试卷或输出答案。
但这里必须说明实验边界:
- 系统没有记录每个模型精确到秒的作答耗时;
- 聊天时间戳只能确认整批答卷在约 6 分钟的窗口内返回;
- 因此不能严格证明每个模型都在 5 分钟内完成;
- 每个模型都只有一次提交记录,没有再次交卷或修改答案;
- 模型内部是否自行验算,无法从外部技术审计;
- Kimi K3 的答卷中可以看到少量中间式,其他模型主要提交最终结果或简短结论。
换句话说,我能够确认“没有二次提交”,但不能把“模型内部从未回头检查”当成已经证实的事实。
四、阅卷标准:满分 150 分
考试结束后,阅卷阶段允许联网,用于交叉核验公开答案和题型分值。
本卷采用新高考 I 卷常见的 150 分结构:
| 题型 | 题号 | 分值 |
|---|---|---|
| 单项选择题 | 1—8 | 40 分 |
| 多项选择题 | 9—11 | 18 分 |
| 填空题 | 12—14 | 15 分 |
| 解答题 | 15—19 | 77 分 |
| 总计 | 1—19 | 150 分 |
解答题采用以下题目总分:
- 第 15 题:13 分
- 第 16 题:15 分
- 第 17 题:15 分
- 第 18 题:17 分
- 第 19 题:17 分
为了比较模型的最终解题结果,本次排名使用的是 “最终答案正确度评分”:最终结论正确,就按照对应小问计分。
这不等于真实高考卷面分。
真实高考明确要求解答题写出文字说明、证明过程或演算步骤。由于我在考试规则中要求模型“只提交答案”,证明题缺少完整过程,若严格按照真实高考阅卷,它们不可能仅凭一句“结论成立”拿到全部过程分。
因此,本文成绩代表的是:
模型最终答案的正确程度,而不是一张符合高考书写规范的正式答题卡得分。
五、成绩公布:3 个满分
| 排名 | 模型 | 客观题 | 解答题 | 总分 |
|---|---|---|---|---|
| 1 | GPT-5.6 | 73/73 | 77/77 | 150 |
| 1 | Opus 5 | 73/73 | 77/77 | 150 |
| 1 | Kimi K3 | 73/73 | 77/77 | 150 |
| 4 | Codex | 73/73 | 70/77 | 143 |
| 5 | Cursor Grok 4.5 | 73/73 | 68/77 | 141 |
| 6 | GLM 5.2 | 57/73 | 37/77 | 94 |
最醒目的结果不是第一名,而是前三名同时拿到了满分。
GPT-5.6、Opus 5 和 Kimi K3 的答案完全命中。更值得注意的是,它们不仅基础题和客观题正确,后面的数列、立体几何、椭圆和三角函数压轴题也给出了正确结果。
Codex 和 Grok 4.5 的客观题同样全部正确,差距主要出现在解答题最后阶段。
GLM 5.2 则从第 11 题开始出现明显失误,最终停在 94 分。
交互式成绩面板:2025 Math Model Grading
六、它们分别错在了哪里?
GPT-5.6、Opus 5、Kimi K3:全部命中
三者在最终答案层面没有发现错误,均得到 150 分。
但需要再次强调:其中涉及证明的题目只提交了结论,不能据此断言它们在真实高考阅卷中也会获得满分。
Codex:倒在椭圆题最后一问
Codex 前 17 题以及第 19 题均与正确答案一致。
它唯一的错误出现在第 18 题第(2)问第②小问:
- Codex 作答:约 $5.515$
- 核验答案:$3\sqrt3+3\sqrt2$
该小问扣 7 分,最终得分 143 分。
Cursor Grok 4.5:两处失分
Grok 4.5 的客观题全部正确,但解答题出现两处问题:
- 第 15 题独立性检验的 $\chi^2$ 统计量多了一位数量级,但“检查结果与患病有关”的结论正确,因此只扣部分分;
- 第 18 题最后一问最大值错误。
最终得分 141 分。
GLM 5.2:错误开始连锁出现
GLM 5.2 的主要失分包括:
- 第 11 题多选题出现错选;
- 第 12、14 题填空错误;
- 第 16 题第(2)问结果错误;
- 第 17 题空间角结果错误;
- 第 18 题后两问错误;
- 第 19 题第(1)、(3)问错误。
它的前 10 题与其他模型保持一致,但进入后半卷后,错误数量明显增加,最终得分 94 分。
七、这场测试能说明什么?
1. 当前头部模型已经具备很强的高中数学结果输出能力
在统一输入、禁止联网、完整试卷和短时间约束下,3 个模型给出了全卷正确答案。
至少从“得到最终结果”这一维度看,它们已经能稳定处理:
- 复数、集合与函数;
- 向量和解析几何;
- 概率统计与数列;
- 立体几何;
- 椭圆综合题;
- 三角函数压轴题。
2. 客观题已经很难拉开头部模型的差距
GPT-5.6、Opus 5、Kimi K3、Codex 和 Grok 4.5 的客观题全部得到 73 分。
真正产生差距的是解答题,尤其是第 18 题椭圆综合题。Codex、Grok 4.5 和 GLM 5.2 都在这道题的后半部分失分。
3. “答案正确”与“会不会证明”不是同一件事
本次测试为了控制输出长度,要求模型只提交答案。
这适合比较最终结果,却不适合评价完整的数学表达、推导严谨性和证明能力。一个模型可以猜中或算出结论,但如果不能提供可检查的推理链,就不能直接等同于真实考生的满分答卷。
4. AI 测评首先要控制输入质量
如果每个模型读取到的公式、表格和图形不一致,那么排行榜没有意义。
这次测试中,先把 PDF 清洗为统一 Markdown,再让所有模型同时读取,是整个实验成立的基础。
八、这次实验仍有哪些局限?
这不是一项严格的学术基准测试,至少存在以下限制:
- 每个模型只运行了一次,无法反映多次采样下的稳定性;
- 没有记录单模型精确耗时;
- 不能审计模型内部是否自行验算;
- 模型只提交答案,无法完整评价证明过程;
- 解答题小问分值采用模拟拆分,并非教育考试院公开的逐步采分细则;
- Gemini 3.5 Flash 因当前环境不可用,未实际参赛;
- 本次成绩只对应当前试卷、当前提示词和当前模型版本,不能直接推广到所有数学任务。
如果要继续完善这项测试,下一轮至少应该加入:
- 每个模型重复测试 3—5 次;
- 记录准确开始时间、结束时间和首字延迟;
- 同时保留“只交答案组”与“完整过程组”;
- 使用盲审方式对证明题单独评分;
- 在不改变原意的前提下,准备不同排版版本,测试模型对输入形式的敏感程度。
九、最后
这场 AI 高考最有意思的地方,并不是“某个模型拿了满分”。
真正值得关注的是:当输入被认真整理、规则被统一之后,头部模型之间的差距已经被压缩到少数几道综合题上。
它们在基础题上的表现越来越接近,决定排名的,开始变成复杂推导中的稳定性。
而这也提醒我们:
测试大模型,不能只随手问一道题。
要给它完整试卷、统一规则、独立考场,以及一套能够被复核的评分标准。
下一次,我准备让它们挑战另一年的高考数学。
到时候,是继续出现多个满分,还是会有新的模型翻车?
下一次还会出现三个满分吗?
附:本次实验信息
- 试卷:2025 年新高考 I 卷数学
- 试卷格式:清洗后的 Markdown
- 实际参赛模型:6 个
- 监考模型:Composer 2.5
- 考试阶段网络:禁止
- 阅卷阶段网络:允许,仅用于交叉核验
- 提交次数:每个模型 1 次
- 精确作答耗时:未记录
- 评分口径:最终答案正确度评分
- 满分:150 分
参考资料
注:公开答案和解析可能来自教育机构或教师整理,本文已结合独立演算交叉核验。解答题模拟小问分值不代表教育考试院正式评分细则。