2026年高考季正式来临,12款国内外主流顶级大模型首次联合进行了语文和数学两科的全真模拟考试。此次测试邀请了多位有阅卷经验的高中教师参与评分,旨在评估这些AI在应对传统高考学科方面的实际表现。
参赛AI模型概况
本次参与测试的AI模型涵盖了市场上的主流旗舰产品。国际阵营有Claude Opus 4.8、GPT-5.5和Gemini 3.1 Pro三款“御三家”模型;国内代表则有千问3.7 max、文心Ernie 5.1、星火Spark X2、智谱GLM5.1、Kimi k2.6、MiniMax M3、DeepSeek V4 Pro、小米MiMo v2.5 Pro、混元3等多款实力派模型,体现了当前人工智能技术的最新水平。
测试流程及评分标准
此次语文考试采用了中国考试官方发布的部分试题及参考答案,由三位有高考阅卷经验的语文老师联合评分,取平均分以保证评分的公正性。数学科目则使用了完整的全国一卷真题,由一位数学老师进行专业批改。师资团队为保持测试公正,每份试卷均认真批阅,最大限度还原真实考试评分环境。
测试背景及意义
近年来,AI在代码生成和智能代理等领域进展飞速,但其在语文和数学这类传统高考科目中的表现仍不明朗。此次大规模测试旨在探究不同AI模型间的语文理解与数学解题能力,评估AI技术在教育辅助和智能评测领域的潜力,推动人工智能与教育深度融合。
特别感谢参与阅卷的教师团队
本次测试能够顺利完成离不开四位资深高中老师的支持,他们针对12套卷子从晚间工作至凌晨,细致批改确保了评分的专业与严谨,展现了教师群体对AI教育研究的积极支持。
后续关注方向
- 未来AI模型在语文主观题理解、作文评分等方面的进一步提升。
- 数学答题过程中AI对复杂问题推理和创意解法的探索。
- 如何借助人工智能优化高考命题与评卷流程,提高效率与公平性。
- 推动AI技术助力教育个性化,提升学生学习质量和效果。
此次测试结果将为教育界提供有价值的参考,期待未来在AI与传统教学深度融合的道路上,看到更多创新应用的出现。
文章来源:https://finance.sina.com.cn/cj/2026-06-08/doc-iniasfpu5655196.shtml
所属栏目:{typename type="name"/}








