2026年高考期间,12款国内外一线大模型全面接受了语文和数学真题的考验,旨在评估当前AI技术在学科理解和解题能力上的表现。此次测试得到了多位经验丰富的高中教师的协助,尤其在语文科目上,通过多人的共同评分保证评分的公平与客观。

测试模型及其选择背景

此次参测的AI模型覆盖了市场上主流与旗舰级产品,具体包括国外的Claude Opus 4.8、GPT-5.5、Gemini 3.1 Pro,以及国内的千问3.7 max、文心Ernie 5.1、星火Spark X2、智谱GLM5.1、Kimi k2.6、MiniMax M3、DeepSeek V4 Pro、小米MiMo v2.5 Pro和混元3等。

测试流程与阅卷安排

由于语文试题相较数学存在主观性评判的特点,主办方邀请了3位具有阅卷经验的语文教师和1位数学教师共同参与评分工作。多人评分的方式确保了结果的客观性和均衡性。语文试题依据由中国考试官方发布的部分试题与参考答案调整得出,满分为100分,随后换算为150分制。数学试题则是完整的全国卷真题。

测试过程与教师贡献

参与阅卷的老师们工作十分投入,深夜仍坚持认真批改全部AI模型的答卷,对此次测试提供了专业支持和保障。多位老师的共同参与为AI模型成绩评定提供了权威参考,也为测试增加了严谨性。

预计影响及后续关注点

此次利用高考标准试题对AI模型的语文与数学能力进行系统评测,有助于更客观地了解当前AI技术在教育辅助领域的实际效能与局限。未来,随着题库的完善及评判体系的升级,AI在教育中的辅助角色将更加突出。本次测试结果将对AI模型在教育场景中的进一步应用提供重要参考,也值得持续关注AI与传统教育的深度融合进程。

文章来源:https://finance.sina.com.cn/cj/2026-06-08/doc-iniasfpu5655196.shtml

所属栏目:{typename type="name"/}