研究背景与AI性能反差

由瑞士联邦理工学院(EPFL)数学数据科学实验室领导的一项研究于2026年7月9日以预印本形式发布(论文编号arXiv:2607.08317v1)。研究指出,尽管当前人工智能系统能够解答博士水平的数学题、通过职业资格考试并在国际象棋和围棋中击败世界冠军,且在标准测试榜单中不断刷新高分,但在面对部分简单题目时仍会出现错误。

研究团队发现,AI在处理某些人类认为简单的任务时会产生反差,例如在要求写一段恰好31个字符的文字时可能数错,在要求画一只有五条腿的狗时可能画出四条或六条腿,以及在统计图片中飞机数量时给出错误答案。

盲点基准测试的设计与构建

研究团队认为,现有的测试体系存在盲区,导致标准考试无法充分暴露在日常使用中频繁出现的缺陷。为了系统地找出并量化这些盲区,研究人员设计了一套名为“blind-spots-bench”(盲点基准测试)的评测集,并对38个主流AI模型进行了全面评测。

该测试集的构建采用了让学生出题的思路。在EPFL一门研究生级别的人工智能课程中,研究人员要求学生提交每人五道“人类轻松能答,但前沿AI答不对”的题目。2025年10月前后,学生们共提交了约287道原始题目。

筛选流程与结果发布

研究团队对收集到的原始题目进行了严格的筛选和整理,具体措施包括:

  • 剔除重复的题目;
  • 剔除对人类而言也具有难度的题目,以维持“人类容易、AI困难”的对比核心;
  • 纠正表述不清楚的问题;
  • 为每道题设计详细的参考答案,其中明确了评判正确与否的标准以及AI易犯的错误类型。

经过筛选,最终形成的题库包含235道题目,并已在Hugging Face平台上公开发布。