用一款被作者自己点名"过时"的模型跑出来的东西,居然能跟高风险标准化考试掰手腕——这件事本身就值得停下来看一眼。研究团队把 o3-mini 塞进一套智能体循环里反复生成、修改考题,结果在心理测量学属性上和真正上考场的高风险试题处在同一档。这不是某次随手试出来的巧合,而是被作者称为迄今最大规模的 AI 生成考题实地研究之一。
有意思的正是"过时"这两个字。o3-mini 在大模型更新表里早就被甩开了好几轮,按常理它出的题应该一眼就看出机器味。但放进智能体循环加上迭代打磨之后,题目的难度分布、区分度这些统计指标居然达标了。决定质量的不是模型的版本号,而是你愿不愿意花时间给它搭一套靠谱的工作流。
对真正用 AI 备课、出题的人来说,信号很具体:心理测量学属性达标,意味着 AI 出题已经跨过"看起来像题"这道坎,进入到"经得起统计检验"的阶段,离正式考试场景又近了一步。老师、培训机构、考试院这些跟命题打交道的人,可能比自己预想更早面对"要不要让 AI 进场"的选择。
当然也要留个心眼。材料没说清这次研究覆盖哪些学科、哪些题型,也没披露有没有经过同行评审。所以在把结论往外推之前,先把它理解成"方法可行"的强信号,而不是"AI 已经能替代命题组"的定论。
我的判断是:模型新旧不是决定性变量,方法与流程的提升空间远比换一个大模型来得大。你更想看到 AI 出题先去啃哪类考试——职业资格、学科统考,还是语言测试?
