报告人:马月(美国特拉华大学)
报告时间:2026年9月17日 (周四)下午16:00-17:00
报告地点:6号楼C204
报告摘要:本研究考察大语言模型(LLM)能否作为系统性"第二评分者",协助研究者对388名初中生的1,116条数学问题提出回答进行质性分类与整体量化评分。通过迭代式提示词优化,LLM与人类参考编码的一致性显著提升,分类任务κ最终达到.760,评分任务达到.705。对分歧案例的事后审查发现,部分人类参考编码本身也存在不一致,说明分歧不仅来自模型错误,也来自编码规则的模糊之处。研究提出将人类–LLM比较作为检验编码框架操作清晰度的一种方法,同时强调一致性的提升不等于构念效度的确立,LLM的判断不能替代研究者的解释与判断。
专家简介:马月博士,毕业于美国特拉华大学教育学系。她的研究以数学教育为核心,聚焦于数学问题提出、教师专业学习、学生认知与情感投入,以及人工智能在教育研究中的应用。已在数学教育领域发表了多篇同行评审论文,研究成果见于《数学教育研究杂志》(Journal for Research in Mathematics Education)和《ZDM-Mathmatics Education》等国际数学教育顶级期刊上发表多篇论文。她希望通过自己的学术工作,将深入的学术探究、实践价值与对教与学的持久关注紧密相连。