
中华医学教育杂志 ›› 2026, Vol. 46 ›› Issue (8): 628-635.DOI: 10.3760/cma.j.cn115259-20250729-00842
刘侃1, 郑淑园1, 王振禹2, 刘子冬2, 杨海2, 田甜3
Liu Kan1, Zheng Shuyuan1, Wang Zhenyu2, Liu Zidong2, Yang Hai2, Tian Tian3
摘要: 目的 探讨生成式大语言模型(large language model,LLM)辅助提升基础医学试题质量的效果。方法 选取空军军医大学2013至2024年“基础医学综合测试”试题2 520道,依据答对率、区分度和干扰项选择率从中筛选出64道存在问题的试题。采用思维树框架设计3套提示词工程,通过ChatGPT-4o模型生成121道新试题,经过专家组人工调优后随机抽取48题编入实际考试进行实测。采用Wilcoxon符号秩检验比较答对率和区分度的差异,采用Fisher精确检验比较干扰项选择率的差异。结果 生成试题的平均答对率由0.218 1提升至0.444 2(P<0.001),平均区分度由0.082 1提升至0.146 9(P=0.019)。异常干扰项结构显著改善:无选择率>30%干扰项的试题由27.1%(13/48)增至54.2%(26/48),无选择率<5%干扰项的试题由41.7%(20/48)降至33.3%(16/48),其差异均具有统计学意义(均P<0.05)。72.7%(88/121)的生成试题需要人工调优,主要涉及选项设计缺陷[44.3%(39/88)]和题干表述问题[30.7%(27/88)]。结论 LLM在基础医学试题命制中具有良好的应用潜力,通过标准化提示词工程设计和人工调优流程可以有效提升试题质量,但仍然需要专业人员深度参与质量控制。
中图分类号: