生成式大语言模型(Generative Large Language Models,Generative LLMs,通常简称LLMs)是一种在大规模语料库上预训练的人工智能模型,为心理测量学领域带来前所未有的机遇和挑战。本文通过整合人工智能与心理学交叉研究发展脉络,总结LLMs赋能心理测量学的显著优势,定位LLMs在心理学应用中的重要挑战,并提出基于LLMs的心理测量研究发展方向。具体地,LLMs能够基于上下文生成连贯的自然语言文本,具有改变传统测验交互方式的潜力;LLMs突破对超长文本和多模态数据的处理能力,其强大的内容理解能力能够全面获取和分析被试的心理信息;LLMs有助于实现实时分析和个性化反馈,促进从结果评价向过程评价的转变。尽管LLMs的实际应用面临着稳定性、创造性和拓展性等挑战,但在情境判断测验生成、合作式问题解决能力评估、心理健康智慧诊疗和试题质量分析等领域展现出广阔的应用前景和研究价值。
2 LLMs赋能心理测量学的优势 2.1 LLMs改变心理测验交互方式 随着技术的发展,心理测验的交互形式经历了巨大的变革,从纸笔测验到计算机化测验,再到如今个体可以通过对话式智能技术与计算机进行交互。本节将简要介绍测验形式的发展历史及其特点,探讨基于LLMs的新型交互方式对心理测量范式的推动作用。 (1)纸笔化心理测验 纸笔测验的历史非常悠久,是最早的心理测验形式,其交互方式以纸笔为载体。心理学领域普遍认为比奈和西蒙在1905年构建了世界上第一个现代智力测验(Boake,2002;Matarazzo,1992),但早在1000多年前,我国就有广泛使用纸笔形式的选拔性考试的记录(张厚粲,骆方,2020)。纸笔测验通常是固定格式的,考生依次回答预设的固定题目,其题目形式包括选择题、判断题、配对题、填空等客观题,或是需要文字表述的开放式主观题(Berry,2008)。 (2)计算机化心理测验 随着计算机和网络的普及,计算机化测验使得心理测验的交互方式更加灵活,除了纸笔测验中的常规题目,计算机化测验允许更复杂、更贴合现实情境的题目。例如,PISA(Programme for International Student Assessment)在2012年新增问题解决测验,使用符合生活场景的应用题等形式,为高阶能力测评提供更多可能性;2015年应用固定式人机交互题目实现对合作问题解决能力的测量等(OECD,2013,2017)。游戏化测评和基于游戏的测评也是计算机化测验发展中的重要产物,结合游戏的趣味性和吸引力,能有效降低测验的焦虑(DeRosier & Thomas,2019;Mavridis & Tsiatsos,2017),游戏中的过程性数据和得分数据可用于评估被试的人格特质和认知能力,有较大的测评应用潜力(Haizel et al.,2021;Kim et al.,2016;孙鑫等,2018)。计算机化自适应测验(Computerized Adaptive Test,CAT)结合了计算机和IRT技术,能够根据考生的反应即时选择适合其能力水平的题目,从而减少不必要的题目数量,缩短测验时间,提高测验的效率,还可以实现跨题目、跨时间的等值,CAT目前在GRE(Graduate Record Examinations)、GMAT(Graduate Management Admission Test)、Duolingo等国际大型测验中被广泛使用。