DOI:10.12154/j.qbzlgz.2026.03.009 1 引言 在学术出版领域,同行评议在提升学术论文质量方面发挥着关键作用。然而同行评议制度存在着审稿人认知局限、精力不足的缺陷[1]。大语言模型(Large Language Model,LLM)为全自动学术论文评审的实施带来了巨大潜力[2]。研究者开始探索利用LLM来缓解传统同行评审压力[3],顶级国际会议也逐步尝试将其纳入正式流程,如ICLR 2025首次大规模试点AI辅助审稿,通过LLM对近19000份评审提供反馈,26.6%的审稿人据此更新了评审内容,共采纳12222条建议,盲审评估显示其中89%的评审质量有所提升[4]。另一方面,LLM在同行评议中的风险也引发了广泛的伦理讨论。针对AI审稿这一新兴现象,不少出版商对其作出明文规定:包括Wiley、Springer和Frontiers在内的出版商同意有限度地使用AI审稿,而Elsevier、中国社会科学杂志社等则禁止使用AI审稿。由此看来,不同期刊对于AI是否可以参与审稿的规定并不统一,AI在审稿中的应用仍处于一个充满争议与不确定性的“灰色地带”。 学术圈对AI审稿的合理性展开了丰富的讨论,一方面,从技术视角出发,采用对照实验评估AI辅助审稿的效果;另一方面,从伦理视角对AI审稿的规范进行梳理和倡议。但是鲜少从行为视角揭示审稿人使用AI的具体过程。基于此,本研究旨在采用质性研究方法,探究审稿人在同行评议任务中与LLM的协作行为过程,刻画其行为模型。 2 文献综述 2.1 AI辅助审稿相关研究 已有研究对LLM辅助审稿的效果进行了评测与分析。在任务流程层面,LLM在处理标准化、重复性任务上能带来直接效益,例如人工智能生成内容(Artificial Intelligence Generated Content,AIGC)痕迹检查[5]。此外,LLM在编辑部初审[6]、匹配审稿人、帮助审稿人抓取论文创新点方面也发挥了一定作用[7]。在反馈内容的有用性层面,通过对比GPT-4与人类审稿人的反馈意见,发现LLM反馈与人工反馈之间存在大量重叠,并且用户对LLM反馈的有用性持有积极态度[8]。具体到论文创新性的评价,LLM在稳定性、准确性与真实性方面稍显不足[9],而将LLM知识与人类知识相结合则有望提升对研究方法新颖性的预测效果[10]。除此之外,LLM也带来了幻觉与偏见、责任归属与数据隐私等伦理挑战[11]。 为了应对LLM在学术出版流程中的风险挑战,学者们也致力于探索其治理之道。在制度规范层面,学者们对国内外学术出版机构、学术组织、期刊的人工智能使用政策进行爬梳和归纳分析,对比国内外治理政策差异[12],总结出治理框架和措施。其中,针对审稿人主体,强调责任归属、公平性、保密性[13]、流程透明性[14]。此外,基于AI应用所致学术乱象案例[15]、SWOT分析[11]等,构建防范AI应用风险的方案和策略。 2.2 学术任务情境下的人智协作研究 人智协作(Human-AI Collaboration)是人智交互的类型之一,强调人与AI通过优势互补,共同完成复杂任务并达成共同目标[16]。其中,用户、AI工具与任务构成了人智协作的三大核心要素。在用户维度,已有研究针对科研人员对LLM的态度、认知及应对策略展开了全面的调研[17]。用户的信息处理能力和认知能力[18]、创造力[19]、人工智能准备度、STARA意识[20]等特征会对人智协作产生影响。例如,根据人类在知识生产中的参与度,可以将人机协作关系划分为AI主导型、AI合作型和AI辅助型[21]。在技术维度,AI在科学研究中以工具、灵感和概念来源、理解代理人三个维度发挥着作用[22]。基于此框架,AI在辅助科研创新中的功能被定位为智能知识转换器、智能科研助理和智能服务平台[18]。调研数据显示,AIGC技术结合的数字学术工具应用只能对科研人员起到辅助作用,对于全部科研工作流中的关键环节仍显不足[22]。在任务维度,AI辅助的学术任务被划分为科学理解、学术综述、科学发现、学术写作和同行评议五类[24],任务依赖关系[25]、任务类型[26]、学术严谨性要求[27]都会对人机协作的形式和效果产生影响。 综上所述,已有研究深入评测了LLM在同行评议任务中的应用效果,并系统探讨了其治理制度与规范。然而,这类研究呈现出鲜明的技术中心主义倾向,对审稿人在协作中的具体行为过程刻画不足。另一方面,人智协作相关研究已经积累了丰富的成果,但是在同行评议这一高度依赖专家隐性知识的高利害情境下,其适用性仍待实证检验与理论深化。基于此,本研究拟解决三个具体的研究问题:审稿人在任务中使用LLM的行为过程是怎么样的?审稿人与LLM的协作行为发生怎样的演变?背后的影响机制是什么? 3 研究设计 采用深度访谈法收集数据,通过主题分析法描述审稿人与LLM协作行为的过程。