DOI:10.12154/j.qbzlgz.2026.03.003 1 引言 突破性论文作为基础研究领域原始创新的核心载体与重大原创性成果的重要源头,是打通“科技强到产业强、国家强”通道的关键环节[1]。突破性论文早期精准识别不仅能为科研人员锚定前沿探索方向,更能为优化国家创新资源配置、培育未来产业提供前瞻性数据支撑[2]。当前我国虽已迈入创新型国家行列,但对标新质生产力发展需求,基础研究领域仍面临重大原创性成果偏少、创新方向引导滞后等短板,亟需构建科学的早期识别机制破解这一困境[3]。基于上述背景,越来越多的研究关注突破性研究成果的识别与分析。然而,突破性论文的核心内涵并非单一维度可完整界定,其本质是思想突破性、影响持久性与启发广泛性的综合体现[4],既依赖主体资源配置的支撑,更凸显于创新属性的特质与载体影响力的赋能。如何及早发现具有潜在突破性潜质的论文仍是一项具有挑战性的任务。基于此,本文聚焦三大核心问题展开探索:一是系统梳理突破性论文的多维度内涵,结合大语言模型全面刻画其本质属性;二是融合形式概念分析与机器学习方法,实现对早期突破性论文的精准识别,平衡识别效率与精度;三是建立可解释性框架,揭示不同维度特征对论文突破性的作用机制,为理解创新形成逻辑提供实证支撑与方法论保障。 2 研究综述 突破性论文作为原始创新的核心载体,已成为科研评价与创新管理领域的研究热点。学界围绕其内涵界定、影响因素及识别方法展开了有益探索。本文首先梳理突破性论文的内涵界定与影响因素,然后比较突破性论文不同的识别方法。 2.1 内涵界定与影响因素 突破性论文的内涵是多维度特质的综合体现,早期研究多以高被引、诺奖关联成果等显性标识作为量化指标[5]。然而,高被引论文与突破性论文并非完全等价,部分奠基性突破成果可能因范式革新的超前性而存在短期被引不足的现象[6]。随着研究深入,学者们逐渐形成共识:突破性论文的本质在于对既有知识体系的革新或拓展,既体现为颠覆性观点提出、研究范式重构等创新属性特质,也依赖于学术传播、资源支撑等外部条件的赋能[7]。 在影响因素研究方面,现有成果聚焦三大维度。一是主体资源配置维度,研究证实作者合作网络密度、跨区域合作程度与基金支持强度等特征,能通过整合多元智力资源与研究条件,为突破性创新提供支撑[8]。其中,通信作者的学术影响力通过积累的学术声誉与资源整合能力,对研究成果的创新性与传播力产生积极作用,而合理的团队规模与合作结构则有助于激发跨领域思维碰撞。二是创新属性维度,颠覆性指数[9]知识突变度[10]等指标成为刻画论文创新特质的核心变量,研究表明仅引用目标论文而不引用其参考文献的颠覆性引文占比能有效反映成果对既有研究范式的突破程度[11]。跨学科知识融合带来的知识突变,更是催生突破性成果的重要动力[6]。三是载体与传播维度,期刊影响力等特征被证实与突破性存在关联[12]。早期高关注度的传播特征能在一定程度上预示成果的潜在突破价值,但期刊级别并非决定性因素,部分普通期刊也可能产出具有里程碑意义的突破性成果[13]。 2.2 识别方法 突破性论文识别方法的演进始终围绕精准性与前瞻性两大目标展开,形成了计量指标法与机器学习法两大研究路径。计量指标法以引文分析为核心,通过构建量化指标刻画论文的突破性潜质。早期研究多依赖被引频次、被引增长率等基础指标,但此类指标难以区分突破性创新与渐进式创新的本质差异。后续学者提出颠覆性指数(CD指数[14])、修正型颠覆性指数[15]等指标,通过解析目标论文与参考文献的引文网络结构,量化成果对既有知识体系的颠覆或巩固程度,显著提升了识别的针对性。此外,跨学科引文耦合强度[16]、主题多样性[17]等指标的引入,进一步丰富了识别维度,为捕捉跨领域融合带来的突破潜力提供了有效工具。随着机器学习技术的发展,基于多特征融合的机器学习方法逐渐成为识别主流路径[18]。学者们将统计特征、影响力与知识关联等纳入模型输入,通过多种算法构建识别模型,有效提升了识别精度。研究证实,集成学习算法在处理高维异构特征方面表现突出,能更好地捕捉不同特征间的复杂关联,在多学科数据集上的识别效果显著优于单一计量指标法[19]。同时,为满足早期识别需求,部分研究尝试引入论文发表时即可获取的统计特征与短期传播特征,为缩短识别周期、提升预测前瞻性提供了新思路。 本文以丰富特征维度与强化解释能力为目标,构建多维度特征体系与可解释性识别框架。首先,在传统特征基础上引入创新属性测度,通过大语言模型诱导获取知识创新向量;其次,融合形式概念分析与机器学习方法,筛选核心特征并构建识别模型,揭示特征组合规则与单特征贡献度,为突破性论文的早期识别提供支持。 3 研究方法 3.1 研究框架 形式概念分析(Formal Concept Analysis,FCA)是一种基于格论的数学工具,其核心内涵在于通过“形式背景(三元组K=(G,M,I))—概念格—属性约简”的逻辑链条,实现对样本、特征及决策目标的结构化表征与关联挖掘,其中G为样本集合、M为属性集合、I为样本与属性的隶属关系[20]。结合本研究突破性论文识别的核心需求,FCA的应用聚焦两大关键功能:一是属性约简功能,在保持特征分类能力不变的前提下,剔除冗余特征并筛选核心属性子集[21],既降低机器学习模型训练复杂度,又避免特征冗余导致的识别偏差;二是规则提取功能,通过概念格结构直观呈现特征组合与决策属性(是否为突破性论文)的蕴含关系[22],生成可解释的识别规则。