0 引言 在数字化浪潮迅猛推进的当下,管理学的研究正面临着急剧变化的环境,既充满挑战,也蕴藏着巨大的机遇。管理学研究的传统方法已不足以解决当前日益增加的复杂性问题,人工智能技术的出现和发展弥补了传统方法的不足。其中,深度学习因其卓越的数据处理和学习能力,正成为推动管理学研究进步的关键技术。 深度学习(DL)是一种模仿大脑神经网络结构的机器学习技术,能够自动从复杂数据中提取相关的特征。在管理学研究中,深度学习已被广泛应用于风险识别[1]、风险评估[2]、价格预测[3]等多个领域,并取得了显著的成效。然而,深度学习模型的推广和发展仍存在着一些挑战,其中,模型的可解释性是其被广泛使用面临的核心问题之一。尽管这些模型具备强大的学习和预测能力,但其内部机制和决策过程往往难以理解,这对其在管理实践中的应用构成了一定的障碍。 大量研究已经投入到解决深度学习模型可解释性,并且出现了一些有价值的综述。Zhang和Zhu[4]专注于卷积神经网络(CNN)表征可视化以及基于模型可解释性的终端学习。Carrington等[5]采纳了Lipton的观点,提供了关于可解释性的深入视角,但其范围较为有限。曾春艳等[6]从模型角度和因果可解释等方面对可解释性方法进行了总结分析。然而,以往的研究主要集中在深度学习模型的梯度传递过程和模型结构,试图理解每个神经元在梯度传递中的作用,这对于全面理解模型的决策过程存在一定的局限性。 随着脑机接口便捷设备的推广,脑电(EEG)数据的获取将越来越便捷。通过观察大脑活动,可以了解人脑在不同任务和认知过程中的工作方式。传统上通过可视化技术提高神经网络可解释性的工作主要集中在揭示网络内部处理信息的机制,帮助研究者理解网络是如何从大量数据中提取特征并进行分类和预测的。与此并行的是基于脑电的行为可解释性研究,它侧重于利用脑电技术测量大脑活动,并将这些活动与个体的行为和认知过程联系起来。这两者的关联性在于它们都探索如何通过可视化和解释模型的内部机制来理解模型的决策结果。神经网络的可解释性研究促使人们深入探索其决策过程,而基于EEG的行为解释则尝试将大脑活动与具体行为联系起来,从而解释神经机制背后的行为。通过EEG增加模型预测行为结果的可解释性方法更加科学,弥补了传统行为数据不足以解释模型预测行为结果的缺点。 本文旨在通过融合EEG数据和神经科学理论,提升深度学习模型决策结果的解释性。首先,本文回顾了当前在深度学习中应用的可解释性技术并分析了它们的局限性,同时介绍了EEG提升深度学习模型可解释性的几个角度。其次,结合EEG数据与深度学习模型进行实证分析,探讨了EEG特征如何影响管理者风险偏好分类和决策预测,具体展示了模型提取的EEG特征与决策结果之间的关系,并将这些神经特征作为解释模型决策与管理者行为的关键纽带。通过这些实证研究,本文不仅展示了EEG数据在提高深度学习模型可解释性方面的作用,还为企业在选择管理者时提供了基于数据的实证支持。 1 深度学习模型的可解释性 1.1 可解释性的定义 在分类和预测任务中,模型通过从数据中提取与任务相关的特征来进行决策。传统的深度学习方法依赖于人工筛选的特征,这些特征通常具有明确的语义和良好的解释性。然而,深度学习算法自动从数据中学习到的特征往往不具备直观的理解。因此,理解深度学习模型的行为需要进行模型的可解释性研究。而模型的可解释性并没有统一的数学定义,通常从用户易于理解的角度进行定义。例如,Montavon等[7]基于ICASSP为解释神经网络模型及其预测问题提供了切入点。本文将可解释性定义为人的行为和模型之间的桥梁——神经数据,它将模型中的抽象表示通过神经数据映射到人们可理解的行为中。 1.2 深度学习可解释性方法 由于图像特征的直观性和解释性算法在不同领域中的相似性,本节将介绍在图像分类任务中主要使用的几种深度学习可解释性方法。 1.2.1 代理模型 代理模型利用结构简洁且具有较强解释性的替代模型进行决策,以便更好地解释原有模型的行为。其中,网络压缩和知识蒸馏是主要的代表性技术。网络压缩算法旨在减少网络模型的大小,同时保持或接近原始模型的性能。他们对CNN通过使用熵指标进行核聚类实现高精度的压缩操作,并且压缩后的网络学习的特征更加紧密,一定程度上增加了模型的可解释性。蒸馏方法则是训练一个简化模型,并将训练集在原网络中的输出概率作为标签,进一步简化模型。然而以上方法在本质上无法直接提供原始模型的解释性,因为它们主要关注的是如何减少模型的大小和提高运行效率,而不是解释模型是如何做出决策的。为了进一步解释模型,有必要探索模型中每层神经元的功能。 1.2.2 激活最大化算法 激活最大化算法(AM)用于分析特定层的神经元的激活值来揭示模型对输入特征的敏感区域。该方法通过确定网络权重并输入图像x,优化网络使得输出层中某类别c的得分S[,c](x)达到最大化。其优化目标可以表示为

其中:λ为正则化系数。通过使用反向传播算法和梯度上升方法,不断调整输入图像x,以最大化输出层中类别c的得分S[,c](x)。最终,通过可视化技术展示经过优化后的特征图像x[.*]。然而,AM方法的训练过程通常困难且会产生噪声较多、高频模式显著的非自然图像,并且这些生成的图像并不总是能够清晰地解释为何特定的特征或模式对于网络是重要的。