空间关系推理任务旨在考察大语言模型对空间关系的理解以及空间常识推理能力。本文提出了一种空间关系推理数据集自动生成方法,并基于此方法生成了2040道中文空间推理测试题,用于面向大语言模型的空间语言理解能力评测大赛SpaCE2024中。相比以往的空间推理数据集,本数据集涵盖了更多的空间关系类型、空间图式和评价维度。参赛系统在本文评测数据集上的平均准确率为0.34,显示基于本文方法生成的空间关系推理测试数据集对大语言模型而言具有高挑战性。
然而,现有的空间推理数据集仍然存在着较多的不足之处。比如,bAbI(Weston et al.,2015)数据集中的子任务Task17“实体空间方位推理”(Positional Reasoning)、Task19“实体路径发现”(Path Finding)与空间推理任务相关,但其测试形式和内容都较为简单,推理步数较少,并仅涉及8类基本空间关系。StepGame(Shi et al.,2022)在一定程度上扩展了空间关系的类型,并且将推理步数的范围提高到了4到10步,大大提高了推理难度。不过,StepGame基于网格的空间关系推理和现实世界的空间推理仍有较大不同,为了保证答案的确定性,StepGame将实体置于网格中,对各个空间关系做了严格的单位和角度的限制,例如,“左边”在StepGame中被定义为“一个实体的横坐标比另一个实体的横坐标小1个单位”,与现实世界差异较大。 SpartQA(Mirzaee et al.,2021)和SpaRTUN(Mirzaee et al.,2022)在出题形式上不局限于网格中抽象的空间方位关系,而是基于NLVR数据集(Suhr et al.,2017)中的简单几何图形来编写物体间方位关系的脚本描述,在提高推理难度的同时,贴近现实世界的空间推理,涉及的空间关系类型拓展至12类。RoomSpace(Li et al.,2024)数据集采用了3D建模方法来模拟日常生活场景中的空间实体图式,并将实体间复杂的空间关系视为约束满足问题(Constraint Satisfaction Problem,CSP)来构建空间推理题自动生成算法,所涉及的空间关系进一步提升至20类。 尽管上述数据集在空间关系类型、推理复杂度和现实贴合度方面不断取得进展,但在模型评估方面仍显不足。在评估过程中,目前的空间推理评测往往只给出模型的总体正确率,无法细粒度地评估空间推理能力,难以为模型优化提供针对性指导。评测数据的价值不仅在于筛选模型优劣,更在于帮助开发者诊断问题、定位短板、指导改进。 为实现更具解释性的空间推理能力评估,评测用数据集的自动生成方式,需要在已有的依靠模板生成的基础上优化。本文提出以结构化知识库为支撑的数据集自动生成框架,具体包括三个核心模块:(1)建立基于常识的空间方位关系推理知识库,结构化地描述空间图式及其约束规则;(2)设计基于知识库的自然语言试题自动生成算法,实现从知识库到题库的自动转换;(3)根据题目的知识标签,构建多维度的评估指标,实现对大语言模型空间推理能力的动态细粒度评估。 二、空间方位关系推理知识库的构建 空间方位关系推理知识库是实现空间推理测试题自动生成的基础。知识库中记录了特定空间图式中各个实体的空间关系信息。空间图式、空间方位模板、模板间推理关系及初始事实共同构成了空间关系推理知识库。 (一)空间图式 一个空间实体并不是孤立的,一般总要与其他实体产生一定的空间关系,它们共同构成一个空间图式。空间图式是对现实世界中无数具体的空间场景的抽象,如:桌上放着一本书、树上停着一只鸟、一艘渡轮正在渡河、一个人正横穿马路,等等,这些场景经抽象后形成的构型称为“空间图式”(Talmy,2005)。 将具体空间场景抽象为空间图式有利于固定空间实体的分布和实体的数量,从而集中考察特定类型的空间关系。同时,不同的空间图式涉及的空间关系有同有异,设计不同类型的空间图式时,主要考虑因素是提高各种空间图式对空间关系的整体覆盖率。
本研究尝试构建了四种空间图式,均由生活中的空间场景抽象而来,如图1所示,分别为六人向心面对围坐的“向心六角”(图1-甲)、六人离心背对围坐的“离心六角”图式(图1-乙)、六个实体在3×2置物架上放置的“三层两列”图式(图1-丙)和四人两两面对面的“四人卡座”图式(图1-丁)。 在四种空间图式中引入更多空间关系,可以进一步扩展出更具体的空间场景,例如:引入了东、南、西、北等空间关系,为场景中的实体规定了特定的朝向或所处方位,就得到了“向心六角正南正北”(图2-甲)、“向心六角正东正西”(图2-乙)等容纳更多空间关系的更为具体的空间场景。空间场景的名称及空间图式对应的场景数量见表2。