语言作为一个复杂适应系统有着自身的演化和发展规律,采用计量方法可探究语言的系统特性。本文在依存句法的理论框架下,利用大规模依存树库,通过构建层级结构计量指标,如节点数、层级数、层级距离、平均层级距离和英语平均层级距离,对英语句子的层级结构进行了量化分析。结果发现,英语句子的节点数、层级数和平均层级距离三者存在显著的正相关;层级数的分布呈正偏态,表明英语句子倾向于采用扁平型层级结构,且节点数越大偏态越明显;英语平均层级距离的阈值为4。
图1为英语句子“The small streams make the big rivers.”的依存结构树图,基于词间二元非对称关系的树图,可以清晰地看出句子的层级结构。动词make是句子的根(root),直接支配两个子节点streams和rivers,这两词又都可作为支配词分别下辖两个子节点。单个支配词可下辖一个或多个子节点,单个子节点最多只能受一个支配词支配。二维的层级结构按时间序列在水平方向上形成投影(projectivity)①,将结构顺序和线性顺序联系起来。 本研究在依存句法理论框架下,利用大规模依存句法标注语料库(树库),通过构建层级结构计量指标,如节点数、层级数、层级距离、平均层级距离和英语平均层级距离,系统考察了英语句子的层级结构特性。主要关注以下问题:是否句长越长,层级数越多?句长相同时,层级又是如何分布的?英语句子层级深度的平均值是否存在上限? 2.研究方法与资源 2.1 语料预处理 本文采用布拉格捷-英依存树库2.0版(PCEDT 2.0)中的英语依存子库,该库的英文语料源自整个宾州树库②的华尔街日报语料,按照依存句法体系手工标注而成,满足投影性条件(
et al.2006)。原数据采用可扩展标记语言(XML)进行存储,我们利用R软件平台内两个软件包(XML和RODBC包),结合xpath语句遍历全部节点属性,计算出层级信息,实现数据的提取、预处理和再存储,最终汇成表1的格式。
通过以上步骤,我们获得的英语依存子库大小为1173766词次(token),句子总数为49208句,平均句长为23.85。剔除句长小于等于3的非句,如“@”,“Virginia:”,“New Jersey:”等特殊字符或新闻标识信息,共476句,占比0.97%。此外,为避免大数据的冗余,降低方法的鲁棒性,本文将筛选后的树库(T0)按句子数等分成4份,构建了4个子库(T1、T2、T3和T4),详见表2。
2.2 层级结构计量指标 层级结构计量标准的设定,既是对研究问题的具体量化,又需要一定程度上反映句法结构的复杂度。Miller & Chomsky(1963:485)用生成句法树图中节点总数与终端节点数的比例,来衡量句子结构的复杂度,实质是一种频次测量。Hawkins(1994:25)采用结构域大小,即结构中所含节点的多少,作为结构复杂度的衡量标准,更接近线性维度的结构容量测量。这些标准用节点分布和结构容量来计算句子结构复杂度,并不能反映层级结构逐级扩展的特点,也很难有效衡量句子结构的实时加工难度。