“语料库选择对依存距离估计会产生多大的影响?”
一项研究比较了通用依赖树库 v2.18 中 38 个同语言树对的平均依赖距离估计值。结果显示,跨树库的一致性极差:替换树库会反转近 40% 的语言排序,且树库选择解释了约 29% 的组间方差。这一分歧超过了树库内采样误差,并在十二种预处理规范下持续存在。尽管所有树库均确认了依赖长度最小化(归一化比率低于 1),但数据更支持将依赖距离视为受语料条件影响的语法、体裁和标注因素的综合体,而非稳定的语言级参数;定性依赖长度模型在替换语料后依然存活,但跨语言序数排名则不再成立。