Self-Supervised Lexical Representation Learning for Fast, Large-Scale Phylogenetic Inference
本文提出一种无需人工标注的自监督对比学习框架,直接从原始国际音标词表中学习词汇表示,并基于此推断出包含 3,399 种语言变体的全球系统发生树。该模型采用双对比目标:单词级损失将语音相似形式组织为连贯空间,辅助语言级损失使词汇空间反映更广泛的语音特征。推断出的树在通用四元组距离(GQD)上与 Glottolog 参考树表现相当,且仅需标准笔记本 GPU 数分钟即可完成计算。消融研究证实,语言级目标与语音特征向量的使用均提升了树的拓扑结构。此外,该框架生成的表示还能捕捉历时概念稳定性,成对距离方差得出的稳定性排名与现有排名显著相关。