一项利用五种大型语言模型对英语歌词进行文化分析的重复测量研究
本研究评估了五个大型语言模型作为零样本标注器对英语歌词中自我价值感、自控力、寻求归属感和寻求认可度四个社会构念的测量可靠性。研究通过重复标注大型歌词语料库,考察了基于大语言模型的测量在跨运行一致性、跨模型收敛性及共识标签向监督分类迁移性方面的三个特性。研究发现,基于大语言模型的测量在不同构念上并非均等可靠:自我价值感在各模型间表现出最强的重复测量可靠性,而寻求认可度通常稳定性较差,自控力和寻求归属感则显示出中等但依赖模型的可靠性。下游分类进一步表明,共识大语言模型标签包含可学习的信号,尽管迁移性本身并不能确立构念效度。因此,在将大语言模型标注视为可扩展的文化分析测量之前,应报告重复测量稳定性和跨模型收敛性。