Nepali Passport Question Answering: A Low-Resource Dataset for Public Service Applications
针对尼泊尔语低资源语言缺乏标注数据与计算资源的挑战,研究团队构建了面向护照相关服务的配对式尼泊尔语问答数据集。该数据集用于训练和评估信息检索模型,并通过微调基于 Transformer 的嵌入模型实现语义相似度匹配。实验对比了细调模型与基线 BM25 算法,并实施了结合两者的混合检索方案。结果显示,细调 SBERT 模型性能优于 BM25,而多语言 E5 嵌入模型在所有测试模型中取得了最高的检索效果。