摘要由 AI 生成
2026 年 9 月 7 日,研究人员在 arXiv 上发布首个针对中国灵活就业人员的养老金参保预测领域专用模型 FlexPension-LLM。该模型采用 DKI-RDistill 方法注入包含 Probit 边际效应和户籍省份规则的基于政策的提示词,利用 LoRA/SFT 将增强监督蒸馏至开源混合专家(MoE)学生模型中,并由真实标签修正教师错误。在 CHFS 2019 盲测中,FlexPension-LLM 实现 0.9316 的复合 F1 分数,超越其 Claude Sonnet 4.5 教师及 17 个基线中的 15 个,且与 Claude Opus 4.6 统计无显著差异;在四项外部调查中平均复合 F1 为 0.7549,表现范围最窄。分析表明,性能提升主要源于基于政策的提示词注入和错误修正机制。
关键实体KEY ENTITIES
CHFSClaude Opus 4.6Claude Sonnet 4.5DKI-RDistillFlexPension-LLM
报道态势 · 每日报道量LANGUAGE SPLIT
实体关系
整合时间线UNIFIED TIMELINE
-
2026-09-04
Can Large Language Models Anticipate Be…
研究人员提出使用大型语言模型(LLMs)作为政策评估工具,并发布了首个针对中国灵活就业人员层级养老金参保预测的领域专用模型 FlexPension-LLM。该模型通过 DKI-RDistill 注入包含 Probit 边际效应和户籍省份养…
-
2026-09-07
Can Large Language Models Anticipate Be…
本文提出将大型语言模型(LLMs)作为政策评估工具,并发布了首个针对中国灵活就业人员层级养老金参保预测的领域专用模型 FlexPension-LLM。该模型通过 DKI-RDistill 方法注入包含 Probit 边际效应和户籍省份养老…
信号强度SIGNALS
关键词热度
- FlexPension-LLM2
- DKI-RDistill2
- CHFS2
- Claude Sonnet 4.51
- Claude Opus 4.61
全部报道(2)SOURCES
↗
研究人员提出使用大型语言模型(LLMs)作为政策评估工具,并发布了首个针对中国灵活就业人员层级养老金参保预测的领域专用模型 FlexPension-LLM。该模型通过 DKI-RDistill 注入包含 Probit 边际效应和户籍省份养老金规则的提示词,利用 LoRA/SFT 将增强监督蒸馏至开源混合专家(MoE)学生模型中,并由真实标签修正教师错误。在 CHFS 2019 盲测中,FlexPension-LLM 实现 0.9316 的复合 F1 分数,超越其 Claude Sonnet 4.5 教师及 17 个基线中的 15 个,且与 Claude Opus 4.6 统计上无显著差异;在四次外部调查中平均复合 F1 为 0.7549。分析表明,性能提升主要源于政策提示词注入和错误过滤监督,而推理过程提供了…
↗
本文提出将大型语言模型(LLMs)作为政策评估工具,并发布了首个针对中国灵活就业人员层级养老金参保预测的领域专用模型 FlexPension-LLM。该模型通过 DKI-RDistill 方法注入包含 Probit 边际效应和户籍省份养老金规则的基于政策的提示词,利用 LoRA/SFT 将增强监督蒸馏至开源混合专家(MoE)学生模型中,并由真实标签修正教师错误。在 CHFS 2019 盲测中,FlexPension-LLM 实现 0.9316 的复合 F1 分数,超越其 Claude Sonnet 4.5 教师及 17 个基线中的 15 个,且与 Claude Opus 4.6 统计无显著差异;在四项外部调查中平均复合 F1 为 0.7549,表现范围最窄。分析表明,性能提升主要源于基于政策的提示词注入和错误…