智迹闻AuraTracer
EN

EVENT DOSSIER

大型语言模型能否预测社会对政策的反应?以中国灵活就业人员养老金参保预测为例

2026-09-07 12:00 大模型 跨 2 天 🔥 47.2 事件热度
2家信源
2天持续发酵
47.2事件热度
5个提及
摘要由 AI 生成

2026 年 9 月 7 日,研究人员在 arXiv 上发布首个针对中国灵活就业人员的养老金参保预测领域专用模型 FlexPension-LLM。该模型采用 DKI-RDistill 方法注入包含 Probit 边际效应和户籍省份规则的基于政策的提示词,利用 LoRA/SFT 将增强监督蒸馏至开源混合专家(MoE)学生模型中,并由真实标签修正教师错误。在 CHFS 2019 盲测中,FlexPension-LLM 实现 0.9316 的复合 F1 分数,超越其 Claude Sonnet 4.5 教师及 17 个基线中的 15 个,且与 Claude Opus 4.6 统计无显著差异;在四项外部调查中平均复合 F1 为 0.7549,表现范围最窄。分析表明,性能提升主要源于基于政策的提示词注入和错误修正机制。

相关事件RELATED EVENTS
关键实体KEY ENTITIES
CHFSClaude Opus 4.6Claude Sonnet 4.5DKI-RDistillFlexPension-LLM

报道态势 · 每日报道量LANGUAGE SPLIT

实体关系
CHFS × DKI-RDistill2CHFS × FlexPension-LLM2DKI-RDistill × FlexPens…2CHFS × Claude Opus 4.61CHFS × Claude Sonnet 4.51Claude Opus 4.6 × Claud…1

整合时间线UNIFIED TIMELINE

  1. 2026-09-04

    Can Large Language Models Anticipate Be…

    研究人员提出使用大型语言模型(LLMs)作为政策评估工具,并发布了首个针对中国灵活就业人员层级养老金参保预测的领域专用模型 FlexPension-LLM。该模型通过 DKI-RDistill 注入包含 Probit 边际效应和户籍省份养…

  2. 2026-09-07

    Can Large Language Models Anticipate Be…

    本文提出将大型语言模型(LLMs)作为政策评估工具,并发布了首个针对中国灵活就业人员层级养老金参保预测的领域专用模型 FlexPension-LLM。该模型通过 DKI-RDistill 方法注入包含 Probit 边际效应和户籍省份养老…

信号强度SIGNALS

关键词热度
  • FlexPension-LLM2
  • DKI-RDistill2
  • CHFS2
  • Claude Sonnet 4.51
  • Claude Opus 4.61

全部报道(2)SOURCES

A arXiv cs.CL en 2026-09-04 22:24

Can Large Language Models Anticipate Behavioral Responses to Social Policies? A Case of Pension Enrollment Prediction among China's Flexible Workers

研究人员提出使用大型语言模型(LLMs)作为政策评估工具,并发布了首个针对中国灵活就业人员层级养老金参保预测的领域专用模型 FlexPension-LLM。该模型通过 DKI-RDistill 注入包含 Probit 边际效应和户籍省份养老金规则的提示词,利用 LoRA/SFT 将增强监督蒸馏至开源混合专家(MoE)学生模型中,并由真实标签修正教师错误。在 CHFS 2019 盲测中,FlexPension-LLM 实现 0.9316 的复合 F1 分数,超越其 Claude Sonnet 4.5 教师及 17 个基线中的 15 个,且与 Claude Opus 4.6 统计上无显著差异;在四次外部调查中平均复合 F1 为 0.7549。分析表明,性能提升主要源于政策提示词注入和错误过滤监督,而推理过程提供了…

A arXiv cs.CL en 2026-09-07 12:00

Can Large Language Models Anticipate Behavioral Responses to Social Policies? A Case of Pension Enrollment Prediction among China's Flexible Workers

本文提出将大型语言模型(LLMs)作为政策评估工具,并发布了首个针对中国灵活就业人员层级养老金参保预测的领域专用模型 FlexPension-LLM。该模型通过 DKI-RDistill 方法注入包含 Probit 边际效应和户籍省份养老金规则的基于政策的提示词,利用 LoRA/SFT 将增强监督蒸馏至开源混合专家(MoE)学生模型中,并由真实标签修正教师错误。在 CHFS 2019 盲测中,FlexPension-LLM 实现 0.9316 的复合 F1 分数,超越其 Claude Sonnet 4.5 教师及 17 个基线中的 15 个,且与 Claude Opus 4.6 统计无显著差异;在四项外部调查中平均复合 F1 为 0.7549,表现范围最窄。分析表明,性能提升主要源于基于政策的提示词注入和错误…