智迹闻AuraTracer
EN

EVENT DOSSIER

TACIT-Switch:一种基于成本意识的LLM智能体扩展模型,用于处理受审查的监督数据

2026-09-07 12:00 大模型 🔥 42.2 事件热度
1家信源
1天持续发酵
42.2事件热度
1个提及
摘要由 AI 生成

研究人员提出 TACIT-Switch 方法,利用标注表示为累积风险尺度区间截断观测的 Teacher-Annotated Censored Intervention Times(TACIT)数据。该方法通过混合 - 治愈阈值模型学习永久交接策略,在无需教师参与部署的情况下实现语言模型代理的成本感知升级。实验表明,该方法将标注视为累积风险尺度上的区间截断观测,并估计强滚动成功的概率及条件交接阈值。在机制式多步模拟中,相比任务级、步骤级及固定前缀路由基线,TACIT-Switch 的成功率高出 7.4-11.1 个百分点且成本相当。消融实验显示任务特征与累积轨迹风险提供互补信息。基于开发数据选择工作点后,该方法在 ALFWorld(4B Cheap 模型达 48.5%,9B Cheap 模型达 45.5%)和 …

相关事件RELATED EVENTS
关键实体KEY ENTITIES
TACIT-SWITCH

信号强度SIGNALS

关键词热度
  • TACIT-SWITCH1

全部报道(1)SOURCES

A arXiv cs.LG en 2026-09-07 12:00

TACIT-Switch: Cost-Aware Model Escalation for LLM Agents from Censored Supervision

TACIT-SWITCH 方法利用 Teacher-Annotated Censored Intervention Times(TACIT)数据,通过混合 - 治愈阈值模型学习永久交接策略,在无需教师参与部署的情况下实现语言模型代理的成本感知升级。该方法将标注表示为累积风险尺度上的区间截断观测,并估计强滚动成功的概率及条件交接阈值。在机制式多步模拟中,TACIT-SWITCH 相比任务级、步骤级及固定前缀路由基线,成功率高出 7.4-11.1 个百分点且成本相当;消融实验表明任务特征与累积轨迹风险提供互补信息。基于开发数据选择工作点后,该方法在 ALFWorld(4B Cheap 模型达 48.5%,9B Cheap 模型达 45.5%)和 DABench(73.1%)上均实现了学习策略中最高的留样成功率。