智迹闻AuraTracer
EN

EVENT DOSSIER

Search-G1:基于表示式内在奖励的基于基础搜索的智能体

2026-09-07 12:00 大模型 🔥 42.2 事件热度
1家信源
1天持续发酵
42.2事件热度
1个提及
摘要由 AI 生成

arXiv:2608.07531v3 提出 Search-G1,一种基于表示的内在奖励框架。该框架利用提示状态读数预测闭包充分性以定义检索必要性,并利用答案提交读数评估对证据删除的敏感性。经校准后,Search-G1 在强化学习优化中无需过程标注或 LLM 作为裁判,即可为正确搜索轨迹提供额外信用并惩罚重复搜索。实验表明,该方法改善了 grounding 与搜索成本的权衡,在多个基于搜索的问题回答基准及两种模型规模上,以具有竞争力的任务准确率生成了更短的响应侧轨迹。相关代码已发布在 GitHub 仓库中。

相关事件RELATED EVENTS
关键实体KEY ENTITIES
Search-G1

信号强度SIGNALS

关键词热度
  • Search-G11

全部报道(1)SOURCES

A arXiv cs.AI en 2026-09-07 12:00

Search-G1: Grounded Search Agents via Representation-Based Intrinsic Rewards

arXiv:2608.07531v3 提出 Search-G1,一种基于表示的内在奖励框架,旨在通过两个干预校准的读数测量代理回答的操作 grounding。该框架利用提示状态读数预测闭书充分性以定义检索必要性,并利用答案提交读数估计对证据删除的敏感性来评估证据依赖。经校准后,Search-G1 在强化学习优化中无需过程标注或 LLM 作为裁判推理,即可为正确搜索轨迹提供额外信用并惩罚重复搜索。实验表明,该方法改善了 grounding--search-cost 权衡,在多个基于搜索的问题回答基准和两种模型规模上,以具有竞争力的任务准确率生成了更短的响应侧轨迹。代码已发布在 https://github.com/Rosy0912/Search-G1。