摘要由 AI 生成
研究人员提出 SQL-Zero,一种无需人工标注数据即可训练具有竞争力的 Text-to-SQL 代理的方法。该方法采用提议者 - 求解者自博弈机制,挑战者与求解者基于同一基础大语言模型启动,仅以数据库执行结果作为唯一真值。挑战者生成针对当前难度的校准 SQL 对,双方交替使用 GRPO 更新,并对挑战者施加模板级重复惩罚以防多样性崩溃。在 BIRD 数据库上无标签训练后,3B 和 7B 模型分别在开发集上比零样本基线提升 6.6 分和 7.3 分,且表现优于同等配方下使用人工标注数据训练的对照模型。迁移能力依赖规模:3B 模型在未见过的 Spider 数据库及词汇扰动任务(Spider-Syn)中每轮迭代均优于基线并比对照模型退化更少;而 7B 模型仅第一轮迭代能保持迁移效果。
关键实体KEY ENTITIES
BIRDGRPOSQL-ZeroSpider
事件框架EVENT FRAME
产品发布
arXiv:2609.04697v1
SQL-Zero
提出零标注自进化文本转 SQL 代理
报道态势 · 每日报道量LANGUAGE SPLIT
实体关系
信号强度SIGNALS
关键词热度
- SQL-Zero1
- GRPO1
- BIRD1
- Spider1
全部报道(1)SOURCES
↗
研究人员提出 SQL-Zero,一种无需人工标注数据即可训练具有竞争力的 Text-to-SQL 代理的方法。该方法采用提议者 - 求解者自博弈机制,挑战者与求解者基于同一基础大语言模型启动,仅以数据库执行结果作为唯一真值。挑战者生成针对当前难度的校准 SQL 对,双方交替使用 GRPO 更新,并对挑战者施加模板级重复惩罚以防多样性崩溃。在 BIRD 数据库上无标签训练后,3B 和 7B 模型分别在开发集上比零样本基线提升 6.6 分和 7.3 分,且表现优于同等配方下使用人工标注数据训练的对照模型。迁移能力依赖规模:3B 模型在未见过的 Spider 数据库及词汇扰动任务(Spider-Syn)中每轮迭代均优于基线并比对照模型退化更少;而 7B 模型仅第一轮迭代能保持迁移效果。