智迹闻AuraTracer
EN

EVENT DOSSIER

FVSpec:基于实际案例的测试作为精益挑战

2026-09-07 12:00 科学 🔥 42.2 事件热度
1家信源
1天持续发酵
42.2事件热度
2个提及
摘要由 AI 生成

arXiv 于 2026 年 9 月 7 日发布 FVSpec 基准,旨在评估 AI 模型在真实世界形式软件验证任务上的表现。该研究团队从 Python 仓库中抓取了 11,039 个基于属性的测试(PBTs),并开发了一个三智能体 LLM 管道,自动将其中的 2,772 个测试翻译为包含 sorry 占位符的 9,415 个 Lean 4 规范。该过程涉及在 Lean 中建模 Python 语义、推断逻辑属性及处理依赖类型编程难度。研究提供了基于多种自动化及模型方法的证明生成基线,并评估了覆盖率和质量指标。所有代码和数据均已开源,以推动 AI 辅助形式化验证的发展。

相关事件RELATED EVENTS
关键实体KEY ENTITIES
Lean 4arXiv

报道态势 · 每日报道量LANGUAGE SPLIT

实体关系
Lean 4 × arXiv1

信号强度SIGNALS

关键词热度
  • arXiv1
  • Lean 41

全部报道(1)SOURCES

A arXiv cs.AI en 2026-09-07 12:00

FVSpec: Real-World Property-Based Tests as Lean Challenges

arXiv:2606.01008v3 提出 FVSpec 基准,用于评估 AI 模型在真实世界形式软件验证任务上的表现。研究人员从 Python 仓库中抓取了 11,039 个基于属性的测试(PBTs),并自动将其中的 2,772 个(占 25%)翻译为包含 sorry 占位符的 9,415 个 Lean 4 规范。该过程涉及在 Lean 中建模 Python 语义、推断命令式 PBT 中的逻辑属性以及处理依赖类型编程的固有难度,并描述了一个三智能体 LLM 管道来完成翻译。研究还评估了覆盖率和质量指标,提供了基于多种自动化及模型方法的证明生成基线,且所有代码和数据均已开源。该基准旨在推动 AI 辅助形式化验证这一未充分探索问题的进展。