智迹闻AuraTracer
EN

EVENT DOSSIER

ARIA – 一种用于自动测试信息娱乐系统的代理框架

2026-09-07 12:00 大模型 🔥 42.2 事件热度
1家信源
1天持续发酵
42.2事件热度
1个提及
摘要由 AI 生成

2026 年 9 月 7 日,arXiv 发布 ARIA 框架,该框架通过多智能体大语言模型自主运行 Android 车载信息娱乐系统的端到端测试。在 30 个测试场景中,ARIA 成功完成 28 个(覆盖率 93.3%)并检出全部已知缺陷,未发生漏报。其采用包含四个专用智能体及报告阶段的闭环管道,能够根据单句场景描述自动生成交互、报告、可复现脚本及视觉证据。评估显示,多智能体设计显著优于单智能体基线,首轮测试误报率从 72.0% 降至 52.6%,其中 8 个误报源于导航限制、图像分辨率不足或手势支持缺失。研究还分析了 Token 消耗、调用次数及成本数据,表明系统稳定性随复杂度变化但故障检测保持一致,显示出将视觉测试集成至持续集成(CI)流程的潜力。

相关事件RELATED EVENTS
关键实体KEY ENTITIES
ARIA

信号强度SIGNALS

关键词热度
  • ARIA1

全部报道(1)SOURCES

A arXiv cs.AI en 2026-09-07 12:00

ARIA - An Agentic Framework for Autonomous Testing of Infotainment Systems

ARIA 框架通过多智能体 LLM 自主运行 Android 车机系统端到端测试,在 30 个场景中完成 28 个(93.3%)并检出全部已知缺陷。该框架采用包含四个专用智能体及报告阶段的闭环管道,从单句场景描述生成交互、报告、可复现脚本及视觉证据。评估显示,ARIA 未漏报任何故障,其 8 个误报源于导航/图像限制及不支持的手势;单智能体基线对比证实多智能体设计价值,首轮测试误报率显著更低(52.6% vs 72.0%)。研究还报告了单次运行与重访后的结果、Token/调用/成本数据,表明稳定性随复杂度变化且故障检测一致,指向视觉测试的 CI 集成潜力。