ElderBench: Benchmarking Autonomous Mobile Agents for Older Adults
ElderBench 是首个针对老年人真实场景评估移动图形界面代理的基准,由来自 20 个应用的 249 项自然采集智能手机任务构建。该研究分析了老年指令与现有 GUI 基准在句法、语义及语用层面的语言差异,并在线下及线上环境中测试主流 GUI 代理和视觉 - 语言模型,发现处理老年导向指令时性能显著下降。通过控制指令归一化、失败分析及细粒度语言特征分析,识别了特定于老年人的语言模式导致代理失败的原因,旨在为更自适应、可解释且包容年龄的 GUI 代理提供设计洞察。