WearableQA: A Benchmark for Health Reasoning over Real-World Wearable Data
研究人员推出 WearableQA,该基准包含由 200 名真实用户数据(含最长 500 天测量记录)构建的 4,084 道选择题。该基准涵盖可穿戴时间序列、血液生物标志物及人口统计学信息,并保留设备噪声与个体差异等真实分布特征。为评估不同推理能力,研究设计了 16 种题型,按数据与健康推理、单信号与跨信号推理两个维度分类。构建过程采用结合文献生理发现与统计验证人群模式的“双重 grounding"框架。对 14 个专有及开源大语言模型的测试显示,其表现介于 19.6% 至 72.9% 之间(基准为 10%),且多数模型准确率低于 60%,表明该基准尚未被完全解决。WearableQA 旨在提供评估大语言模型在真实世界可穿戴数据上进行健康推理的可靠诊断基准。