智迹闻AuraTracer
EN

EVENT DOSSIER

WearableQA:基于真实世界可穿戴数据的健康推理基准测试

2026-09-07 12:00 科学 跨 2 天 🔥 47.2 事件热度
2家信源
2天持续发酵
47.2事件热度
1个提及
摘要由 AI 生成

研究人员于 2026 年 9 月推出 WearableQA,这是一个旨在评估大语言模型健康推理能力的基准测试数据集。该数据集包含 4,084 道选择题,基于 200 名真实用户长达 500 天的可穿戴设备时间序列、血液生物标志物及人口统计数据构建。WearableQA 采用双 grounding 框架,结合文献与统计验证模式,保留了设备噪声和个体差异等真实分布特征,并设计了涵盖数据推理与健康推理、单信号与跨信号推理的 16 种问题类型。对 14 个专有及开源大语言模型的评估显示,其表现范围从 19.6% 至 72.9%,远超 10% 随机基准,且多数模型准确率低于 60%,表明该基准能有效区分模型能力并证明健康推理领域尚未解决。

相关事件RELATED EVENTS
关键实体KEY ENTITIES
WearableQA

整合时间线UNIFIED TIMELINE

  1. 2026-09-04

    WearableQA: A Benchmark for Health Reas…

    研究人员推出 WearableQA,该基准包含由 200 名真实用户数据(含最长 500 天测量记录)构建的 4,084 道选择题。该基准涵盖可穿戴时间序列、血液生物标志物及人口统计学信息,并保留设备噪声与个体差异等真实分布特征。为评估不…

  2. 2026-09-07

    WearableQA: A Benchmark for Health Reas…

    研究人员推出 WearableQA,这是一个包含 4,084 道选择题的基准测试数据集,基于 200 名真实用户长达 500 天的可穿戴设备时间序列、血液生物标志物及人口统计数据构建。该基准通过双 grounding 框架结合文献与统计验…

信号强度SIGNALS

关键词热度
  • WearableQA2

全部报道(2)SOURCES

A arXiv cs.CL en 2026-09-05 01:52

WearableQA: A Benchmark for Health Reasoning over Real-World Wearable Data

研究人员推出 WearableQA,该基准包含由 200 名真实用户数据(含最长 500 天测量记录)构建的 4,084 道选择题。该基准涵盖可穿戴时间序列、血液生物标志物及人口统计学信息,并保留设备噪声与个体差异等真实分布特征。为评估不同推理能力,研究设计了 16 种题型,按数据与健康推理、单信号与跨信号推理两个维度分类。构建过程采用结合文献生理发现与统计验证人群模式的“双重 grounding"框架。对 14 个专有及开源大语言模型的测试显示,其表现介于 19.6% 至 72.9% 之间(基准为 10%),且多数模型准确率低于 60%,表明该基准尚未被完全解决。WearableQA 旨在提供评估大语言模型在真实世界可穿戴数据上进行健康推理的可靠诊断基准。

A arXiv cs.CL en 2026-09-07 12:00

WearableQA: A Benchmark for Health Reasoning over Real-World Wearable Data

研究人员推出 WearableQA,这是一个包含 4,084 道选择题的基准测试数据集,基于 200 名真实用户长达 500 天的可穿戴设备时间序列、血液生物标志物及人口统计数据构建。该基准通过双 grounding 框架结合文献与统计验证模式,保留了设备噪声和个体差异等真实分布特征,并设计了涵盖数据推理与健康推理、单信号与跨信号推理的 16 种问题类型。对 14 个专有及开源大语言模型的评估显示,其表现范围从 19.6% 至 72.9%,远超 10% 随机基准,且多数模型准确率低于 60%,表明该基准能有效区分模型能力并证明健康推理领域尚未解决。