智迹闻AuraTracer
EN

EVENT DOSSIER

“谁应该对我的作品进行评分?学生对高等教育中透明的人工智能辅助写作评估的看法”

2026-09-07 12:00 大模型 跨 2 天 🔥 50.2 事件热度
3家信源
2天持续发酵
50.2事件热度
1个提及
摘要由 AI 生成

近期研究证实 AI 在大规模写作评估中的应用可行性。一项基于真实考试数据的研究提出并验证了“人机回环”(Human-in-the-Loop)评分框架,该策略通过让 AI 初评、人类专家复核关键案例,有效降低了人工工作量,同时保持了中等至高程度的评分一致性。另一项针对沙特高校学生的实证研究发现,尽管学生接受并使用 AI 生成的反馈进行文本修订,但他们普遍将 AI 定位为提供“有用性”的辅助工具,而将人类教师视为拥有最终“评估权威”的决策者。两项研究共同表明,在引入 AI 辅助评分时,必须结合精心设计的人机监督流程,以平衡效率与准确性,并明确区分反馈效用与评估权威的角色边界。

相关事件RELATED EVENTS
关键实体KEY ENTITIES
ChatGPT

整合时间线UNIFIED TIMELINE

  1. 2026-09-04

    A Human-in-the-Loop Framework for AI-As…

    A Human-in-the-Loop Framework for AI-Assisted Scoring in Large-Scale Writing Assessment

  2. 2026-09-07

    Who Should Grade My Work? Student Persp…

    沙特一所公立大学的计算机本科生课程中,13 名男性学生完成手写写作任务后,由 ChatGPT 依据与任务目标对齐的评分标准进行评分并提供反馈。学生被明确告知分数和反馈由 AI 系统生成并受邀反思该评价过程。定性分析识别出四个主题:对反馈有…

    2 条报道

信号强度SIGNALS

关键词热度
  • ChatGPT1

全部报道(3)SOURCES

A arXiv cs.AI en 2026-09-07 12:00

A Human-in-the-Loop Framework for AI-Assisted Scoring in Large-Scale Writing Assessment

本研究提出并验证了一种用于大规模写作评估的 AI 辅助评分框架,该框架针对约 150-200 词的短文,采用人机回环策略以降低人工工作量。研究基于两个近期全国性考试(每场约 5,000 份学生答卷)的真实运营数据,分析了 AI 生成分数与人类评分者在多个评分维度上的一致性,以及该决策流程对通过/失败结果的影响。结果显示,模型与人类评价在大多数维度上具有中等至高程度的吻合度,支持了在此场景下引入 AI 辅助的可行性;同时,提出的修正工作流程能识别人类审查最具价值的案例,从而更有效地分配专家精力。研究结论指出,只有结合精心设计的人机监督,AI 辅助评分才能安全地整合进大规模评估流程中。

A arXiv cs.AI en 2026-09-07 12:00

Who Should Grade My Work? Student Perspectives on Transparent AI-Assisted Writing Assessment in Higher Education

沙特一所公立大学的计算机本科生课程中,13 名男性学生完成手写写作任务后,由 ChatGPT 依据与任务目标对齐的评分标准进行评分并提供反馈。学生被明确告知分数和反馈由 AI 系统生成并受邀反思该评价过程。定性分析识别出四个主题:对反馈有用性的感知、对 AI 局限性的认知、区分反馈效用与评估权威的条件信任,以及对人类教师角色的反思。参与者接受 GenAI 反馈用于表面修订,但一致将人类教师定位为评分决策的适当权威。研究指出学生将“反馈效用”与“评估权威”视为分析上分离的两个判断,而非单一批准尺度的两端。