VISTA:利用视觉语言模型进行密集多标签课堂编码
VISTA 模型在三个未参与的化学讲座测试中,将受限宏观准确率提升至 80.1%,优于零样本变体的 74.9%。该研究提出 VISTA 基线,利用 MiniCPM-V-4.5 在稠密滑动窗口上运行,并通过轻量级多层感知机(MLP)头对冻结主干进行微调,最终将预测结果池化到每两分钟的 COPUS 网格。评估数据集基于由五人专家小组共识构建的 Classroom Observation Protocol for Undergraduate STEM (COPUS),包含外部验证词汇及基于人类评估员的代码可靠性指标。VISTA 在视觉上相似的教师代码和稀有音频依赖代码上出现最大残差,研究还识别了三种系统性故障模式(音频部分可观测性、细粒度小组工作区分、长尾召回),并发布了基准工具、提示词及基线代码。