Stress-Testing Efficient Responsible-AI Evaluation: When Compute Savings Change Benchmark Conclusions
研究团队对负责 AI 基准测试中的高效评估进行了压力测试,发现计算成本降低会改变模型行为结论的稳定性。该研究在 BBQ 和 BBQ-V 数据集上,对三种稠密及混合专家模型进行了七种条件(涵盖批处理、量化、基准缩减及其组合)下的评估,并将结果与全基准 BF16 基线进行对比。结果显示,增大批处理可将准确率维持在基线 0.35 个百分点以内并产生较小的子组变化,同时使五分之六的模型 - 数据集设置能耗降低;INT8 量化虽大幅节省能源(为基线的 1.79-4.26 倍),但 INT4 会导致更大且依赖模型与上下文的结论变化;基准缩减虽提供一致性的节省,但极小子集对保留项的选择极为敏感。因此,高效评估应被视为一种必须验证其有效性的测量干预措施。