Single-Query Black-Box Calibration Auditing via Logit Bias
研究人员提出了一种通过 logits 偏差参数对大语言模型进行单查询黑盒校准审计的新方法。该方法利用任意暴露 logits_bias 参数的 LLM API,仅需每个样本一次查询即可数学操纵以评估精确概率阈值。基于此机制,研究团队引入了一个针对二元任务的新颖且可证明一致的 True Calibration Error 估计器,从而为审计黑盒基础模型提供了高效框架。
EVENT DOSSIER
2026 年 9 月 7 日,arXiv cs.LG 发布论文《Single-Query Black-Box Calibration Auditing via Logit Bias》,提出一种仅需单次查询即可对黑盒机器学习模型进行校准审计的新方法。该研究通过分析 logits 偏差(logit bias)来评估模型的预测分布与真实标签分布的一致性,旨在解决传统多轮查询或白盒依赖导致的审计效率低下问题。该方法在保持高准确性的同时显著降低了计算成本,为工业界快速验证模型公平性与可靠性提供了新路径。
研究人员提出了一种通过 logits 偏差参数对大语言模型进行单查询黑盒校准审计的新方法。该方法利用任意暴露 logits_bias 参数的 LLM API,仅需每个样本一次查询即可数学操纵以评估精确概率阈值。基于此机制,研究团队引入了一个针对二元任务的新颖且可证明一致的 True Calibration Error 估计器,从而为审计黑盒基础模型提供了高效框架。