如何在生产前评估大型语言模型
团队在评估用于减少 GitHub 秘密扫描误报的 LLM 系统时,发现仅靠基准测试无法反映生产环境挑战。文章指出,随着系统接近上线,输入往往模糊、标签不一致且上下文缺失,导致离线指标提升未必能转化为实际生产表现。作者分享了从原型到生产的实践方法:首先明确产品决策而非调整模型组件,针对秘密扫描场景定义核心目标为减少误报并保留足够召回率以确保安全。团队将评估标准分为三个层级:主要结果(如误报减少)、安全约束(如召回率下限)及运营护栏(如延迟、成本),以此避免将所有指标视为同等重要,从而在满足安全与可行性前提下选择最优配置。