评估大型语言模型用于强制停机风险预测:优势及与机器学习的比较
本研究在零样本框架下,利用六年 outage 记录与高分辨率天气数据,评估大型语言模型(LLMs)对德克萨斯州中部某公用事业服务区域电网因天气导致的强制停电风险预测能力。研究将问题定义为跨三个预报时段(3h、6h、12h)的二元严重程度分类任务,对比了四种零样本 LLM 与两种监督分类器在两种输入配置下的表现。结果显示,监督模型在宏观 F1 值和精确率上优于 LLMs,而新一代 LLMs 得分具有竞争力;此外,LLMs 在行动性推理和地理可扩展性方面提供互补优势,表明将 LLMs 与监督模型结合可能是最佳实践。