随着具身智能(agentic AI)系统兴起,其自主调用子代理及执行工具操作的需求导致 CPU 服务器容量等待时间激增。尽管大型语言模型(LLM)推理主要在 GPU 上执行,但约七分之八的具身 AI 任务环节(包括解析输出、调用 API 及编写代码等)需由 CPU 处理,造成资源利用率失衡。AWS 因此紧急要求工程师全力节约 CPU 周期以应对负载压力。针对此问题,Intel 研究员 Souvik Kundu 与 AMD 副总裁 Madhu Rangarajan 指出 CPU 已成为关键瓶颈,Kundu 团队随后提出调度优化方案,旨在将具身工作负载的端到端延迟降低至原来的 1.8 倍。
AWS 因 AI 工作负载导致 CPU 服务器容量等待时间激增,迫使公司紧急要求工程师全力节约 CPU 周期。随着具身智能(agentic AI)系统兴起,其自主调用子代理及执行工具操作的需求使 CPU 成为关键瓶颈。Intel 研究员 Souvik Kundu 与 AMD 副总裁 Madhu Rangarajan 指出,具身 AI 任务中约七分之八的环节运行于 CPU,包括解析输出、调用 API 及编写代码等。尽管 LLM 推理主要在 GPU 上执行,但工具调用及安全护栏检查常由 CPU 处理,导致两者资源利用率失衡。Kundu 团队提出调度优化方案,旨在将具身工作负载端到端延迟降低至原来的 1.8 倍。