摘要由 AI 生成
arXiv 于 2026 年 9 月 7 日发布 KernelGenBench,这是首个用于评估大语言模型及智能体生成 Triton 内核的统一多源多芯片基础设施。该基准涵盖六款硬件平台,包含来自 PyTorch ATen、生产 vLLM 及专有 cuBLAS 的 210 个算子,并在六款平台上测试了语义稳定的 110 个算子。评估过程消耗超过 150 亿 token。结果显示,虽然智能体执行提升了正确性,但没有任何方法在所有源和平台上占据优势:vLLM 带来了最强的正确性挑战,cuBLAS 设定了最高性能上限,而 AutoKernel 的准确率从 NVIDIA 平台的 87% 降至 Iluvatar CoreX 平台的 25%。专用智能体平均每个成功算子消耗约 499 万 token。
关键实体KEY ENTITIES
AutoKernelIluvatar CoreXKernelGenBenchNVIDIAPyTorch ATenTritoncuBLASvLLM
报道态势 · 每日报道量LANGUAGE SPLIT
实体关系
信号强度SIGNALS
关键词热度
- KernelGenBench1
- Triton1
- PyTorch ATen1
- vLLM1
- cuBLAS1
- AutoKernel1
- NVIDIA1
- Iluvatar CoreX1
全部报道(1)SOURCES
↗
arXiv:2607.27231v2 发布 KernelGenBench,首个统一多源多芯片基础设施用于评估 LLM 及智能体生成的 Triton 内核。该基准覆盖六款硬件平台,包含来自 PyTorch ATen、生产 vLLM 及专有 cuBLAS 的 210 个算子(KernelGenBench-MS),并在六款平台上测试语义稳定的 110 个算子(KernelGenBench-MC)。评估消耗超过 150 亿 token,结果显示智能体执行提升了正确性,但无方法在所有源和平台上占优:vLLM 带来最强正确性挑战,cuBLAS 设定最高性能上限,AutoKernel 准确率从 NVIDIA 的 87% 降至 Iluvatar CoreX 的 25%。专用智能体平均每个成功算子消耗 499 万 token,…