智迹闻AuraTracer
EN

EVENT DOSSIER

KernelGenBench:一个用于基于LLM的内核生成的多源多芯片基准测试工具

2026-09-07 12:00 科学 🔥 42.2 事件热度
1家信源
1天持续发酵
42.2事件热度
8个提及
摘要由 AI 生成

arXiv 于 2026 年 9 月 7 日发布 KernelGenBench,这是首个用于评估大语言模型及智能体生成 Triton 内核的统一多源多芯片基础设施。该基准涵盖六款硬件平台,包含来自 PyTorch ATen、生产 vLLM 及专有 cuBLAS 的 210 个算子,并在六款平台上测试了语义稳定的 110 个算子。评估过程消耗超过 150 亿 token。结果显示,虽然智能体执行提升了正确性,但没有任何方法在所有源和平台上占据优势:vLLM 带来了最强的正确性挑战,cuBLAS 设定了最高性能上限,而 AutoKernel 的准确率从 NVIDIA 平台的 87% 降至 Iluvatar CoreX 平台的 25%。专用智能体平均每个成功算子消耗约 499 万 token。

相关事件RELATED EVENTS
关键实体KEY ENTITIES
AutoKernelIluvatar CoreXKernelGenBenchNVIDIAPyTorch ATenTritoncuBLASvLLM

报道态势 · 每日报道量LANGUAGE SPLIT

实体关系
AutoKernel × Iluvatar C…1AutoKernel × KernelGenB…1AutoKernel × NVIDIA1AutoKernel × PyTorch AT…1AutoKernel × Triton1Iluvatar CoreX × Kernel…1

信号强度SIGNALS

关键词热度
  • KernelGenBench1
  • Triton1
  • PyTorch ATen1
  • vLLM1
  • cuBLAS1
  • AutoKernel1
  • NVIDIA1
  • Iluvatar CoreX1

全部报道(1)SOURCES

A arXiv cs.AI en 2026-09-07 12:00

KernelGenBench: A Multi-Source and Multi-Chip Benchmark for LLM-based Kernel Generation

arXiv:2607.27231v2 发布 KernelGenBench,首个统一多源多芯片基础设施用于评估 LLM 及智能体生成的 Triton 内核。该基准覆盖六款硬件平台,包含来自 PyTorch ATen、生产 vLLM 及专有 cuBLAS 的 210 个算子(KernelGenBench-MS),并在六款平台上测试语义稳定的 110 个算子(KernelGenBench-MC)。评估消耗超过 150 亿 token,结果显示智能体执行提升了正确性,但无方法在所有源和平台上占优:vLLM 带来最强正确性挑战,cuBLAS 设定最高性能上限,AutoKernel 准确率从 NVIDIA 的 87% 降至 Iluvatar CoreX 的 25%。专用智能体平均每个成功算子消耗 499 万 token,…