智迹闻AuraTracer
EN

EVENT DOSSIER

HLS-Seek:基于感知Q值的代码生成技术,通过代理式比较奖励强化学习实现高级合成》

2026-09-07 12:00 科学 🔥 42.2 事件热度
1家信源
1天持续发酵
42.2事件热度
3个提及
摘要由 AI 生成

HLS-Seek 提出一种基于代理比较奖励强化学习的 QoR(质量 - 延迟权衡)感知代码生成框架。该框架利用仅 7B 参数的模型,在 HLS-Eval 测试集上实现了 84.7% 的语法正确率(pass@1)和 81.4% 的功能正确率(pass@5),其训练速度比传统真实奖励强化学习快 8.5 倍。为提升效率并防止奖励黑客行为,该框架采用代理比较奖励模型避免全合成循环,达到 99.53% 的帕累托优势准确率,并引入不确定性感知蒙特卡洛 Dropout 切换机制。在 QoR 评估中,HLS-Seek 在 19/30 个内核上实现了最低延迟,并在 9 个内核上帕累托支配了 HLS 特定基线,其功能正确率超越了 GPT-5.1。

相关事件RELATED EVENTS
关键实体KEY ENTITIES
GPT-5.1HLS-SeekVitis HLS

报道态势 · 每日报道量LANGUAGE SPLIT

实体关系
GPT-5.1 × HLS-Seek1GPT-5.1 × Vitis HLS1HLS-Seek × Vitis HLS1

信号强度SIGNALS

关键词热度
  • HLS-Seek1
  • Vitis HLS1
  • GPT-5.11

全部报道(1)SOURCES

A arXiv cs.AI en 2026-09-07 12:00

HLS-Seek: QoR-Aware Code Generation for High-Level Synthesis via Proxy Comparative Reward Reinforcement Learning

HLS-Seek 提出一种基于代理比较奖励强化学习的 QoR 感知代码生成框架,在仅使用 7B 参数的情况下,于 HLS-Eval 测试集上实现 84.7% 语法正确率(pass@1)和 81.4% 功能正确率(pass@5),训练速度比真实奖励强化学习快 8.5 倍。该框架通过代理比较奖励模型避免全合成循环,达到 99.53% 的帕累托优势准确率,并引入不确定性感知蒙特卡洛 Dropout 切换机制以防止奖励黑客行为。在 QoR 评估中,HLS-Seek 在 19/30 个内核上实现最低延迟,并在 9 个内核上帕累托支配 HLS 特定基线,其功能正确率超越 GPT-5.1。