摘要由 AI 生成
HLS-Seek 提出一种基于代理比较奖励强化学习的 QoR(质量 - 延迟权衡)感知代码生成框架。该框架利用仅 7B 参数的模型,在 HLS-Eval 测试集上实现了 84.7% 的语法正确率(pass@1)和 81.4% 的功能正确率(pass@5),其训练速度比传统真实奖励强化学习快 8.5 倍。为提升效率并防止奖励黑客行为,该框架采用代理比较奖励模型避免全合成循环,达到 99.53% 的帕累托优势准确率,并引入不确定性感知蒙特卡洛 Dropout 切换机制。在 QoR 评估中,HLS-Seek 在 19/30 个内核上实现了最低延迟,并在 9 个内核上帕累托支配了 HLS 特定基线,其功能正确率超越了 GPT-5.1。
关键实体KEY ENTITIES
GPT-5.1HLS-SeekVitis HLS
报道态势 · 每日报道量LANGUAGE SPLIT
实体关系
信号强度SIGNALS
关键词热度
- HLS-Seek1
- Vitis HLS1
- GPT-5.11
全部报道(1)SOURCES
↗
HLS-Seek 提出一种基于代理比较奖励强化学习的 QoR 感知代码生成框架,在仅使用 7B 参数的情况下,于 HLS-Eval 测试集上实现 84.7% 语法正确率(pass@1)和 81.4% 功能正确率(pass@5),训练速度比真实奖励强化学习快 8.5 倍。该框架通过代理比较奖励模型避免全合成循环,达到 99.53% 的帕累托优势准确率,并引入不确定性感知蒙特卡洛 Dropout 切换机制以防止奖励黑客行为。在 QoR 评估中,HLS-Seek 在 19/30 个内核上实现最低延迟,并在 9 个内核上帕累托支配 HLS 特定基线,其功能正确率超越 GPT-5.1。