智迹闻AuraTracer
EN

EVENT DOSSIER

在深度算子学习中解析注意力机制:关于数据驱动和物理信息驱动架构的对照研究

2026-09-07 12:00 科学 🔥 42.2 事件热度
1家信源
1天持续发酵
42.2事件热度
0个提及
摘要由 AI 生成

一项针对深度算子网络(DeepONet)变体的受控研究揭示了注意力机制对偏微分方程(PDE)求解精度的显著影响。研究人员在数据驱动和物理信息两种架构模式下,测试了五种不同注意力机制的 DeepONet 变体,并在源驱动瞬态一维非线性扩散 - 反应方程、瞬态一维粘性 Burgers 方程及二维泊松热传导问题等基准上进行了评估。结果显示,采用感知器分词与交叉注意力配置的模型,在所有基准训练组合中的平均相对 L_2 误差降低了 2.4 至 28.0 倍,最佳配置降幅达 3.5 至 32.3 倍;而仅使用点积融合的分支自注意力机制表现不一致。尽管叠加交叉注意力虽能改善所有六类情况但提升幅度较小,全局预混合未提供一致益处,且增加交叉注意力深度会导致成本显著增加及收益递减。总体而言,查询依赖的交叉注意力被证实是提升精度的…

相关事件RELATED EVENTS

全部报道(1)SOURCES

A arXiv cs.LG en 2026-09-07 12:00

在深度算子学习中解析注意力机制:关于数据驱动和物理信息驱动架构的对照研究

一项针对深度算子网络(DeepONet)变体的受控研究揭示了注意力机制对 PDE 求解精度的影响。研究人员在数据驱动和物理信息两种模式下,测试了五种具有不同注意力机制的 DeepONet 变体,并在源驱动瞬态一维非线性扩散 - 反应方程、瞬态一维粘性 Burgers 方程及二维泊松热传导问题等基准上进行了评估。结果显示,带感知器分词与交叉注意力的配置将经典 DeepONet 在所有基准训练组合中的平均相对 L_2 误差降低了 2.4 至 28.0 倍,最佳注意力配置降幅达 3.5 至 32.3 倍;而仅配合点积融合的分支自注意力机制表现不一致,叠加交叉注意力后虽能改善所有六类情况但提升幅度较小。全局预混合未提供一致益处,增加交叉注意力深度虽能提高精度但成本显著增加且收益递减。总体而言,查询依赖的交叉注意力是最…