在深度算子学习中解析注意力机制:关于数据驱动和物理信息驱动架构的对照研究
一项针对深度算子网络(DeepONet)变体的受控研究揭示了注意力机制对 PDE 求解精度的影响。研究人员在数据驱动和物理信息两种模式下,测试了五种具有不同注意力机制的 DeepONet 变体,并在源驱动瞬态一维非线性扩散 - 反应方程、瞬态一维粘性 Burgers 方程及二维泊松热传导问题等基准上进行了评估。结果显示,带感知器分词与交叉注意力的配置将经典 DeepONet 在所有基准训练组合中的平均相对 L_2 误差降低了 2.4 至 28.0 倍,最佳注意力配置降幅达 3.5 至 32.3 倍;而仅配合点积融合的分支自注意力机制表现不一致,叠加交叉注意力后虽能改善所有六类情况但提升幅度较小。全局预混合未提供一致益处,增加交叉注意力深度虽能提高精度但成本显著增加且收益递减。总体而言,查询依赖的交叉注意力是最…