ParaRNN: Parallel Training for Non-Linear RNNs (sLSTM, RWKV-7, CfC, Titans) via Triton Newton Scans [P]
开发者开源了名为 ParaRNN 的 PyTorch/Triton 库,该库利用牛顿 - 拉弗森迭代映射到关联前缀扫描,实现了非线性循环架构在时间维度上的并行训练。通过自定义融合 Triton 求解器,ParaRNN 将墙钟时间加速约 200 倍,在 RTX 3060 上处理 CfC(T=2048)耗时从 643ms 降至 2.79ms;经验验证表明其牛顿迭代预算在新线性度下保持平坦(K≤3),匹配顺序展开性能直至 131,072 个 token。该库支持 sLSTM、RWKV-7、CfC、Titans、Modern Hopfield 及 M²RNN 等单元,并提供 torch.compile 生产级钩子及 vLLM 插件,相关代码已托管于 GitHub。