Almost Free State Prediction Separation
arXiv:2609.03807v2 提出一种“几乎免费”的状态预测分离方法,利用共享权重骨干中的并行预测流而非序列额外 token 来生成思考 token。该技术在 10 亿参数模型上使下一个 token 预测准确率提升 2-3 个百分点。由于暂停 token 占用现有位置,推理时不增加上下文长度、KV 缓存及延迟,训练成本较优化预训练流程降低至 x1.14。该方法实现了在标准 next token 训练 Transformer 基础上保持同算力、同参数和同 token 数量的性能提升。