智迹闻AuraTracer
EN

EVENT DOSSIER

无需训练、以语音为中心的全方位理解技术,结合冻结的视觉语言模型

2026 年 9 月 7 日 TFO 框架论文在 arXiv 及 Hugging Face 发布,无需训练即可提升音频…

2026-09-07 12:00 大模型 🔥 47.2 事件热度
2家信源
1天持续发酵
47.2事件热度
7个提及
摘要由 AI 生成

研究人员提出名为 TFO(Training-Free Omni)的无训练框架,旨在将冻结的视频 - 语言模型(VLM)转化为语音中心的全模态模型。该框架由 Ankan Deria 等人在 2026 年 8 月发布,无需修改架构或进行多模态重对齐。TFO 利用 Whisper 提取置信度过滤和时间戳转录本,通过 VLM 现有语言接口路由音频信息,同时保留视觉路径不变。在 56 个基准测试和 21 种语言的对比中,该框架在音视频理解上与原生全模态模型具有竞争力,提升了所有五种模型设置下的音频单独性能,并实现了显著的跨语言语音增益。此外,冻结 VLM 还普遍保留了比对应原生全模态检查点更强的图像/视频理解、视觉定位、编码、数学推理及医疗问答能力。研究结果表明,强大的语音中心全模态理解通常可通过模块化音频到语言路由获…

相关事件RELATED EVENTS
事件速览QUICK FACTS
56基准测试数量
21语言种类数量
关键实体KEY ENTITIES
Ankan DeriaHanoona RasheedHugging FaceMohamed Bin Zayed University of Artificial IntelligenceTFOWhisperXilin He

事件框架EVENT FRAME

研究成果

arXiv:2609.04242v1 Training-Free Omni (TFO) 提出无需训练即可增强语音能力的框架

当前状态

2026 年 9 月 7 日 TFO 框架论文在 arXiv 及 Hugging Face 发布,无需训练即可提升音频…

报道态势 · 每日报道量LANGUAGE SPLIT

实体关系
TFO × Whisper1Ankan Deria × Hanoona R…1Ankan Deria × Hugging F…1Ankan Deria × Mohamed B…1Ankan Deria × Xilin He1Hanoona Rasheed × Huggi…1

整合时间线UNIFIED TIMELINE

  1. 2026-09-07

    TFO 框架论文发布

    Ankan Deria 等人在 arXiv 及 Hugging Face 发布 TFO 无训练框架,利用 Whisper 提取信息并通过 VLM 语言接口路由音频,在 56 个基准测试和 21 种语言中验证效果。

    2 条报道

信号强度SIGNALS

关键词热度
  • TFO1
  • Whisper1
  • Hugging Face1
  • Mohamed Bin Zayed University of Artificial Intelligence1
  • Ankan Deria1
  • Hanoona Rasheed1
  • Xilin He1

全部报道(2)SOURCES

H Hugging Face Papers en 2026-09-07 08:00

Paper page - Training-Free Speech-Centric Omni Understanding with Frozen VLMs

Ankan Deria、Hanoona Rasheed、Xilin He 及 Fahad Shahbaz Khan、Salman Khan 提出了一种名为 Training-Free Omni(TFO)的框架,该框架无需架构修改或模态重对齐即可将冻结的多模态大模型(VLM)转化为语音中心的全模态理解模型。现有全模态模型通常依赖专用音频编码器及昂贵的音视频文本联合训练,导致能力耦合特定 VLM 主干并削弱原有视觉与推理能力。TFO 利用 Whisper 提取置信度过滤和时间戳转录本以解决此问题。该研究发表于 Hugging Face Daily Papers,论文 ID 为 2609.04242,于 2026 年 8 月 7 日发布。

A arXiv cs.CV en 2026-09-07 12:00

Training-Free Speech-Centric Omni Understanding with Frozen VLMs

研究人员提出名为 TFO 的无训练框架,将冻结的视频 - 语言模型(VLM)转化为语音中心的全模态模型,无需架构修改或多模态重对齐。该框架利用 Whisper 提取置信度过滤和时间戳转录本,通过 VLM 现有语言接口路由,同时保留视觉路径不变。在 56 个基准测试和 21 种语言的对比中,TFO 在音视频理解上与原生全模态模型具有竞争力,提升了所有五种模型设置下的音频单独性能,并实现了显著的跨语言语音增益。冻结 VLM 还普遍保留了比对应原生全模态检查点更强的图像/视频理解、视觉定位、编码、数学推理及医疗问答能力。这些结果表明,强大的语音中心全模态理解通常可通过模块化音频到语言路由获得,而非昂贵的特定骨干训练。