摘要由 AI 生成
研究人员提出名为 TFO(Training-Free Omni)的无训练框架,旨在将冻结的视频 - 语言模型(VLM)转化为语音中心的全模态模型。该框架由 Ankan Deria 等人在 2026 年 8 月发布,无需修改架构或进行多模态重对齐。TFO 利用 Whisper 提取置信度过滤和时间戳转录本,通过 VLM 现有语言接口路由音频信息,同时保留视觉路径不变。在 56 个基准测试和 21 种语言的对比中,该框架在音视频理解上与原生全模态模型具有竞争力,提升了所有五种模型设置下的音频单独性能,并实现了显著的跨语言语音增益。此外,冻结 VLM 还普遍保留了比对应原生全模态检查点更强的图像/视频理解、视觉定位、编码、数学推理及医疗问答能力。研究结果表明,强大的语音中心全模态理解通常可通过模块化音频到语言路由获…
关键实体KEY ENTITIES
Ankan DeriaHanoona RasheedHugging FaceMohamed Bin Zayed University of Artificial IntelligenceTFOWhisperXilin He
事件框架EVENT FRAME
研究成果
arXiv:2609.04242v1
Training-Free Omni (TFO)
提出无需训练即可增强语音能力的框架
当前状态
2026 年 9 月 7 日 TFO 框架论文在 arXiv 及 Hugging Face 发布,无需训练即可提升音频…
报道态势 · 每日报道量LANGUAGE SPLIT
实体关系
整合时间线UNIFIED TIMELINE
-
2026-09-07
TFO 框架论文发布
Ankan Deria 等人在 arXiv 及 Hugging Face 发布 TFO 无训练框架,利用 Whisper 提取信息并通过 VLM 语言接口路由音频,在 56 个基准测试和 21 种语言中验证效果。
2 条报道
信号强度SIGNALS
关键词热度
- TFO1
- Whisper1
- Hugging Face1
- Mohamed Bin Zayed University of Artificial Intelligence1
- Ankan Deria1
- Hanoona Rasheed1
- Xilin He1
全部报道(2)SOURCES
↗
Ankan Deria、Hanoona Rasheed、Xilin He 及 Fahad Shahbaz Khan、Salman Khan 提出了一种名为 Training-Free Omni(TFO)的框架,该框架无需架构修改或模态重对齐即可将冻结的多模态大模型(VLM)转化为语音中心的全模态理解模型。现有全模态模型通常依赖专用音频编码器及昂贵的音视频文本联合训练,导致能力耦合特定 VLM 主干并削弱原有视觉与推理能力。TFO 利用 Whisper 提取置信度过滤和时间戳转录本以解决此问题。该研究发表于 Hugging Face Daily Papers,论文 ID 为 2609.04242,于 2026 年 8 月 7 日发布。
↗
研究人员提出名为 TFO 的无训练框架,将冻结的视频 - 语言模型(VLM)转化为语音中心的全模态模型,无需架构修改或多模态重对齐。该框架利用 Whisper 提取置信度过滤和时间戳转录本,通过 VLM 现有语言接口路由,同时保留视觉路径不变。在 56 个基准测试和 21 种语言的对比中,TFO 在音视频理解上与原生全模态模型具有竞争力,提升了所有五种模型设置下的音频单独性能,并实现了显著的跨语言语音增益。冻结 VLM 还普遍保留了比对应原生全模态检查点更强的图像/视频理解、视觉定位、编码、数学推理及医疗问答能力。这些结果表明,强大的语音中心全模态理解通常可通过模块化音频到语言路由获得,而非昂贵的特定骨干训练。