智迹闻AuraTracer
EN

EVENT DOSSIER

PRISM-Bench:一种以音频为中心的文本转音视频生成诊断基准测试

2026-09-07 12:00 大模型 🔥 42.2 事件热度
1家信源
1天持续发酵
42.2事件热度
1个提及
摘要由 AI 生成

arXiv 于 2026 年 9 月 7 日发布 PRISM-Bench,这是首个面向文本生成音视频(T2AV)的音频中心诊断基准。该基准基于 900 个经人工验证的样本构建,将音频评估分解为音频类型(语音、音乐、声音)和声源可见性(屏幕内、屏幕外)两个正交维度,并从视听一致性、音频质量、音频表现力和提示遵循四个感知维度进行评价,共包含 35 项细粒度标准。为确保评估可靠性,研究采用了基于盲测并排对比的增强型多模态大模型作为裁判协议,其与人类评分者的平均一致性超过 70%。对近期 T2AV 系统的评估显示,前沿模型与开源模型之间存在显著性能差距;同时发现当前生成范式过度拟合感知保真度,而在复杂定位与控制任务上表现不佳,特别是在音乐生成和屏幕内音频同步方面。

相关事件RELATED EVENTS
关键实体KEY ENTITIES
PRISM-Bench

信号强度SIGNALS

关键词热度
  • PRISM-Bench1

全部报道(1)SOURCES

A arXiv cs.AI en 2026-09-07 12:00

PRISM-Bench: An Audio-Centric Diagnostic Benchmark for Text-to-Audio-Video Generation

PRISM-Bench 发布了首个面向文本生成音视频(T2AV)的音频中心诊断基准。该基准基于 900 个经人工验证的样本构建,将音频评估分解为音频类型(语音、音乐、声音)和声源可见性(屏幕内、屏幕外)两个正交维度,并从视听一致性、音频质量、音频表现力和提示遵循四个感知维度进行评价,共包含 35 项细粒度标准。为确保评估可靠性,研究采用了基于盲测并排对比的增强型多模态大模型作为裁判协议,其与人类评分者的平均一致性超过 70%。对近期 T2AV 系统的评估显示,前沿模型与开源模型之间存在显著性能差距;同时发现当前生成范式过度拟合感知保真度,而在复杂定位与控制任务上表现不佳,特别是在音乐生成和屏幕内音频同步方面。