PRISM-Bench: An Audio-Centric Diagnostic Benchmark for Text-to-Audio-Video Generation
PRISM-Bench 发布了首个面向文本生成音视频(T2AV)的音频中心诊断基准。该基准基于 900 个经人工验证的样本构建,将音频评估分解为音频类型(语音、音乐、声音)和声源可见性(屏幕内、屏幕外)两个正交维度,并从视听一致性、音频质量、音频表现力和提示遵循四个感知维度进行评价,共包含 35 项细粒度标准。为确保评估可靠性,研究采用了基于盲测并排对比的增强型多模态大模型作为裁判协议,其与人类评分者的平均一致性超过 70%。对近期 T2AV 系统的评估显示,前沿模型与开源模型之间存在显著性能差距;同时发现当前生成范式过度拟合感知保真度,而在复杂定位与控制任务上表现不佳,特别是在音乐生成和屏幕内音频同步方面。