Commonsense Reasoning in Computer Vision: Foundations, Recent Advancements, and Future Directions
本文综述了计算机视觉中常识推理的最新进展。文章系统回顾了基于知识图谱、场景图、神经符号模型及常识增强 Transformer 的方法,指出常识推理通过整合视觉数据与上下文知识,使模型能比传统 CNN 更整体地解释场景并提升空间推理能力。同时,文章分析了当前存在的数据集偏差、知识不完整及集成挑战等局限,并展望了跨模态推理、可扩展常识知识注入及神经符号混合架构等未来研究方向。