I reduced image-processing token usage by ~95% compared with GPT-4o direct vision, while maintaining roughly the same accuracy.How significant is that?[P]
作者测试了一种降低图像基 LLM 推理成本的新方法,在 MOMA Graph 基准(1,315 个问题)上,相比直接使用 GPT-4o 处理原图,实现了约 95% 的 token 使用量下降且保持大致相同的准确率。该方法目前仍处于开发阶段,作者暂未分享具体实现细节,正通过该基准验证结果强度并寻求社区反馈以评估其在多模态 AI 效率方面的意义。