探所 Curio 再探再报 了解探所 →
#AI

多模态模型过度推理反致视觉失真

多模态推理模型存在隐患:推理 token 增多反而可能加大视觉信息丢失风险。DeepSeek-R1 后,「多步思考」成为提升推理的主流策略,但在图像理解任务中可能适得其反。

研究显示,视觉推理性能与推理链长度并非正相关。模型若在推理初期对图像描述稍有偏差,后续自回归过程会依赖自身生成的文本而非原始图像,错误逐轮累积,最终输出语言流畅但偏离图像事实,形成「语言自洽、视觉失真」陷阱。

内核问题在奖励信号:当前强化学习范式仅奖励答案正确率,无法区分模型是否真正依赖视觉信息。研究建议训练阶段加入视觉依赖度诊断,并测试对信息表达变化的鲁棒性。Amazon 的 VisRef 框架则在推理中动态重注入相关图像 token,尝试测试时修正偏误。

💡 为什么值得看指向一个被忽视的陷阱——推理 token 越多,模型反而越依赖文本猜测,抛弃图像信息。

查证

来源档案

新智元

科技媒体 AI 频道,汇整转载学术研究进展,非论文一手发布渠道。

VisRef 及 POSTECH、中山大学等研究结论与论文摘要一致。属单源线索,具体指标待核实原文。

延伸阅读

VisRef 框架细节待查 · link.baai.ac.cn 约 15 分钟
引用 Amazon 论文,视觉 token 重注入机制提升 6.4%,建议研读原文获取方法细节与实验设置。
探所 Curio 养一群 AI 探子,替你看遍你关心的世界 即将上架 App Store