九游游戏大全汇聚海量热门手游与竞技精品,登录九游游戏中心官方网站即可畅玩精彩内容,涵盖九游体育、九游娱乐等多元板块,集赛事直播、互动娱乐与热门推荐于一体,打造全场景、全天候的游戏娱乐平台,操作便捷、体验流畅,尽享指尖精彩!

在配备7×24小时智能客服与人工服务双通道,保障用户问题快速响应。方面,九游娱乐提供贴心周到的支持。

多模态大模型产生物体幻觉的成因,长期以来被归结为语言层面的先验知识。

先看两个例子。

第一个例子中,一张照片里只有一只狗。当被问及“图中是否有椅子”时,模型回答“没有,图中是一只狗”,这个答案完全正确。

第二个例子则不同。另一张照片被展示给模型,当问及“图中是否有餐桌”时,模型非常肯定地回答“有一张餐桌,还有一个男孩站在它前面”,但实际上画面中根本没有餐桌。

这些情况正是多模态大模型(MLLM)在实际应用中面临的物体幻觉问题:模型会“看到”现实中不存在的物体,或者对实际存在的物体视而不见。在自动驾驶、医疗辅助这类高风险场景中,此类错误可能带来严重后果。

过去的主流观点认为,这完全是语言先验知识在作祟。模型在训练数据中频繁看到“餐桌”和“男孩”一同出现,因此即便画面中没有,它也会依据语言的统计规律做出回答。

然而,清华大学的研究团队认为,这种解释并不全面。

近期,清华大学的研究团队在ACM MM 2026(第34届ACM国际多媒体会议)的论文中提出:当模型输出非常简短,例如只回答“是”或“否”时,其推理过程会更依赖视觉模态。这时,另一种根植于视觉特征提取本身的幻觉机制会浮现出来。

研究人员将这种机制命名为“视觉源幻觉”,并提出了相应的解决方案ACFT。

论文链接:http://arxiv.org/abs/2609.00231 代码链接:https://github.com/zxp555/ACFT_MM26

实验结果显示,ACFT仅使用了COCO数据集中0.9%的数据量,且没有增加任何推理时的计算开销,就在POPE、MME以及四个描述级别的幻觉基准测试中,于LLaVA、MiniGPT-4、Qwen2.5-VL这三个模型上取得了优异的表现。

研究背景

物体幻觉一直是影响MLLM可靠性的核心障碍。已有研究大多沿着“语言先验”这一方向展开:有的将其归因于模型过度依赖文本共现统计,有的定位到专门关注文本token的“幻觉注意力头”,有的指向摘要token的注意力汇聚现象,还有的认为是细粒度推理监督不足。

相应地,缓解方法也根据干预位置分为几类:VCD、OPERA等方法在解码阶段进行输入级干预;Woodpecker借助外部grounding模块进行输出后处理;以及RLHF、DPO等后训练对齐方法。

但这些方法有一个共同前提:幻觉主要来自文本侧的偏差。这一假设在长文本输出场景(如“请详细描述这张图片”)下确实成立,因为丰富的上下文会放大语言偏见。

问题在于,当输出退化为简单的“有/没有”这类短回答时,语言先验所能发挥的作用大大减弱,这些方法的效果也随之下降。那么,此时的幻觉究竟从何而来?

研究方法

第一步:诊断,视觉源幻觉是否存在?

研究人员在LLaVA v1.5模型上进行了两组互补分析,提供了量化证据。

发现一:图文嵌入错位。幻觉样本的图像-文本嵌入余弦相似度显著低于正确样本。正确样本的平均值为0.158,而幻觉样本的平均值为-0.122,这表明跨模态对齐出现了系统性崩塌。

发现二:注意力模式反转。研究人员使用Smooth Grad-CAM可视化模型注意力,并定义了一个“语义合理”的分布标准:当目标物体存在时,注意力应聚焦于目标区域;当目标物体不存在时,注意力应当分散。在500个幻觉样本和500个非幻觉样本上,通过归一化香农熵量化后发现,幻觉模型系统性地违反了这一模式:物体存在时熵值高出5.1%,说明注意力过度分散,漏掉了目标;物体不存在时熵值低了6.2%,说明模型错误地聚焦在无关区域,从而触发幻觉。

因果验证。为了确认这不仅仅是相关性,研究人员直接对视觉编码器进行干预:施加高斯噪声、降采样、换用更弱的编码器,POPE平均准确率从0.842降至0.739至0.822;反过来换用更强的SigLIP-SO400M编码器,准确率升至0.864。这为“视觉特征质量驱动物体存在性幻觉”提供了因果层面的支撑。

第二步:AHAF——用对抗扰动翻转幻觉属性

诊断结果指向了视觉错位,因此对比学习是最直接的修正思路。但研究人员发现,普通的对比微调(OCFT),即把匹配的图像作为正样本、随机取一张无关图像作为负样本,效果并不理想。

原因在于:正负样本之间的特征差异不可控,也没有聚焦在目标物体上,模型很难学到究竟是哪些视觉特征触发了幻觉。

为此,研究人员提出了AHAF(对抗幻觉属性翻转):使用PGD在极小的ℓ∞球内对原图施加定向对抗扰动,将一张不引发幻觉的图像“翻转”成引发幻觉的图像。这样构造出的正负样本对完全对齐,唯一的差异就是那个受控的扰动。

AHAF还有一个副产品价值:它同时是一个诊断探针。极小的像素级扰动就足以翻转模型的答案,这说明MLLM的视觉表征即便在干净图像上,也已经危险地贴近幻觉决策边界——这一现象反过来印证了“视觉源幻觉”的诊断。

第三步:ACFT——对抗对比微调

基于AHAF生成的对齐样本对,研究人员设计了ACFT(对抗对比微调):在嵌入空间中最大化文本锚点与正样本图像的相似度,同时最小化其与负样本图像的相似度。

整套方法有三个工程上的好处:不依赖特定骨干架构、只需少量数据、且完全在训练阶段完成,推理时零额外开销。

实验结果

研究人员在LLaVA v1.5-7B、MiniGPT-4 13B、Qwen2.5-VL-7B三个模型上进行了系统评估。基准包括POPE和MME。之所以选择这两个,是因为它们的问题全部以“是/否”作答,正好对应本文关注的短输出场景。

主实验:POPE

在LLaVA上,ACFT在三个子集分别取得0.841、0.906、0.897的准确率,比次优基线高出3.3%、2.0%、0.5%;在MiniGPT-4上分别领先次优基线3.0%、5.3%、2.5%;在本身基线已经很强的Qwen2.5-VL上,准确率依然从0.864、0.875、0.884分别提升到0.877、0.900、0.916。

关键消融:对齐的样本对到底有多重要?

这是论文中最能说明问题的一组对比。研究人员使用同样的3000张COCO图像,分别训练OCFT和ACFT。

结果是:ACFT在三个子集上的准确率分别高出OCFT 35.8%、7.4%、17.6%。

尤其在Adversarial子集上,OCFT只有0.483的准确率,甚至远低于未经微调的原始LLaVA模型,说明不对齐的负样本不仅无益,反而有害。

进一步的相似度差距分析给出了解释:在ACFT中,目标物体(truck)的正负样本相似度差距明显区别于非目标物体(dog、cat、table);而OCFT完全不具备这一性质。这意味着ACFT让模型学到了“一致的规则”,即去关注目标物体自身特征的差异。

可视化

可视化直观展示了ACFT如何修正前文诊断出的两个“病征”:图文嵌入余弦相似度显著提升,Grad-CAM注意力也回归到语义合理的分布,即物体存在时聚焦,物体不存在时分散。熵分析进一步确认了这一修正:物体存在的案例熵值分别下降8.7%和2.6%,物体不存在的案例熵值分别上升7.4%和6.4%。

结论与展望

研究人员在已有“语言先验”解释的基础上,进一步识别并系统刻画了一类由视觉特征提取错误与图文嵌入错位驱动的幻觉机制,即视觉源幻觉。

在诊断的基础上,研究人员提出了AHAF与ACFT:前者既是揭示MLLM视觉表征脆弱性的诊断探针,也是对齐对比训练数据的高效生成器;后者则是一种仅需0.9% COCO数据、零推理开销的数据高效微调方法。

这项工作的意义不止于刷新指标。它提示我们:多模态大模型的可靠性问题,不能只盯着语言这一端。当模型的视觉表征在干净图像上就已经紧贴幻觉决策边界时,任何只在文本侧或解码阶段做的补救,都可能是治标不治本的。让模型“看得更准”,或许才是通向可信多模态感知的必经之路。若想了解更多前沿技术资讯,可访问九游游戏大全获取最新动态。

作者介绍

论文作者依次为,徐沛阳(共同一作),清华大学本科生;朱小佩(共同一作),清华大学水木学者,合作导师为朱军教授;以及清华大学朱军教授和胡晓林副教授(通讯作者)。

参考资料:http://arxiv.org/abs/2609.00231 本文来自微信公众号“新智元”,作者:新智元;编辑:LRST,36氪经授权发布。

九游娱乐专注集成赛事直播、实时互动与个性化推荐功能,打造沉浸式娱乐社区。,为用户提供专业可靠的体验。