肉眼看不出的幻觉?清华提出视觉源幻觉,仅用0.9%数据实现SOTA

近日,清华大学的研究团队在ACMMM 2026上发布了一项突破性的研究,揭示了多模态大模型(MLLM)中的物体幻觉问题。这项研究不仅挑战了过去对幻觉的传统解释,更为提高模型的可靠性提供了新的思路。

在多模态大模型的应用中,物体幻觉一直是一个亟待解决的核心障碍。研究人员通过实验展示了,模型在对短输出(如Yes/No的回答)进行推理时,往往依赖于视觉特征,而非语言先验。这一发现为幻觉的成因提供了全新的视角,研究者们将其命名为“视觉源幻觉”。

通过分析不同模型的输出,研究人员发现,许多幻觉样本的图文嵌入余弦相似度显著低于正确样本,表明模型在跨模态对齐时出现了系统性崩塌。此外,研究还表明,模型的注意力模式在幻觉和非幻觉样本之间存在显著差异,幻觉样本的注意力往往过度分散,导致模型漏掉重要信息。

为了验证这一理论,研究人员进行了多项实验,发现视觉特征的质量直接影响模型的物体识别能力。当对视觉编码器施加扰动时,模型的准确率也随之波动,这进一步证明了视觉源幻觉的存在。

在此基础上,研究团队提出了AHAF(对抗幻觉属性翻转)和ACFT(对抗对比微调)两种方法,旨在通过有效的样本对齐来减少幻觉的产生。AHAF通过施加定向对抗扰动来构造正负样本,确保样本之间的特征差异可控,而ACFT则在嵌入空间中优化样本的相似度。这两种方法的结合,显著提高了模型在不同基准测试中的表现。

研究结果显示,ACFT在多个模型上的准确率提升显著,尤其是在处理短输出时,其效果尤为明显。实验表明,ACFT在LLaVA、MiniGPT-4和Qwen2.5-VL等模型上均取得了超越次优基线的优异表现,准确率分别提高了3.3%、5.3%和2.5%。

这一研究不仅为多模态大模型的可靠性问题提供了新的解决方案,也为未来的研究指明了方向。清华大学的研究者们强调,解决多模态大模型的幻觉问题,不应仅仅依赖于文本侧的补救措施,而是需要从视觉特征的提取和处理入手。只有让模型“看得更准”,才能真正实现可信的多模态感知。

这一研究成果,标志着在视觉和语言理解的交叉领域,清华大学的学者们为推动人工智能的发展做出了重要贡献。未来,随着技术的不断进步,期待能有更多的研究成果涌现,为我们揭开人工智能的更多奥秘。