热门AI工具推荐

焚书AI多模型聚合平台
AI多模型聚合平台( Claude 系列、GPT 系列)支持聊天、搜索、图片、视频、音乐等多种功能;聚合了 Claude 系列(如 Sonnet 5、Opus 5 等)、Gemini 系列、GPT 系列、DeepSeek(搜索模式默认调用 DeepSeek V4 Pro)以及通义千问、Kimi 等数十款国内外主流模型。
AI编程订阅服务,支持多款国产主流编程模型自由切换。
Seedance 2.0AI视频生成
具备卓越的物理真实性和角色一致性,可生成电影级视频内容。
方舟 Agent PlanAI智能体订阅
火山引擎推出的全场景AI智能体订阅服务,通过一个订阅整合5大主流模型和10+AI工具
SpeedAIAI内容检测降重
AI内容检测与降重工具,能有效帮助用户通过论文AI率检测
秒哒AI工具
不懂代码也能开发应用?百度秒哒:无需编程,快速搭建小程序与网站
有戏AIAI漫剧生成工具
全流程AI短剧创作工具,实现从剧本到成片的自动化生产,让“一人即剧组”成为现实。
沁言学术智能科研平台
一站式文献管理与科研写作工具,支持边写作边搜索文献,高效阅读,文献管理,

清华ACFT破解视觉源幻觉 仅0.9%数据登顶SOTA

时间:2026年9月20日 地点:北京(清华大学)、ACM MM 2026 国际会议 人物:清华大学朱军教授、胡晓林副教授;共同一作徐沛阳(本科生)、朱小佩(水木学者) 事件详情:清华大学研究团队在 ACM MM 2026 上提出"视觉源幻觉"(visual-origin hallucination)概念,并发布 ACFT(Adversarial Contrastive Fine-Tuning,对抗对比微调)解决方案。研究发现,多模态大模型(MLLM)在短输出场景(如 Yes/No 回答)下,幻觉并非来自传统认知的"语言先验",而是源于视觉特征提取错误与图文嵌入错位。论文数据显示,幻觉样本的图文嵌入余弦相似度平均仅为 -0.122(正确样本为 0.158),且注意力模式出现"目标存在时过度分散、目标不存在时错误聚焦"的反转。团队提出 AHAF(Adversarial Hallucination Attribute Flipping)方法,用极小的 ℓ∞ 球内对抗扰动翻转幻觉属性来生成对齐样本对,并据此设计 ACFT 微调方法,仅使用 COCO 数据集 0.9% 的数据量,就在 LLaVA、MiniGPT-4、Qwen2.5-VL 三个模型上,于 POPE、MME 等基准取得 SOTA,且推理阶段零额外开销。 背景:物体幻觉一直是多模态大模型可靠性的核心障碍,长期被业界归因于"语言先验"(即文本侧偏置)。现有 VCD、OPERA 等方法在解码阶段做输入级干预;Woodpecker 借助外部 grounding 模块做输出后处理;RLHF、DPO 等后训练对齐方法也被广泛采用。但这些方法在短输出场景下效果明显下降,业界对幻觉根因的理解并不完整。 影响:这项工作首次系统识别"视觉源幻觉"这一新型幻觉机制,并提出不需要大量数据和推理开销的解决方案,挑战了"幻觉主要源于语言侧"的传统认知,为多模态大模型可靠性研究开辟了新方向。在自动驾驶、医疗辅助等高风险场景中,这一发现对提升模型可靠性具有重要价值。 总结:清华大学朱军团队在 ACM MM 2026 提出"视觉源幻觉"概念并发布 ACFT 解决方案,仅用 COCO 0.9% 数据就在三大主流多模态模型上实现 SOTA,揭示多模态大模型幻觉的视觉根源。 参考来源: 1. 论文原文(arXiv):https://arxiv.org/abs/2609.00231 2. 新浪财经报道:https://finance.sina.com.cn/wm/2026-09-20/doc-inismzve6774153.shtml 3. 36氪英文版报道:https://eu.36kr.com/en/p/3991348966292486 4. Marsbit报道:https://news.marsbit.co/20260920151609960462.html 5. 搜狐报道:https://m.sohu.com/a/1078557341_121956425 6. GitHub代码:https://github.com/zxp555/ACFT_MM26 7. KuCoin News报道:https://www.kucoin.com/news/flash/tsinghua-researchers-identify-visual-origin-hallucinations-in-multimodal-models 8. OpenReview论文页:https://openreview.net/forum?id=VF5xa8k0G0