智能AI
morning
不成文的基准:抽象感知推理中多模态机器学习的新挑战
摘要
arXiv:2608.14558v1 Announce Type: new Abstract: Current multimodal models have demonstrated remarkable proficiency in recognizing static visual and auditory content. However, their capacity for abstra...
and
the
perceptual
models
for
reasoning
this
cognitive
new
their
2026-08-18
1 阅读
约1分钟阅读
Garima Arya Yadav, Nilay Yilmaz, Yezhou Yang
字号:
arXiv:2608.14558v1 公告类型:新 摘要:当前的多模态模型在识别静态视觉和听觉内容方面表现出了卓越的能力。然而,它们的抽象感知推理能力,即从动态生成过程中推断出看不见的信息的能力,仍然是一个关键且尚未充分探索的前沿领域。在本文中,我们介绍了不成文基准,这是一项旨在探讨这种抽象感知和认知能力的新挑战。我们将核心任务定义为声动单词推理:模型必须破译单词,跨越 3 种不同的书写风格,仅根据钢笔划痕的音频和手部动作的视频书写,没有任何可见的墨水痕迹。我们的评估结果揭示了人类和机器性能之间的巨大差距:虽然人类参与者实现了较高的有序字母准确率(超过 80%),但领先的多模态机器学习模型(包括 GPT-4o 和 Gemini 2.5-Pro)却表现不佳,未能超过 10%。此外,我们发现模型中存在矛盾的融合效应,提供两种模式通常会降低性能而不是提高性能。这一发现表明他们为这项认知任务综合互补感知线索的能力出现了根本性的崩溃。这些发现凸显了跨模式因果推理和对这种认知和直觉感知推理所必需的微观运动学的理解的显着局限性。
这篇文章对您有帮助吗?
订阅66必读
每日精选科技资讯,直达你的邮箱