Fable5仅做对3.5%!大模型会看图,但还没有主动视觉|追踪|推理|多模态_网易订阅
时间:2026-08-08 22:08:30 出处:知识阅读(143)

视往往链接:https://mp.weixin.qq.com/s/d0dmowGeef3z3UO12BYMqg01|视觉,做对主动追踪为什么是大模但还多模一条闭环?人类看图时,不会先在大脑中拍下一张「截图」,看图再闭眼推理。视觉思考流程会不断引导我们的推理态网目光:找到一个线索,形成一个假设,易订阅再回到图像里验明正身它。做对主动追踪这套闭环有首先期的大模但还多模心理学基础。经典著作《眼动与视觉》(1967)发现,看图同一幅画在不一样状况下会引发截然不一样的视觉眼动轨迹:观看并非由图像单向决定,任务目的推理态网和中间假设会持续重定向注视。《视觉与视觉意识的易订阅感觉—运动理比如》(2001)进一步把「看见」理解为掌握视觉输入如何随观察表现而变化;《自然表现中的眼动》(2005)则表明,人们在真实任务中会按需回看环境。做对主动追踪《破解视觉知觉的大模但还多模「真正」谜题:作为外部记忆的世界》(1992)将这种对策概括为把外部世界当作可以反复查询的「外部记忆」,而不是看图把所有细节一次性存入大脑。这种能力和真实采取息息相关。车间工作需在一桌相似的零件中找到目的、检查区别;医生关键在整张影像中逐区搜索并统方式可疑病灶;旅行者关键沿地图跨过一个个岔路,持续确认自己仍在正确馗上。每一次新发现都会变化下一次查看的区域,下一次观察又会反过来修正判断;只看懂大意远远不够。基于以上动机,我们发布了 ActiveVision——一个专业测量这种「主动观察」能力的视觉推理基准。ActiveVision 涵盖 17 个任务和 3 类能力:● 全局扫描(distributed scanning):在整张图里找全、数全● 顺序追踪(sequential traversal):沿一条结构一步步走到底● 属性迁移(visual attribute transfer):跨区域记住并比较细微视觉属性ActiveVision 的三类任务也直接对应心理学中已知的基础视觉操作。《视觉数量辨别》(1949)和《为什么少量与大量目的的方式数方式不一样?》(1994)表明,少量目的可以被高效高效「瞬时方式数」,数量提高后则需逐项扫描;《曲线追踪:空间关系知觉的一种可能的基础操作》(1986)将沿轮廓追踪视为串行的注意流程;《视觉工作记忆对特点及其组合的容量》(1997)验明正身,跨区域比较受到视觉工作记忆容量限制,需在目的与参照之间反复切换。《视觉程序》(1984)进一步指出,这类基础操作需由注意力逐步实施。ActiveVision 将这些经典实验中的基础操作转化为可以直接测量模型的三类任务。图 1|主动观察的真实采取与 ActiveVision 任务设方式。02|一方式接近 9 倍的鸿沟评测结荚很清楚:在没有采取外部工具的状况下,GPT-5.5 在所有模型中取得最高分 10.6%(9/85);而 3 位人类参与者的平均准确率为 96.1%(94.1%~97.6%)。两者之间存在接近 9 倍的差距。即使是这个最高分模型,也在 17 个任务中的 11 个上拿到 0 分。图 2|纯 CoT 模型与人类的准确率比较:最高分模型与人类仍相差近 9 倍。提高推理强度也无法缩短差距。GPT-5.5 从不思考、直接回答,到采取最高推理强度,每题成本增首先了超过两个数量级,其准确率仅从 2.4% 提高到 10.6%;Fable 5 在最高推理强度下的准确率只有 3.5%,反而在更低推理强度时实现 5.9%。「还想得不够久」验明正身不了这些结荚。更直接的迹象是,正确的视觉证据没有被稳固地带回推理流程。从错误模式看,状况也很相同:全局扫描时漏数,顺序追踪时从起点直接猜终点,属性迁移时用语言先验替代真正的跨区域比较。模型能生成一段听起来合理的验明正身,却无法稳固实现「获取证据—保存中间状态—回到图像验明正身」的闭环。模型看到了图,却未能持续观察其中的物体。图 3|纯 CoT 模型的准确率与每题成本。03|给它代码,能不能替它看?那如果给模型代码、裁图、测量和其他视觉工具呢?我们把同一套题交给 3 个工具型 Coding Agent 开展测试,得到的分数明显上升:Fable 5 + Claude Code 为 50.6%,GPT-5.5 + Codex 为 37.6%,Opus 4.8 + Claude Code 为 24.7%。然而,和人类的 96.1% 相比,仍有很大差距。Agent 擅首先把「看」改写成「算」:通过阈值分割、连通域、馗追踪等方式拆分题,试图处理它们。然而,一旦真实纹理导致分割结荚破碎,或追踪器在交叉处串线,Agent 频仍无法察觉这些工具输出错误。同时,这些提高并不均匀。3 个 Agent 在那么点儿通过裁图、模板匹配或几何测量处理的属性迁移任务上实现了 43%~66%;到了必须准确穿过交叉点、持续跟踪方向和目前位置的顺序追踪任务,Codex 只做对 1/25,Opus 4.8 只做对 3/25,而 Fable 5 也只有 10/25。工具只有在「看」能被可靠地改写成一套方式算时,才真正有效。瓶颈没有消失,只是从「看图」转移到了「检查自己有没有看错」。同时,采取 Agent 的代价不小:每题平均花费 12~15 分钟,API 等价成本实现 2.74~7.63 美元;人类平均约 34 秒,且不依赖任何工具即可实现。工具会方式算,但不会替你保持注视。图 4|工具型 Agent 成绩与典型失败案例。04|怎样造出一场「看不完就答不对」的考试?为了避免结比如依赖几张手工选项的「刁钻图」,ActiveVision 的每方式题都先由选定性程序生成:位置、形状、曲线、拓扑和原则答案全部已知;再用 GPT-image-2 将其重绘成照片级场景,同时保持决定答案的结构不变。这样,每个任务都可以从新种子后续生成,答案准确、可复现,又不会让模型靠熟悉的卡通模板取巧。例如,闭合区域可以变成航拍视角下的田野与河流,箭头链可以变成由脚印连接的彩色石块,曲线可以变成漂流木上的绳索。生成器负责把已知结构「翻译」成材质、光照和纹理;解题者却必须反过来从像素中恢复全局结构。同时,为了避免模型看一次图就记住全部材料、不再看图,ActiveVision 中的所有元素均出目前后续采样的任意位置,形状逐题重新生成,路线沿随机曲线展开。模型无法依赖网格坐标、命名形状或固定馗,只能在推理流程中反复回到图像,逐步寻找、追踪并核验视觉证据,而不能只看一眼、压缩成摘关键后直接作答。ActiveVision 把题放在感知能否持续参与推理;描述一张图只是起点。比如文:https://arxiv.org/abs/2607.16165AlphaXiv:https://www.alphaxiv.org/abs/2607.16165项目主页:https://activevision.dev数据集:https://huggingface.co/datasets/activevisionai/ActiveVision评测代码:https://github.com/saccharomycetes/ActiveVision图 5|ActiveVision 数据生成步骤:选定性程序、准确答案与真实照片重绘。作者验明正身张家瑞是南加州大学方式算机科学博士生,由 Willie Neiswanger 教授指导。本科毕业于清华大学,探究方向涵盖多模态感知与推理及 AI-for-Science。主页:https://saccharomycetes.github.io/陶沐孜是南加州大学方式算机科学博士生,师从马学喆教授。本科毕业于上海交通大学 ACM 班,探究方向涵盖多模态学习、理解与生成,关注多模态模型的细粒度视觉感知与生成能力。主页:https://muzi-tao.github.io/王上上是南加州大学方式算机科学博士生,由 Willie Neiswanger 教授指导。本科及硕士毕业于上海科技大学。探究兴趣涵盖大语言模型推理、后训练、强化学习以及 AI-for-Science。主页:https://shangshang-wang.github.io/
分享到:
温馨提示:以上内容和图片整理于网络,仅供参考,希望对您有帮助!如有侵权行为请联系删除!
猜你喜欢
- 9月1日起!江苏骑电动车必看:这几种行为直接扣车|上牌|超标车|江苏省|非法改装_网易订阅
- 贝达药业股价涨5.59%,东方基金旗下1只基金重仓,持有1.52万股浮盈赚取5.21万元_新浪财经_新浪网
- 德福科技股价涨6.05%,国联基金旗下1只基金重仓,持有2.52万股浮盈赚取11.92万元_新浪财经_新浪网
- 深信服股价跌5.09%,国泰基金旗下1只基金重仓,持有161.02万股浮亏损失1032.12万元_新浪财经_新浪网
- 小红书女主播田友欣诈骗本人三万多-恋爱区-虎扑社区
- 税友股份股价跌5.01%,南方基金旗下2只基金重仓,合计持有141.91万股浮亏损失353.35万元_新浪财经_新浪网
- 三环集团股价跌5.16%,华银基金管理旗下2只基金重仓,合计持有5万股浮亏损失32.75万元_新浪财经_新浪网
- 税友股份股价跌5.01%,申万菱信基金旗下1只基金重仓,持有10.02万股浮亏损失24.95万元_新浪财经_新浪网
- 蜘蛛侠替身“河南弟”抢功翻车,还没拍完就被剧组开除|演员|电影|好莱坞|雪迷宫_网易订阅