机器人不用每帧都脑补了:GlanceWAM 一招破解"想象-速度"死局

机器人不用每帧都脑补了:GlanceWAM 一招破解"想象-速度"死局

想象一下,机器人不再是"看一眼、动一下"的近视眼,而是学会"瞟一眼未来,再决定怎么动"的高手。

但这背后藏着一个让所有机器人专家头疼的悖论:让机器人在每一步控制前都"脑补"一段未来视频,预测更准吗?准!但慢得像老牛拉破车;直接放弃想象、靠肌肉记忆反应,快是快,但复杂任务一做就废。

2026 年 8 月 25 日挂在 arXiv 上的这篇论文 GlanceWAM: Sparse Test-Time Imagination for World-Action Models,用一个极其反直觉的思路,把这道题解了。

别让机器人"每一帧都想象"。

这个看似简单的偷懒,反而让机器人在厨房任务里碾压了所有对手,速度更是暴增 24 倍。

一、视频想象模型的"速度-成功率"死局

过去两年,机器人圈最火的方向叫"世界-动作模型"(World-Action Models,简称 WAM)。简单说,就是让机器人在行动前,先在脑子里"演一遍"接下来几秒钟的视频,再决定关节怎么转、夹爪怎么抓。

这条路线的祖师爷是英伟达的 Cosmos Policy、各大厂的 VLA(Vision-Language-Action)模型,核心假设是:视频生成模型在互联网上看过几亿小时的物理世界视频,它"脑补"的未来,比任何手工设计的规划器都准。

但问题来了。

视频生成模型——尤其是基于 Diffusion Transformer(DiT)的大模型——生成几秒钟视频要几百毫秒甚至几秒。可机器人控制频率是多少?工业上一般 10-50 Hz,也就是每 20-100 毫秒就要出一次动作指令。

这就像让一个思考要 3 秒才能回答的人,去当一个必须 50 毫秒回话的接线员。

学术界现在有两条岔路,但都很难看:

第一条是"同步想象"——让机器人在每一步控制前都完整生成一段未来视频。结果就是动作指令要等视频生成完才能算,延迟高到机器人像喝醉了酒,任务成功率也崩。

第二条是"放弃想象"——直接把视频生成踢出推理流程,让机器人靠历史观测+动作历史决策。延迟降下来了,但遇到没见过的场景、复杂任务,成功率直接腰斩。

这两条路,本质上是在"准"和"快"之间二选一。

而 GlanceWAM 的团队——来自弗吉尼亚理工大学、约翰斯·霍普金斯、北卡州立、圣母大学的 10 位作者——给出的答案,是第三条路:

把想象和控制彻底解耦

二、GlanceWAM:异步"瞟一眼",同步做动作

GlanceWAM 的核心架构由两部分组成:异步 Proposer(提议器)+ 同步 Action Head(动作头)。

两者住在同一个视频 DiT 里,但各干各的。

Proposer 像一个"走神"的上班族——它用一个慢时钟(论文里是几秒一次),在后台"瞟一眼"未来,生成一帧 lookahead 帧塞进 latent space(潜空间)。注意,是一帧,不是一段视频。

Action Head 则是那个 996 的打工人——它每 48 毫秒就要在潜空间里解出一组动作指令,根本不管 Proposer 那边的进度。

这两者怎么做到互不干扰?靠两个关键设计:

第一,非干扰注意力掩码(Non-interfering Attention Mask)。视频表征和动作表征在 DiT 的注意力层里被物理隔离,谁也看不见谁,但共享底层的物理世界先验。

第二,陈旧性鲁棒训练(Staleness-robust Horizon Training)。因为 Proposer 是慢时钟,它生成的"未来一帧"传到 Action Head 时可能已经过了几百毫秒——已经不算"未来"了,算"过期预测"。GlanceWAM 在训练时主动喂入各种"过期时长"的想象帧,让 Action Head 学会"看旧账做新决定"。

结果是什么?

在 24 任务 RoboCasa 厨房基准上,GlanceWAM 拿到 72.2% 成功率。

对比一下:

  • 同步想象的 Cosmos Policy:67.1%——比 GlanceWAM 低 5.1 个百分点
  • 完全放弃想象的 Co-training baseline:64.4%——比 GlanceWAM 低 7.8 个百分点
  • 也就是说,GlanceWAM 用 24 倍的速度提升,同时打赢了"全想象派"和"无想象派"

在 LIBERO 基准上,GlanceWAM 直接干到 99.0% 成功率,接近满分。

而且,所有这些成绩,是在纯演示训练(purely on demonstrations)下取得的——没有奖励函数、没有在线 RL、没有大规模遥操数据。

就一台 NVIDIA A100,48 毫秒出一次动作。

三、这不是一个机器人技巧,是 AI 系统的架构哲学

如果只看 72.2% 和 99.0% 这两个数字,这只是一篇顶会论文。

但如果你把视角拉远,会发现 GlanceWAM 戳中了一个更根本的问题:

过去十年,AI 系统的主流范式是"端到端"——输入到输出,中间不分离。AlphaGo 是端到端,GPT-4 是端到端,VLA 模型也是端到端。这种范式的诱惑在于:理论最优、训练简单。

但端到端的代价是:思考的时延直接卡死了行动的频率

你不可能让一个 GPT-5 思考 30 秒,然后让机器人再等 30 秒——物理世界不等人。

GlanceWAM 的解法,本质上是把"思考"从"行动的关键路径"上剥离出去。

Proposer 思考得再慢,也不影响 Action Head 48 毫秒出一次动作。两者通过潜空间+过期容忍机制弱耦合。

这跟人类大脑的运作方式,何其相似。

人类的"快速思考"(System 1)——开车、躲球、夹菜——靠的是小脑和基底核,几百毫秒就能反应;"慢速思考"(System 2)——下棋、写论文、规划周末——靠的是前额叶皮层,可以花几小时、几天。

但这两个系统不是串行阻塞的——你不会等 System 2 想清楚"这顿饭值不值得吃"再动筷子。System 1 在干活,System 2 在后台慢慢"瞟一眼"未来。

GlanceWAM 的 Proposer + Action Head,就是 System 2 + System 1 在硅基上的第一次工程化复刻。

更让人后背发凉的是,这种架构天然适配未来 5-10 年的 AI 大趋势:

  • 当视频生成模型从 1080p/30fps 升级到 4K/60fps,Proposer 的"想象"质量会指数级提升,Action Head 的决策上限会跟着水涨船高
  • 当世界模型从"预测下一帧"升级到"预测多模态未来"(触觉、力反馈、声音),Action Head 的输入维度会爆炸,但异步架构不会崩
  • 当 AI 共生组织(人+AI 协作)真正落地,机器人的"快速反应"和"深度规划"分属不同时间尺度,是必然的——没有人能接受一个"想 3 秒再迈一步"的机器人同事

GlanceWAM 不只是一个 RoboCasa 厨房任务上的 SOTA,它是一张未来 10 年 AI 系统的架构草图:

四、当机器人学会"偷懒",人类该害怕什么

所有突破背后,都藏着一个反直觉的真相。

GlanceWAM 的核心洞察是:机器人不需要每一步都"看清未来"才能做好。一帧过期几百毫秒的想象,加上潜空间里的肌肉记忆,足够搞定 99% 的日常任务。

这跟 AGI 怀疑论者的直觉完全相反。

怀疑论者说:机器人要想真正通用,必须有完整的世界模型,必须能"脑补"出任意时长的未来。

GlanceWAM 的回答是:不必

异步、稀疏、可过期——这才是物理世界 AI 的真正语法。

一个每秒想 50 次但每次只想 1 帧的机器人,比一个每秒想 0.1 次但每次想 1 小时的机器人,在物理世界里更有用。

这个发现的二阶影响是:当 AI 学会"偷懒",人类的"勤奋"溢价会进一步压缩。

过去我们以为,AI 取代人类是因为它"想得更深"。但 GlanceWAM 告诉我们——AI 取代人类,可能是因为它想得恰到好处

不多想,不少想,不同时想。

这才是 2026 年 AI 文明最让人倒吸一口凉气的地方。

不是它变聪明了,是它学会了在正确的时间,用正确的速度,正确地偷懒

📄 论文原文arXiv:2608.23927v1

🔍 关键词 Tags

#世界动作模型 #机器人学习 #视频生成 #扩散变换器 #潜在空间 #异步推理 #具身智能 #测试时想象

关于我们
宏天有鸣是创新的AI数字员工解决方案公司,核心团队来自中国科学技术大学。我们提供从咨询规划、方案落地到协助运营的一站式服务,协助企业把AI变成能干活、不休息的"数字员工",向AI共生组织演进,持续降本、提效、增收:
- 品牌推广数字员工:能自动写文章,做视频,运营自媒体账号矩阵;
- 全网拓客数字员工:24小时在抖音、小红书等平台自动找客户;
- 金牌销售数字员工:复制销冠经验,推动潜在客户签单。