大语言模型的成功路径是否可以直接复制到机器人身上?蚂蚁灵波团队在最新论文 LingBot-VA 2.0 中给出了一个不同的答案:与其把机器人能力嫁接到现成的视觉-语言模型上,不如从第一天起就为具身智能设计一个原生的视频-动作基础模型。
这篇 7 月中旬挂上 arXiv 的论文(arXiv:2607.08639),把「具身原生」(embodied-native)作为整个技术路线的出发点。团队认为,主流 VLA 的通病在于视觉、语言与动作三个模态是分阶段拼接的:视觉-语言骨干先在互联网数据上预训练,动作头再在机器人数据上补课,两者的表征空间从未真正对齐。
SemVAE:把视觉和动作装进同一个分词器
LingBot-VA 2.0 的第一个关键组件是语义视觉-动作分词器 SemVAE。它把视觉重建目标和动作潜空间统一到同一个 tokenizer 里,让视频帧和机器人动作在离散 token 层面共享词表。
这一步的意义在于:模型预测「下一帧会发生什么」和预测「下一步该做什么动作」,从两个任务变成了同一个自回归序列建模任务。视觉预测的物理先验会自然渗透进动作生成,而不需要额外的对齐损失。
因果预训练 + 稀疏 MoE 骨干
架构上,LingBot-VA 2.0 由语言模型、MoE 视频模型和动作模型三部分协同组成。视频骨干采用稀疏专家混合(MoE)设计,在扩大参数容量的同时控制单次推理的激活参数量。
预训练遵循严格的因果范式:模型只能基于过去的观测预测未来,这与很多依赖双向注意力的视频模型不同。团队的判断是,因果结构才是可部署机器人策略的正确归纳偏置——真实世界里没有「看到未来」这回事。
异步推理:高频闭环控制的工程答案
论文另一个值得关注的设计是异步推理方案。大模型推理慢、机器人控制要求快,这对矛盾是所有 VLA 落地的拦路虎。LingBot-VA 2.0 把高层规划器(VLM)与低层执行器(VA)拆成两个节奏运行的闭环:规划器低频思考,执行器高频出动作。
这种分层控制让系统可以在保持大模型语义理解能力的同时,把动作输出频率推到实时控制所需的量级,避免机器人在等待推理时「卡顿」。
从工程角度看,异步方案还带来一个附带好处:规划器和执行器可以分别部署在不同算力档位的硬件上——重的 VLM 跑在边缘服务器或云端,轻的动作模型跑在机器人本体,通信只传递紧凑的中间表征。这为「云脑 + 本体小脑」的商业化部署形态提供了论文级别的支撑。
真机验证与少样本泛化
团队在真实机器人部署中验证了模型在复杂操作任务上的少样本泛化能力:面对新物体、新场景,模型只需少量示教数据即可适配,而不是每换一个任务就重训一遍。
论文展示的任务谱系覆盖了从桌面抓放、柔性物体整理到多步骤的厨房操作。值得注意的是,在需要理解物理因果的任务上——例如判断推倒一摞物体会发生什么——具身原生预训练的优势最为明显,因为视频预测目标迫使模型内化了朴素物理学。
路线之争:原生统一 vs 暴力 Scaling
对产业界来说,这篇论文的信号很清晰:中国大厂系的具身智能团队不再满足于在开源 VLA 上做微调,而是开始自研从 tokenizer 到骨干网络的全栈基础模型。蚂蚁灵波选择的「视频-动作原生统一」路线,与小米 Xiaomi-Robotics-1 的「十万小时真实数据暴力 Scaling」形成了鲜明的路线对照。
更进一步说,如果视频-动作原生统一的路线被验证有效,它对上游数据生态的含义是:互联网上海量的第一人称视频、操作教程都可能成为具身预训练的燃料,而不再局限于昂贵的遥操作示教数据。这会显著改变具身智能的数据成本曲线。
两条路线谁能率先跑通商业闭环还没有答案,但可以确定的是:具身基础模型的牌桌上,视频生成、动作生成与语言理解正在加速收敛成同一件事。开源社区也将是这场路线竞赛的直接受益者——团队已公布代码仓库与模型权重的开源计划。
论文全文可在 arXiv:2607.08639 查阅,架构图与演示视频见蚂蚁灵波官方项目页,代码仓库与模型权重将按团队公布的计划陆续开源。本文基于公开报道整理。