论文
UP-VLA: A Unified Understanding and Prediction Model for Embodied Agent 首次构建统一视觉-语言-动作模型,增强空间细节和动态信息理解。
- 会议/期刊
- Accepted to ICML2025
- 发表年份
- 2025
硅基参考论文库整理具身智能论文的作者、机构、会议、方法与代码关联;同一板块也可阅读论文解读跟进文章。
清华联合正行创新、无问芯穹提出 Harness VLA:记忆增强的 Harness 层把冻结 VLA 封装为可重试的接触丰富原语,与解析原语组合执行,零微调在 LIBERO-Pro 拿下 82.4%,低成本路线正面击败重训派。
蚂蚁灵波发布 LingBot-VA 2.0:以 SemVAE 统一视觉与动作分词、因果预训练配稀疏 MoE 骨干、异步推理实现高频闭环控制,真机验证少样本泛化。具身原生路线与暴力 Scaling 路线正面对照。
小米机器人团队发布Xiaomi-Robotics-1,用10万+小时UMI真实操作轨迹预训练VLA模型,RoboCasa365以57.4%刷新SOTA,代码与权重将开源。
首次构建统一视觉-语言-动作模型,增强空间细节和动态信息理解。
首次将在线强化学习系统化嵌入 VLA 框架。
首次提出可控生成式世界模型,突破单一视角、动作预测不精准、多时一致性差等限制。