论文
InternVL: Scaling up Vision Foundation Models and Aligning for Generic Visual-Linguistic Tasks InternVL视觉-语言基础模型,上海AI Lab代表。
- 会议/期刊
- CVPR
- 发表年份
- 2024
硅基参考论文库整理具身智能论文的作者、机构、会议、方法与代码关联;同一板块也可阅读论文解读跟进文章。
清华联合正行创新、无问芯穹提出 Harness VLA:记忆增强的 Harness 层把冻结 VLA 封装为可重试的接触丰富原语,与解析原语组合执行,零微调在 LIBERO-Pro 拿下 82.4%,低成本路线正面击败重训派。
蚂蚁灵波发布 LingBot-VA 2.0:以 SemVAE 统一视觉与动作分词、因果预训练配稀疏 MoE 骨干、异步推理实现高频闭环控制,真机验证少样本泛化。具身原生路线与暴力 Scaling 路线正面对照。
小米机器人团队发布Xiaomi-Robotics-1,用10万+小时UMI真实操作轨迹预训练VLA模型,RoboCasa365以57.4%刷新SOTA,代码与权重将开源。
InternVL视觉-语言基础模型,上海AI Lab代表。
OLMo开放大语言模型与训练栈,开放科学代表。
提出分层机器人 Transformer,官网摘要称成功率提升 20-30%,推理速度近乎翻倍。
提出预测-动作联合去噪框架,将图像预测与动作输出在同一扩散过程中学习。
利用视频扩散模型预测视觉表征作为机器人策略输入,实现通用机器人策略。