论文
Human-level control through deep reinforcement learning DQN 用深度网络学习 Q 值,在 Atari 游戏上达到人类水平。
- 会议/期刊
- Nature
- 发表年份
- 2015
- DOI
- 10.1038/nature14236
硅基参考论文库整理具身智能论文的作者、机构、会议、方法与代码关联;同一板块也可阅读论文解读跟进文章。
清华联合正行创新、无问芯穹提出 Harness VLA:记忆增强的 Harness 层把冻结 VLA 封装为可重试的接触丰富原语,与解析原语组合执行,零微调在 LIBERO-Pro 拿下 82.4%,低成本路线正面击败重训派。
蚂蚁灵波发布 LingBot-VA 2.0:以 SemVAE 统一视觉与动作分词、因果预训练配稀疏 MoE 骨干、异步推理实现高频闭环控制,真机验证少样本泛化。具身原生路线与暴力 Scaling 路线正面对照。
小米机器人团队发布Xiaomi-Robotics-1,用10万+小时UMI真实操作轨迹预训练VLA模型,RoboCasa365以57.4%刷新SOTA,代码与权重将开源。
DQN 用深度网络学习 Q 值,在 Atari 游戏上达到人类水平。
深度生成模型综述,Salakhutdinov方向代表。
Oxford机器人场景学习与SLAM方向代表。
SMPL人体模型,人体姿态估计与动画标准。
VGGNet极深卷积网络,视觉识别里程碑。
Adam优化器,深度学习最广泛使用的优化算法之一。
知识蒸馏,模型压缩与教师-学生范式奠基。
Faster R-CNN区域提议网络,实时目标检测奠基。
TRPO策略优化算法,强化学习稳定性方向代表。
结合物理引擎与深度学习感知物体物理属性。
用序列到序列模型做句法分析,把语法解析当作翻译任务。