清华大学联合正行创新、无问芯穹提出 Harness VLA:在冻结 VLA 之上增加记忆增强的 Harness 层,把 VLA 当作可重试的接触丰富原语,与解析原语组合执行。无需微调即可将预训练 VLA 扩展到扰动 tabletop、厨房和双手任务,在 LIBERO-Pro 和 RoboCasa365 上大幅刷新 SOTA。arXiv:2607.08448。
具身智能论文库
硅基参考论文库整理具身智能论文的作者、机构、会议、方法与代码关联;同一板块也可阅读论文解读跟进文章。
最近更新
清华联合正行创新、无问芯穹提出 Harness VLA:记忆增强的 Harness 层把冻结 VLA 封装为可重试的接触丰富原语,与解析原语组合执行,零微调在 LIBERO-Pro 拿下 82.4%,低成本路线正面击败重训派。
蚂蚁灵波发布 LingBot-VA 2.0:以 SemVAE 统一视觉与动作分词、因果预训练配稀疏 MoE 骨干、异步推理实现高频闭环控制,真机验证少样本泛化。具身原生路线与暴力 Scaling 路线正面对照。
小米机器人团队发布Xiaomi-Robotics-1,用10万+小时UMI真实操作轨迹预训练VLA模型,RoboCasa365以57.4%刷新SOTA,代码与权重将开源。
蚂蚁灵波提出 LingBot-VA 2.0,一个从头为具身智能设计的视频-动作基础模型。论文核心包括语义视觉-动作分词器 SemVAE、因果预训练范式、稀疏 MoE 骨干,以及异步推理方案,实现高频实时闭环控制。真实部署验证了模型在复杂操作任务中的少样本泛化能力。arXiv:2607.08639。
小米机器人团队提出 Xiaomi-Robotics-1,一个基于 10 万+小时 UMI 真实操作轨迹预训练的视觉-语言-动作基础模型。通过可扩展的自动标注流水线将轨迹片段标注为自然语言状态迁移,模型在 RoboCasa365 与 RoboDojo 上刷新 SOTA,并展现出数据与模型规模的良好扩展性。代码与模型检查点将开源。
Mobile ALOHA 是斯坦福大学于 2024 年 1 月发布的双臂移动操作研究论文(arXiv:2401.02117,后被 CoRL 2024 接收),作者为 Zipeng Fu、Tony Z. Zhao 与 Chelsea Finn。论文在 ALOHA 双臂遥操作平台上加装移动底盘与全身遥操作界面,构成低成本全身遥操作系统用于数据采集,并通过与静态 ALOHA 数据集协同训练,仅用约 50 次演示即可将移动操作任务成功率提升至约 90%,可自主完成炒菜上菜、开双门柜、呼叫并进入电梯等任务。
GaussianFace(2014)由汤晓鸥团队提出,在 LFW 数据集上取得 98.52% 的识别准确率,是世界上首个超越人眼(97.53%)的人脸识别算法,由香港中文大学多媒体实验室(MMLab)完成,奠定了商汤科技创立前的技术突破。
- 发表年份
- 2014
DeepID 系列由香港中文大学多媒体实验室(MMLab)王晓刚、汤晓鸥团队提出,是早期基于深度学习的面部识别表征方法,将人脸识别准确率提升至 99% 以上,率先突破工业应用红线,是 MMLab 走向产业化的重要基础研究。
- 发表年份
- 2014
《Single Image Haze Removal Using Dark Channel Prior》(CVPR 2009)由何恺明、孙剑、汤晓鸥完成,提出暗原色先验单幅图像去雾方法,是 CVPR 创办以来首篇来自亚洲机构的最佳论文,也是香港中文大学多媒体实验室(MMLab)的旗舰成果。
- 会议/期刊
- CVPR
- 发表年份
- 2009
Diffusion Policy 用扩散模型学习机器人视觉运动策略,提升泛化与多模态。
- 会议/期刊
- RSS
- 发表年份
- 2023
DreamerV3 用世界模型在 150+ 任务上单一超参数达到 SOTA,证明世界模型可行性。
- 发表年份
- 2023
AlphaGo 用深度神经网络与蒙特卡洛树搜索击败围棋世界冠军李世石。
- 会议/期刊
- Nature
- 发表年份
- 2016
- DOI
- 10.1038/nature16961
AlexNet 在 ImageNet 上大幅提升分类精度,开启深度学习时代。
- 会议/期刊
- NeurIPS
- 发表年份
- 2012
RT-2 把视觉语言模型迁移到机器人控制,实现 VLA 统一架构。
- 发表年份
- 2023
提出语言模型性能随参数、数据、算力幂律缩放,指导大模型训练。
- 发表年份
- 2020
提出 Transformer 架构,奠定现代大模型基础。
- 会议/期刊
- NeurIPS
- 发表年份
- 2017
DQN 用深度网络学习 Q 值,在 Atari 游戏上达到人类水平。
- 会议/期刊
- Nature
- 发表年份
- 2015
- DOI
- 10.1038/nature14236
Open X-Embodiment 汇集全球 22 个机构百万机器人演示,训练通用 RT-X 模型。
- 会议/期刊
- ICRA
- 发表年份
- 2023
PaLM-E 将 PaLM 与具身感知融合,实现多模态机器人规划。
- 会议/期刊
- ICML
- 发表年份
- 2023
SayCan 用大语言模型结合机器人可行性,实现长程任务规划。
- 会议/期刊
- CoRL
- 发表年份
- 2022
RT-1 用 Transformer 学习真实机器人控制策略,13 万演示训练。
- 发表年份
- 2022
InstructGPT 用 RLHF 对齐 GPT-3,使模型按人类指令生成更有用回答。
- 会议/期刊
- NeurIPS
- 发表年份
- 2022
CLIP 用 4 亿图文对做对比学习,实现零样本图像分类与跨模态检索。
- 会议/期刊
- ICML
- 发表年份
- 2021
多智能体学习通信,Foerster方向代表。
- 会议/期刊
- NeurIPS
- 发表年份
- 2016
Cobot社会统计代理,Isbell早期RL应用。
- 会议/期刊
- AAAI
- 发表年份
- 2000
提出 Chinchilla 缩放定律:数据与算力需同步增长,70B 模型可达更优性能。
- 会议/期刊
- NeurIPS
- 发表年份
- 2022
Anthropic 提出 Constitutional AI,用 AI 反馈而非纯人类反馈实现无害对齐。
- 发表年份
- 2022
AlphaFold 通过深度学习实现高精度蛋白质结构预测,解决生物学五十年难题。
- 会议/期刊
- Nature
- 发表年份
- 2021
- DOI
- 10.1038/s41586-021-03819-2
GPT-3 展示 175B 参数语言模型在少样本学习任务上的涌现能力。
- 会议/期刊
- NeurIPS
- 发表年份
- 2020
Web挖掘群体智慧,松尾方向代表。
- 会议/期刊
- IEEE Intelligent Systems
- 发表年份
- 2010
COMA多智能体策略梯度,多智能体RL里程碑。
- 会议/期刊
- AAAI
- 发表年份
- 2018
Keepaway机器人足球,Stone强化学习基准。
- 会议/期刊
- AAMAS
- 发表年份
- 2005
深度网络逐层贪心训练,深度学习预训练奠基。
- 会议/期刊
- NIPS
- 发表年份
- 2007
Options框架,分层强化学习时间抽象奠基。
- 会议/期刊
- Artificial Intelligence
- 发表年份
- 1999
形状上下文,物体识别经典特征。
- 会议/期刊
- IEEE TPAMI
- 发表年份
- 2002
安全RL综述,Kohli可信AI方向。
- 会议/期刊
- DeepMind Safety
- 发表年份
- 2017
Pluribus多人扑克AI,不完全信息博弈里程碑。
- 会议/期刊
- Science
- 发表年份
- 2019
Cicero外交AI,结合语言模型与策略推理。
- 会议/期刊
- Science
- 发表年份
- 2022
Google Brain大规模无监督学习发现高层特征(猫脸神经元)。
- 会议/期刊
- ICML
- 发表年份
- 2012
神经概率语言模型,词向量与神经LM奠基。
- 会议/期刊
- JMLR
- 发表年份
- 2003
用神经网络降维,自编码器深度学习奠基。
- 会议/期刊
- Science
- 发表年份
- 2006
MRF图像分割,李子青方向代表。
- 会议/期刊
- IEEE TPAMI
- 发表年份
- 1998
神经网络表达能力理论,Arora深度学习理论代表。
- 会议/期刊
- COLT
- 发表年份
- 2017
BEVDet多相机3D检测,自动驾驶感知。
- 会议/期刊
- ECCV
- 发表年份
- 2022
重新思考泛化,深度学习理论里程碑。
- 会议/期刊
- ICLR
- 发表年份
- 2017
InternVL视觉-语言基础模型,上海AI Lab代表。
- 会议/期刊
- CVPR
- 发表年份
- 2024
MTCNN人脸检测对齐联合模型,工业最广泛人脸检测之一。
- 会议/期刊
- IEEE SPL
- 发表年份
- 2016
InternVideo视频理解基础模型。
- 会议/期刊
- arXiv
- 发表年份
- 2023
FCOS全卷积单阶段检测,无锚框检测代表。
- 会议/期刊
- ICCV
- 发表年份
- 2019
MMDetection开放目标检测工具箱,OpenMMLab核心。
- 会议/期刊
- arXiv
- 发表年份
- 2019
深度生成模型综述,Salakhutdinov方向代表。
- 会议/期刊
- Annual Review of Statistics
- 发表年份
- 2015
子模函数最大化综述,Krause方向代表。
- 会议/期刊
- Tractability
- 发表年份
- 2012
支持向量机扩展,Schölkopf核方法早期代表。
- 会议/期刊
- NIPS
- 发表年份
- 1997
贝叶斯暗知识,朱军方向代表。
- 会议/期刊
- NeurIPS
- 发表年份
- 2018
虹膜识别序数特征,谭铁牛方向代表。
- 会议/期刊
- Journal of the Optical Society of America
- 发表年份
- 2005
悟道大模型,智源中国超大规模预训练模型。
- 会议/期刊
- BAAI Workshop
- 发表年份
- 2021
陷门函数理论,姚期智密码学奠基工作。
- 会议/期刊
- FOCS
- 发表年份
- 2002
安全多方计算(百万富翁问题),姚期智密码学里程碑。
- 会议/期刊
- FOCS
- 发表年份
- 1992
TSN视频动作识别,中科院自动化所代表。
- 会议/期刊
- ECCV
- 发表年份
- 2016
因果推断综述,Schölkopf因果ML方向。
- 会议/期刊
- arXiv
- 发表年份
- 2023
Oxford机器人场景学习与SLAM方向代表。
- 会议/期刊
- IJRR
- 发表年份
- 2015
YOLO单阶段实时目标检测,工业最广泛检测器之一。
- 会议/期刊
- CVPR
- 发表年份
- 2016
OLMo开放大语言模型与训练栈,开放科学代表。
- 会议/期刊
- ACL
- 发表年份
- 2024
腿式机器人敏捷运动强化学习,Nature子刊。
- 会议/期刊
- Science Robotics
- 发表年份
- 2018
SMPL人体模型,人体姿态估计与动画标准。
- 会议/期刊
- ACM TOG
- 发表年份
- 2015
Lucas-Kanade光流算法,视觉对齐奠基。
- 会议/期刊
- IJCAI
- 发表年份
- 1981
VGGNet极深卷积网络,视觉识别里程碑。
- 会议/期刊
- ICLR
- 发表年份
- 2015
光流估计理论分析,Black方向代表。
- 会议/期刊
- IJCV
- 发表年份
- 2010
MC Dropout,用dropout近似贝叶斯推断。
- 会议/期刊
- ICML
- 发表年份
- 2016
ANYmal四足机器人,腿式机器人代表平台。
- 会议/期刊
- IROS
- 发表年份
- 2016
概率PCA,贝叶斯降维奠基。
- 会议/期刊
- JRSS
- 发表年份
- 1999
Adam优化器,深度学习最广泛使用的优化算法之一。
- 会议/期刊
- ICLR
- 发表年份
- 2015
知识蒸馏,模型压缩与教师-学生范式奠基。
- 会议/期刊
- NeurIPS Workshop
- 发表年份
- 2015
深度学习教科书,领域标准教材。
- 会议/期刊
- MIT Press
- 发表年份
- 2016
NASNet神经架构搜索,用RL搜索网络结构。
- 会议/期刊
- ICLR
- 发表年份
- 2017
DrQA开放域问答系统,检索+阅读奠基。
- 会议/期刊
- ACL
- 发表年份
- 2017
神经ODE,用微分方程定义网络,连续深度学习奠基。
- 会议/期刊
- NeurIPS
- 发表年份
- 2018
视觉常识推理VCR,认知级视觉理解。
- 会议/期刊
- CVPR
- 发表年份
- 2019
REALM检索增强语言模型预训练,RAG前身。
- 会议/期刊
- ICML
- 发表年份
- 2020
层归一化,Transformer训练的标准组件。
- 会议/期刊
- arXiv
- 发表年份
- 2016
反向传播算法奠基论文,神经网络训练核心。
- 会议/期刊
- Nature
- 发表年份
- 1986
MoCo动量对比学习,视觉自监督代表。
- 会议/期刊
- CVPR
- 发表年份
- 2020
MAE掩码自编码器,视觉自监督学习新范式。
- 会议/期刊
- CVPR
- 发表年份
- 2022
贝叶斯概念学习,Tenenbaum认知建模代表。
- 会议/期刊
- NIPS
- 发表年份
- 2007
Mask R-CNN实例分割里程碑,目标检测分割统一框架。
- 会议/期刊
- ICCV
- 发表年份
- 2017
Bigtable分布式存储,NoSQL系统奠基。
- 会议/期刊
- OSDI
- 发表年份
- 2006
Faster R-CNN区域提议网络,实时目标检测奠基。
- 会议/期刊
- NeurIPS
- 发表年份
- 2015
ResNet残差网络,超深网络训练与视觉识别里程碑。
- 会议/期刊
- CVPR
- 发表年份
- 2016
DINO自监督ViT,FAIR视觉自监督代表。
- 会议/期刊
- ICCV
- 发表年份
- 2021
R-CNN区域卷积目标检测,深度学习视觉检测开山。
- 会议/期刊
- CVPR
- 发表年份
- 2014
Seq2Seq序列到序列学习,NLP里程碑。
- 会议/期刊
- NeurIPS
- 发表年份
- 2014
MapReduce分布式数据处理,大数据系统奠基。
- 会议/期刊
- OSDI
- 发表年份
- 2004
Places场景识别数据集,场景理解基准。
- 会议/期刊
- IEEE TPAMI
- 发表年份
- 2017
可逆/关闭游戏,AI对齐中关于人类干预的形式化。
- 会议/期刊
- IJCAI
- 发表年份
- 2017
Dex-Net抓取数据集与深度抓取规划。
- 会议/期刊
- RSS
- 发表年份
- 2017
Drake机器人优化与仿真工具,模型based设计环境。
- 会议/期刊
- Software
- 发表年份
- 2016
POMDP求解算法,Kaelbling在部分可观测决策方向奠基。
- 会议/期刊
- AAAI
- 发表年份
- 1998
离线强化学习综述,Levine方向代表作。
- 会议/期刊
- arXiv
- 发表年份
- 2020
剪枝+量化+哈夫曼压缩深度网络,高效AI奠基。
- 会议/期刊
- ICLR
- 发表年份
- 2016
归一化分割图像分割经典算法,视觉图论方法代表。
- 会议/期刊
- IEEE TPAMI
- 发表年份
- 2000
SAC最大熵off-policy强化学习算法,机器人学习事实标准。
- 会议/期刊
- ICML
- 发表年份
- 2018
端到端深度视觉运动策略训练,深度RL机器人学习开山之作。
- 会议/期刊
- JMLR
- 发表年份
- 2016
基于全局共现矩阵的词向量,与Word2Vec并列的奠基表示。
- 会议/期刊
- EMNLP
- 发表年份
- 2014
JEPA自监督世界模型架构,LeCun对自主机器智能的路线图。
- 会议/期刊
- Open Review
- 发表年份
- 2022
通过逆向强化学习从专家演示学习,Abbeel奠基工作。
- 会议/期刊
- ICML
- 发表年份
- 2004
TRPO策略优化算法,强化学习稳定性方向代表。
- 会议/期刊
- ICML
- 发表年份
- 2015
主动询问人类偏好学习奖励函数,降低人机交互成本。
- 会议/期刊
- RSS
- 发表年份
- 2017
卷积神经网络LeNet在手写数字识别的应用,CNN奠基工作。
- 会议/期刊
- Proceedings of the IEEE
- 发表年份
- 1998
结合物理引擎与深度学习感知物体物理属性。
- 会议/期刊
- NIPS
- 发表年份
- 2015
流式超算架构,Dally并行计算方向代表工作。
- 会议/期刊
- ACM SIGCSE
- 发表年份
- 2007
ImageNet数据集原论文,视觉识别基准的奠基。
- 会议/期刊
- CVPR
- 发表年份
- 2009
MAML元学习算法,少样本快速适应的奠基工作。
- 会议/期刊
- ICML
- 发表年份
- 2017
Russell对有益AI的理论框架,价值对齐方向代表。
- 会议/期刊
- ECAI Keynote
- 发表年份
- 2019
用GAN学习3D物体形状的潜在空间。
- 会议/期刊
- NeurIPS
- 发表年份
- 2016
机器学习可复现性挑战与方法学规范。
- 会议/期刊
- NeurIPS Reproducibility Workshop
- 发表年份
- 2019
大规模分布式强化学习在Dota2击败人类职业队。
- 会议/期刊
- arXiv
- 发表年份
- 2019
基于人类反馈的强化学习奠基论文,RLHF范式的起点。
- 会议/期刊
- NeurIPS
- 发表年份
- 2017
通用自博弈强化学习算法,在围棋/国际象棋/将棋超越专用AI。
- 会议/期刊
- Science
- 发表年份
- 2018
在代码上训练的LLM(Codex/GPT-Code),奠定Copilot。
- 会议/期刊
- arXiv
- 发表年份
- 2021
用序列到序列模型做句法分析,把语法解析当作翻译任务。
- 会议/期刊
- NeurIPS
- 发表年份
- 2015
深度网络持续学习综述:方法、评估与开放问题。
- 会议/期刊
- arXiv
- 发表年份
- 2023
用神经网络学习可解释程序的递归执行框架。
- 会议/期刊
- arXiv
- 发表年份
- 2016
模拟人类反馈的训练环境,降低RLHF研究成本。
- 会议/期刊
- arXiv
- 发表年份
- 2023
原始音频波形生成的因果扩张卷积模型,奠定神经声码器方向。
- 会议/期刊
- arXiv
- 发表年份
- 2016
在星际争霸II击败人类职业选手的多智能体强化学习系统。
- 会议/期刊
- Nature
- 发表年份
- 2019
官网摘要称其利用 Denoising World Model 支持端到端强化学习人形机器人,并实现零样本 sim-to-real。
- 会议/期刊
- NeurIPS 2022 ICBINB workshop (spotlight)
- 发表年份
- 2022
提出即时检测与即时恢复框架。
- 会议/期刊
- Published in IROS 2024
- 发表年份
- 2023
提出分层机器人 Transformer,官网摘要称成功率提升 20-30%,推理速度近乎翻倍。
- 会议/期刊
- Accepted to CORL 2024
- 发表年份
- 2024
提出预测-动作联合去噪框架,将图像预测与动作输出在同一扩散过程中学习。
- 会议/期刊
- NeurIPS 2024
- 发表年份
- 2024
利用视频扩散模型预测视觉表征作为机器人策略输入,实现通用机器人策略。
- 会议/期刊
- ICML 2025 Spotlight Paper
- 发表年份
- 2024
首次构建统一视觉-语言-动作模型,增强空间细节和动态信息理解。
- 会议/期刊
- Accepted to ICML2025
- 发表年份
- 2025
首次将在线强化学习系统化嵌入 VLA 框架。
- 会议/期刊
- 2025 IEEE International Conference on Robotics and Automation (ICRA)
- 发表年份
- 2025
首次提出可控生成式世界模型,突破单一视角、动作预测不精准、多时一致性差等限制。
- 会议/期刊
- Robotics (cs.RO); Artificial Intelligence (cs.AI)
- 发表年份
- 2025