RoboCOIN(Bimanual Robotic Data COllection for INtegrated Manipulation)由北京智源人工智能研究院牵头、联合多家产业与高校于 2025年11月25日发布,定位高质量双臂机器人真机数据集;本批正文后半因飞书分页未齐,细节以主页为准。
- 数据类型
- 具身智能开源数据集
- 任务类型
- 双臂操作、集成操作
- 数据模态
- 双臂真机轨迹、精细标注
硅基参考数据集库建立遥操作、轨迹、多模态、RGB-D、力矩、触觉和语言数据的元索引,方便按任务、平台与协议筛选对照。
RoboCOIN(Bimanual Robotic Data COllection for INtegrated Manipulation)由北京智源人工智能研究院牵头、联合多家产业与高校于 2025年11月25日发布,定位高质量双臂机器人真机数据集;本批正文后半因飞书分页未齐,细节以主页为准。
World In Your Hands 由它石智航于 2025年12月24日开源,公开口径称其为全球首个 VLTA 多模态真实世界数据集,用于填补互联网缺动作、仿真难泛化的缺口,并为具身基座模型提供 scaling 语料。
AGIBOT WORLD 1.0 由智元于 2024年12月30日发布,并在 2025 年 Q1 完成百万级真机数据开源;公开资料称含超 100 万轨迹、约 2976.4 小时,覆盖 217 项任务、87 种技能与五大领域百余真实场景。
10Kh RealOmni-Open DataSet 由简智机器人于 2026年1月5日开源,定位大规模无本体具身数据集;公开口径称累计时长超 10Kh、规模超 1Mil clips,专注 10 大家庭场景与 30 项技能的双手长程任务。
RoboMIND 由北京人形机器人创新中心与北京大学等推出,定位国内具身智能标准范式数据集(RSS2025);公开整理称 V1.0 含 10 万+双臂轨迹,V2.0 扩展至 30 万+轨迹并新增带触觉数据与仿真资产。
UnifoLM-WBT-Dataset 由宇树科技于 2026年3月5日开源,定位开放场景人形机器人高质量全身遥操作真机数据集,目标是构建场景覆盖广、任务复杂度高、操作多样性丰富的人形真机数据体系。
Xperience-10M 由 Ropedia 于 2026年3月16日发布,公开口径称涵盖超过一千万条人类真实交互轨迹与万小时级第一视角经验数据,以「经验」为单位对齐视觉、动作、空间与语义,面向具身与物理智能训练。
OpenLET 由乐聚与开放原子于 2026年3月17日开源,定位融合触觉灵巧操作与全身高动态运动的多模态具身数据集,含 LET-Body、LET-Dex、LET-Base 三个子集,面向全尺寸人形 Kuavo 系列真机场景。
OmniViTac 由它石智航联合六家机构于 2026年3月25日发布,定位大规模视触觉操作数据集;公开整理称已收录 2 万余条轨迹,覆盖近百类任务与百余种物体,并保证视触动高精度同步。
LingBot-Depth-Dataset 由蚂蚁灵波科技于 2026年3月31日开源,为大规模 RGB-D 深度数据集,公开口径称含约 300 万对样本(200 万真实 + 100 万渲染),总规模约 2.71TB,覆盖 6 款主流深度相机。
AGIBOT WORLD 2026 由智元机器人于 2026年4月7日开源,定位覆盖具身智能多研究主题的真实场景数据集,宣称数据采自真实环境,并同步开源数字孪生仿真数据,分阶段持续扩展。
PhysInOne 由 vLAR Group 于 2026年4月15日推出,面向视觉-物理联合学习与推理,覆盖力学、光学、流体与磁学等物理领域,并提供大规模多视角视频与动态 3D 场景标注。
Daimon-Infinity 由戴盟机器人联合多家机构于 2026年4月15日发布,定位为大规模含触觉的全模态物理世界具身数据集,依托二指夹爪与五指手套采集设备提供高密度视触觉与动作信息。
AllenAI 于 2026年5月2日开源的 MolmoAct2-BimanualYAM 是约 720 小时双手遥操作数据集,覆盖桌面与家居任务,公开资料称其为当时开源最大双手遥操作数据集之一。
SynData 是灵初智能(PsiBot)于 2026年5月10日发布的大规模真实世界多模态数据集,覆盖视觉、语言与动作,依托外骨骼手套采集高精度双手双臂数据,并含裸手自然交互样本。
OpenAI 发布的 164 道 Python 编程题基准,以 pass@k 评估大模型代码生成能力。
Google 发布的 900 万图像 600 类目标检测数据集,含 1500 万边框标注。
Hendrycks 等提出的 57 学科 14042 道多选题基准,衡量大模型多任务语言理解能力。
DeepMind 与 EMBL-EBI 合作发布,含 2 亿+ 蛋白质结构预测,覆盖 UniProt 全部序列。
Google 主导的 200+ 任务大模型基准,跨 100+ 机构协作,用于探查大模型能力与缩放效应。
DeepMind 大规模人类动作视频数据集,Kinetics-700 含 65 万视频 700 类动作。
Colossal Clean Crawled Corpus,Google 发布的 750GB 清洗后英文网页文本语料,用于 T5 训练。
21 家机构联合汇总 22 种机器人 100 万+ 轨迹的标准化机器人操作数据集。
Microsoft Common Objects in Context 数据集,含 33 万图像 250 万标注,用于检测分割与描述。
基于 WordNet 层级组织的大规模图像数据集,含 1400 万标注图像 2.2 万类,推动深度学习革命。
EleutherAI 825GB 多样化文本语料,22 个子集混合,用于 GPT-Neo/Jurassic 等开源大模型训练。
LAION 发布的 58.5 亿 CLIP 过滤图文对开源数据集,训练 Stable Diffusion 等模型。
Booster Assets 是 Booster 机器人模型、数据等资源库,适合作为数据集/资源库节点关联 T1、K1 与开源生态。
K2 页面将 EmbodiedDataSet 描述为具身智能数据集,数据源融合场景实测、实验室数据、合作伙伴训练场与仿真环境,并支撑算法训练。
Fourier ActionNet 是傅利叶正式开源的全尺寸人形机器人数据集。官网文章称首批上线超 3 万条高质量真机训练数据,包含多种自由度灵巧手训练数据和手部任务模仿学习数据,并配套采集、训练、部署工具链。