数据集
HumanEval OpenAI 发布的 164 道 Python 编程题基准,以 pass@k 评估大模型代码生成能力。
- 数据类型
- research
硅基参考数据集库建立遥操作、轨迹、多模态、RGB-D、力矩、触觉和语言数据的元索引,方便按任务、平台与协议筛选对照。
OpenAI 发布的 164 道 Python 编程题基准,以 pass@k 评估大模型代码生成能力。
Google 发布的 900 万图像 600 类目标检测数据集,含 1500 万边框标注。
Hendrycks 等提出的 57 学科 14042 道多选题基准,衡量大模型多任务语言理解能力。
DeepMind 与 EMBL-EBI 合作发布,含 2 亿+ 蛋白质结构预测,覆盖 UniProt 全部序列。
Google 主导的 200+ 任务大模型基准,跨 100+ 机构协作,用于探查大模型能力与缩放效应。
DeepMind 大规模人类动作视频数据集,Kinetics-700 含 65 万视频 700 类动作。
Colossal Clean Crawled Corpus,Google 发布的 750GB 清洗后英文网页文本语料,用于 T5 训练。
21 家机构联合汇总 22 种机器人 100 万+ 轨迹的标准化机器人操作数据集。
Microsoft Common Objects in Context 数据集,含 33 万图像 250 万标注,用于检测分割与描述。
基于 WordNet 层级组织的大规模图像数据集,含 1400 万标注图像 2.2 万类,推动深度学习革命。
EleutherAI 825GB 多样化文本语料,22 个子集混合,用于 GPT-Neo/Jurassic 等开源大模型训练。
LAION 发布的 58.5 亿 CLIP 过滤图文对开源数据集,训练 Stable Diffusion 等模型。