首页 > 新闻中心 > 财汇

智元开源AGIBOT WORLD 2026第三期:强化学习数据集,让机器人从经验中学习

来源: 紫牛新闻

2026-08-31 22:14:00

过去几年,大规模专家示教数据推动机器人模仿学习快速发展,帮助机器人学习“面对一个任务应该怎么做”。 但进入真实环境后,机器人产生的数据并不都是标准答案:有成功,也有失败;有偏差,也有恢复;有自主执行,也有人类接管。 这些真实交互记录了模型的能力边界、失败状态、有效行为和纠正过程,是专家示教无法完全提供的经验数据(Experience Data)。 因此,机器人不仅要学习别人如何成功完成任务,也要学会利用自己与真实世界交互产生的经验。

为此,智元正式发布 AGIBOT WORLD 2026 第三期开源强化学习数据集。该数据集覆盖了从示教到部署的各个阶段:专家示教提供任务的标准示范;人类在环纠正轨迹记录了模型执行犯错时人类的接管与纠正;部署推理轨迹(Rollout)则有模型真实部署执行产生的成功与失败。在此基础上,数据集进一步标注了进度、错误、成功与干扰等关键信息。研究者可以据此训练不同维度的奖励模型(Reward Model),将轨迹级的成败结果细化为过程反馈,为真机强化学习的研究提供可复用的数据基础。

从示教到部署,采集机器人的“实战轨迹”

本期首批数据集聚焦工业与家居等真实场景,设计网线插接、钥匙开门等14类交互任务,覆盖精细操作、复杂长程和强接触等不同任务类型。

数据采集贯穿从示教、部署到纠正的三个阶段:

专家示教轨迹,由人类操作员完成任务,记录任务在真实环境中的标准执行轨迹。

部署推理轨迹,模型进入真实场景执行任务,成功和失败结果均被记录。成功rollout展示策略已经具备的能力,失败Rollout则暴露模型在不同任务阶段的能力边界。

人类在环纠正轨迹,模型首先自主推理并执行任务,人类操作员在策略出现偏差时进行接管纠正。数据同时保留接管前的模型行为、接管时机、接管后的纠正动作。

这三类轨迹共同构成一条完整的数据链路:专家示教告诉模型任务应该怎样完成,人类在环纠正轨迹记录了模型如何被纠正,Rollout轨迹检验模型独立执行时究竟做得怎么样。



从过程到结果,标注真实执行中的关键反馈

强化学习需要的不是“机器人做了什么”的笼统记录,而是“这一步做得怎么样”“任务推进到哪一步”的精细反馈。

本期数据集围绕真实执行过程,对成功、错误、接管、干扰等关键状态进行细粒度标注;在此基础上,用户可进一步结合标注信息,识别风险与错误恢复过程。成功帧提供明确的任务达成信号,错误、干扰和风险区间帮助模型识别异常与危险状态,接管区间记录人工介入时机,错误恢复区间则提供从错误到恢复的真实过程。


 数据在强化学习中的应用

让机器人从每一次成功与失败中进步

对具身智能而言,真正的技能从来不是复刻标准化动作,而是在动态真实环境中感知反馈、自主纠错、持续优化。

模仿学习让模型从专家示教中学习任务,而强化学习则提供了另一条优化路径:利用真实执行反馈,判断哪些行为推动了任务、哪些状态存在风险,并将这些判断转化为可供训练的奖励信号。高质量的真机轨迹与过程标注,是开展这类研究的重要基础。

AGIBOT WORLD 2026 第三期真机强化学习数据集,完整留存每一次物理接触、每一处执行偏差、每一轮人工修正,让真机强化学习拥有高质量、可复用、闭环式训练底座,让机器人不仅要从成功示范中学会“怎么做”,还要从错误、风险和人工纠正中学会“如何做得更好”。加速行业从 “实验室演示” 走向规模化产业部署,迈进具身智能生产力新时代。

校对 陶善工