诺亚 发自 凹非寺

  量子位 | 公众号 QbitAI

  2009年,李飞飞团队正式发布ImageNet。

  随后,以ImageNet为基础形成的大规模视觉识别任务,让不同机构第一次能够围绕共同的数据集、类别体系和评测指标训练模型、比较结果。

  得益于这套可以持续扩展、统一比较的数据与评测基础设施,图像识别和深度学习开始快速发展。

  17年后,李飞飞的博士生Danfei Xu,开始为机器人学习寻找类似的协作基础设施。

  Danfei Xu目前担任佐治亚理工学院交互计算学院助理教授,也是机器人学习与推理实验室(RL2)的负责人。他在斯坦福大学攻读博士期间,由李飞飞和Silvio Savarese共同指导。过去几年,他持续研究一个问题:机器人如何从人类演示中学习,并将这些经验迁移到不同任务、环境和机器人本体上。

  这条研究线,最终汇入了EgoVerse——“第一视角人类操作数据生态”。

  EgoVerse是一套持续增长的第一视角人类操作数据生态与标准。EgoVerse最新公开的联盟伙伴中,除了佐治亚理工、斯坦福、苏黎世联邦理工和UC San Diego等学术机构,还包括Meta、Scale AI、光轮智能、Mecka AI、MicroAGI、Trace Labs等公司。

  最值得的关注是,光轮智能作为唯一一家中国公司,出现在这个顶级大佬云集的全球标准牌桌上。

  EgoVerse:Danfei想做的不只是一个数据集

  机器人学习长期面临一个明显的数据悖论。

  目前机器人训练仍然依赖真机遥操作,每增加一条演示,都需要机器人硬件、操作人员、实验场地和复位流程。采集速度慢、成本高,能够覆盖的任务和场景也很有限。

  而人类的各种行为天然包含丰富的视觉信息、动作过程、物体交互和任务策略,明显是机器人更好的老师。

  第一视角人类数据提供了新的路线:先记录人如何在真实环境中完成任务,再把这些经验迁移给不同机器人。

  但过去的人类数据集大多是一次性项目。

  不同团队使用各自的采集设备、坐标体系、动作标签和任务定义,数据发布后也很难持续扩张。即使两家机构都采集了“把杯子放到碟子上”,两份数据也未必能够直接放在一起训练。

  Danfei及其合作者因此没有把EgoVerse设计成又一份静态数据集,而是做成了一套“活”的协作框架。

  EgoVerse当前公开版本包含1362小时人类演示数据、约8万个episode、1965项任务、240个场景和2087名采集者。数据不仅包含第一视角视频,还提供相机位姿、三维手部信息以及细粒度语言描述,并在不同实验室、不同任务和不同机器人本体上验证人类数据的迁移效果。

  一套事实标准形成之前,往往要先完成几件事:

  让参与者采用共同的数据结构,遵守共同的任务语义,生产可以相互兼容的数据,并用统一方法检验这些数据是否真的有效。

  EgoVerse正在做的,正是这一步:先让全球具身数据开始按照同一套“语言体系”流动。

  EgoVerse的核心共建方,都是什么背景?

  具身人类数据并不是戴上一副眼镜、录一段视频,再加几个标签那么简单。完整采集流程至少包括研究问题定义、采集硬件、动作迁移、规模化运营、数据标注和机器人验证。任何一家机构,都很难单独完成所有环节。

  EgoVerse召集了具身领域里最头部的高校、学者、机构进行全球协作,共同定义具有划时代意义的数据标准。

  佐治亚理工Danfei Xu教授:具身人类数据采集路线标志性代表,EgoVerse的发起人

  佐治亚理工承担的是EgoVerse的组织中枢和研究框架角色。Danfei Xu与RL2团队长期关注机器人如何从人类数据中学习。到了EgoVerse,问题不再只是“某一批人类视频能不能改善某一台机器人”,而是进一步升级为:人类数据的效果能否跨实验室复现?能否跨机器人本体成立?数据规模增加时,能力是否稳定增长?哪些类型的数据才真正具有迁移价值?

  EgoVerse让不同实验室在共享协议下重复实验。佐治亚理工学院负责的代表任务是object-in-container,斯坦福大学负责双臂精细操作,UC San Diego和ETH Zurich则参与长时序双臂任务验证。由此,Danfei搭起一种新的协作方式,使过去互不兼容的数据、算法、机器人和实验室,开始在共享协议下回答同一组问题。

  斯坦福Shuran Song教授:UMI发明人,让人类操作经验能够迁移给机器人

  人类有柔软灵活的双手,机器人可能只有两指夹爪;人可以依靠触觉、经验和身体协调完成任务,机器人却需要明确的观测和动作表示。因此,人类数据并不会天然变成机器人能力,中间横着一道“具身鸿沟”。

  Shuran Song带领的斯坦福REAL Lab,是打通这条路径的代表团队之一。其团队开创的UMI——Universal Manipulation Interface,使用便携式手持夹爪采集真实环境中的人类操作,再将这些演示转化为可部署的机器人策略。

  UMI的关键价值,是让数据采集摆脱固定机器人和实验室。人可以带着设备进入真实环境进行复杂长时序任务,学习得到的策略还能迁移到不同机器人平台。

  简单说,斯坦福要解决的是:让人类经验变成机器人能执行的动作。

  Meta:为EgoVerse提供专用数据采集眼镜

  第一视角数据采集首先需要一双合格的“眼睛”。Meta研发的Project Aria,是行业首个专为“大规模基础模型”设计的专用数据采集硬件,可以记录第一视角视频、手部动作、相机位姿和空间信息。设备包含面向前方的RGB相机,以及用于SLAM和手部追踪的同步场景相机。没有这类空间感知能力,第一视角数据很容易只是一段“看起来像人在干活”的视频。Meta解决的是如何把“人看到了什么”,升级为“人在三维世界中如何行动”。

  Mecka:人类数据先驱,把数据采集从专用眼镜普及到手机

  如果一套人类数据生态只能依赖少数专用硬件,它能够覆盖的采集者与真实环境就始终有限。

  Mecka AI推动了一条更便携的采集路线:使用iPhone与轻量化头戴装置完成第一视角采集,再通过云端处理恢复头部轨迹与双手三维关键点。

  这一方案让第一视角数据不再只来自少数机器人实验室,而能够进入家庭、商店、工作场所和更多真实任务环境。

  Mecka AI所解决的,是如何让人类数据采集从专用设备走向更低门槛、更广覆盖的生产方式。

  Scale AI:人类数据的规模化制造工厂

  数据采回来之后,还要经历清洗、标注、质检、结构化和版本管理。

  Scale AI从2016年起长期从事AI数据基础设施建设,最早以自动驾驶等场景中的大规模数据处理能力闻名。进入Physical AI阶段后,它又把数据工厂数据扩展到机器人数据采集、标注、人工反馈和模型验证。

  Scale更擅长把数据生产变成一套成熟的运营和处理系统,从而在人类演示从几百条变成几万小时后,把大规模、异构的原始采集结果,转化为稳定可用的数据产品。

  光轮智能:在规模化的前提下,构建人类数据最高质量标准

  当具身数据生产真正迈向千万级小时,单单依靠采集工具和后处理,无法满足规模化下的数据质量需求。同时,采集设备越多、采集人员越多、场景越复杂的趋势下,视角偏移、动作遗漏、任务中断、设备异常和标注不一致等问题也会被同步放大。

  数据可以快速增长,但真正能被机器人学习的有效信息,并不一定同步增长。

  而光轮智能补上的,是一套贯穿端侧采集、云端处理和仿真验证的质量控制体系。

  与绑定某一款眼镜或采集设备的方案不同,光轮智能的目标是让数据管线兼容不同硬件。无论原始数据来自Aria、iPhone、头戴相机还是其他多模态设备,都可以进入统一的云端管线,通过VIO、三维手部与Body标注、V7级动作语义标注,被转化成同一质量标准下的训练资产。

  数据完成处理之后,光轮智能还会利用物理仿真SimFoundry和模型评测能力RoboFinals,进一步验证动作轨迹、物理关系和任务过程能否被合理还原,并判断数据是否真正具有机器人学习价值。通过不断的回环评价,掌握最快速的质量反馈,并且不断迭代,引领标准。

  因此,光轮在EgoVerse中的贡献,是让数据在规模化生产中依然做到源头可控、跨硬件统一、价值可验证。

  此外,MicroAGI也在探索分布式众包采集,通过让操作人员在真实家庭环境中自然完成任务,将人类数据生产从实验项目转化为可持续运营的采集网络。

  规模化之后,光轮智能如何定义高质量人类数据

  传统数据质量控制,通常关注文件是否完整、格式是否正确、轨迹是否缺失,以及标注是否通过。

  但这些指标最多只能证明一条数据在生产流程上“合格”,不能证明它真的值得机器人学习。

  一段视频可能拍摄完整,动作轨迹却无法被机器人执行;一条标注可能符合规范,其中的任务过程却缺少关键步骤;一批数据看起来数量庞大,实际覆盖的人群、场景与动作分布却高度重复。

  光轮智能将人类数据质量拆成三个连续环节。

  首先,用Agent驱动数据采集质量与数据分布。

  在光轮智能看来,具身数据最大的质量风险,经常发生在采集现场。

  关键动作是否进入画面?手与物体的交互是否被遮挡?任务起点和终点是否完整?采集者是否偏离操作要求?一个episode虽然录制完成,是否真正包含完整的学习过程?

  如果这些问题等到数据上传后才被发现,往往只能整段作废,或者重新组织人员补采。

  光轮智能的Agent驱动采集体系,会围绕设备状态、任务流程、动作完整性和有效视角进行实时检查,并在发现风险时推动现场纠偏或补采。

  更重要的是,Agent不仅负责单条数据质检,也可以根据已有数据分布,调控下一轮需要采集的人群、场景、任务与动作类型,避免数据规模增长后出现大量重复样本。

  这使数据质量从事后抽检,转化为生产过程控制。

  其次,通过兼容多种采集硬件的云端平台,实现统一的数据标准。

  无论原始数据来自眼镜、手机、头戴相机还是其他多模态设备,都需要经过云端统一的处理和质量控制,才能进入同一个训练体系。

  光轮的处理流程包括视觉惯性里程计,也就是VIO,用于恢复相机在空间中的运动;三维手部与Body标注,用于还原人的身体动作和手物交互;以及V7级动作标注,把一段连续视频进一步切分为可以与任务过程对齐的动作语义。

  光轮智能的人类数据解决方案EgoSuite,能够在生产规模上提供三维手部、三维全身姿态和帧级语义标注,并强调在遮挡和近距离物体交互情况下维持稳定追踪。其平台也公开强调对不同商业设备、研究型眼镜、动作相机和定制采集系统的兼容能力。

  这套思路可以用一句话概括:硬件可以多元,进入模型之前的数据标准必须一致。

  最后,用仿真与评测检验数据价值。

  数据处理完成后,还要回答一个更关键的问题:这些数据,是否真的值得机器人学习?

  光轮智能将自研仿真平台SimFoundry与工业级评测平台RoboFinals接入人类数据质量闭环。SimFoundry将人类数据中的动作轨迹、物体关系和任务流程,转化为机器人可执行、可复现的仿真任务;RoboFinals则通过标准化评测,验证这些数据究竟提升了哪些任务,又会在哪些机器人本体、场景和物理条件下失效。

  因此,数据价值不再由生产方自行定义,而是由机器人训练和评测结果共同验证。评测过程中发现的失败案例,也会进一步反馈给采集端,指导下一轮需要补充哪些数据、扩大哪些分布、修正哪些采集规则,形成持续优化的数据闭环。

  最终,高质量具身人类数据形成一条完整的数据质量闭环:

  端侧Agent实时控制采集质量 → 多种采集硬件统一接入云端 → VIO、手部、Body Pose与动作语义标准化处理 → SimFoundry将人类数据转化为机器人可执行任务 → RoboFinals验证数据学习价值并定位失败模式 → 评测结果反馈下一轮数据采集。

  唯一中国公司,进入全球两大具身基础设施标准

  随着具身智能从单点技术验证走向规模化发展,行业竞争正在从模型能力,进一步延伸到底层基础设施与标准体系。

  其中,两条关键主线正在形成。

  一条是以EgoVerse为代表的数据基础设施,定义高质量具身人类数据如何采集、组织、处理、共享和持续迭代;另一条是以Newton为代表的物理仿真基础设施,定义机器人如何在遵循真实物理规律的仿真世界中完成训练、验证和评测。

  Newton由NVIDIA、Google DeepMind和Disney Research联合发起,由NVIDIA、Google DeepMind、Disney Research、光轮智能和Toyota Research Institute(TRI)五家企业共同组成技术指导委员会(TSC),持续定义机器人仿真与物理建模的技术路线,正逐渐成为全球具身智能的重要物理仿真基础设施。

  前者解决机器人从哪里获得可规模化的学习经验,后者解决这些经验如何在物理世界中被复现和验证。数据与仿真,共同构成物理AI走向规模化的两大底座。

  光轮智能成为目前唯一同时参与这两套国际标准体系的中国企业。

  在EgoVerse中,光轮带入的是一套贯穿人类数据生产全流程的质量体系:从端侧Agent管理采集过程,到多种硬件数据进入统一云端管线,再到通过仿真与模型评测验证数据价值。人类数据质量由此从依赖人工抽检和经验判断,走向可定义、可比较、可验证、可持续优化的工程标准。

  在Newton中,光轮参与物理求解、仿真资产、机器人训练与评测等核心能力建设,推动真实世界中的物体、任务和物理过程,转化为机器人可以交互、训练和验证的仿真基础设施。

  这意味着,光轮参与定义的不只是某一种数据格式,也不只是某一套仿真工具,而是连接真实世界数据、物理仿真、模型训练与能力验证的底层标准。

  如果说ImageNet为视觉AI建立了共同的数据基础设施,那么EgoVerse与Newton则分别从数据和仿真两个方向,为物理AI建立新的全球基础设施。

  光轮同时进入EgoVerse与Newton,参与建设的已经不只是今天的工具链,而是未来全球具身智能产业共同遵循的底层基础设施。这也意味着,中国企业开始从标准的使用者,走向全球物理 AI 基础设施规则的共同定义者。