机器人前瞻(公众号:robot_pro)




作者 | 周加琦




编辑 | 漠影



机器人前瞻8月26日报道,今天凌晨,Figure CEO Brett Adcock在X上宣布,今天


正式推出Index


——全球规模最大且最多样化的机器人数据集。





Figure正式发布Index:覆盖108个国家和地区,超1600万段视频




▲(图源:X)



目前,Index包含超1600万段视频,覆盖家庭、物流、餐饮、工业等室内外多类任务场景。素材全部来自真实场景第一视角录制,还原真实工作流程,并配套自动化与人工协同的数据处理管线,完成从过滤到标注。



Figure称,迄今为止,他们已经在108个国家和地区收集了数据、累计下载量达26.4万次,并拥有超过4.4万名周活跃用户。



不仅如此,Figure还表示,已经向数据创作者支付了1500万美元,并承诺在未来12个月内,在数据和算力方面投入


超过10亿美元





评论区有网友称,终于看到机器人领域有实打实的进展了。



Figure正式发布Index:覆盖108个国家和地区,超1600万段视频
▲(图源:X)



一、覆盖108个国家和地区,累计下载26.4万次



四个月前,Figure曾秘密推出一款APP用于测试,希望能直接从人类这里收集大规模的真实物理世界数据。



今天,这个APP被重新命名为Index,并已经在Google Play和App Store上正式发布。



Figure正式发布Index:覆盖108个国家和地区,超1600万段视频



▲Index(图源:Figure)



在此之前,Figure也尝试购买数据,但其称,供应商提供的数据无法达到Helix模型所需要的吞吐量、多样性和质量标准。因此,Figure选择自己构建整个数据采集系统。



在Index平台,创作者可以录制自己日常做家务或工作的视频,也可以通过平台雇佣零工上门完成家务,同时录制第一视角操作画面,来获取奖励。



目前,Index已经应用在


108个国家和地区


,累计


下载量超26.4万次





每周有4.4万名用户活跃


。在速度上,该应用实现


每秒处理30分钟


的视频上传量。



Figure正式发布Index:覆盖108个国家和地区,超1600万段视频



▲周用户活跃量(图源:Figure)



Figure称,每一位新的创作者都可能带来此前未出现过的环境、物体,以及他们独特的任务完成方式。Index已经涵盖了各种人类任务,烹饪、清洁、洗衣服等各类家务;物流中心、工厂、办公室等各类企业内部任务。



Figure正式发布Index:覆盖108个国家和地区,超1600万段视频



▲采集种类(图源:Figure)



在每采集1000小时的数据中,Index平均包含


373种独特的任务





1146种被操作的对象





116个独特的环境


。目前,Figure已经向创作者


支付1500万美元





二、24小时不间断处理,五大环节保证数据质量



Index要处理全球创作者每秒30分钟的视频数据,因此Figure构建了整套数据基础设施,该设施实现


7*24小时


稳定运行、持续的大规模计算处理能力,以及可实时向创作者反馈,不断优化后续数据采集质量。



整套数据管线主要分为五大环节:





自动过滤:


从视频技术、画面画质、内容语义三个维度进行初筛。





人工复核


:审核人员会抽查上传样本,排查是否有违规的上传行为。





数据去重:


相似度超出阈值的素材直接被剔除,以此保障数据多样性。





样本均衡:


依据视频与任务场景的匹配程度,按预设配额分配各任务素材总量;通过特征聚类区分视频细微动作与场景,补齐标签遗漏的样本。





分层标注:


为每一段完整行为视频生成层级化文本描述标签。



Figure称,Index正在为“机器人即服务”的规模化落地打基础。未来,这些事情将由机器人替人们完成。



结语:行业的竞争,正在进入“数据战”



对于整个具身智能行业而言,真实且多样的物理世界数据一直是稀缺资源。Figure此次推出Index,本质上是在尝试把分散在人类日常生活和工作中的真实行为,转化为可用于训练机器人的“数据燃料”。



从“买数据”转向“自己造数据”,再到未来12个月投入超过10亿美元,Figure押注的已经不只是一个数据集,而是一套能够持续获取、处理和生产机器人训练数据的基础设施。



当机器人开始从“能动”走向“会干活”,数据正在成为继本体、模型和算力之后,新的核心竞争力。