本文来源:时代财经 作者:庞宇

2026WAIC智元展台

“我认为可能要1亿小时的数据,才能实现所谓物理世界的‘GPT时刻’。”智元合伙人、高级副总裁、具身业务部总裁,觅蜂科技董事长兼CEO姚卯青说。

过去一年,具身智能行业的评价标准正在从机器人能否完成演示验证,转向能否在真实场景中持续、稳定、批量地作业。在2026世界人工智能大会展馆,时代财经注意到,数据采集和工业场景成为不少企业展示的重点。

不过,在数据、模型、本体性能和场景适配等方面,机器人距离规模化落地仍有不少门槛。一个普遍疑问是,具身智能要从展台演示走向真实应用,行业究竟还缺什么?

在2026世界人工智能大会(WAIC)期间,姚卯青接受时代财经等媒体采访,围绕国产供应链进展、真实数据如何规模化采集并逐步形成标准、机器人怎样达到工业级要求,以及大厂入局会给行业带来什么影响等问题逐一给出解答。

以下为姚卯青接受时代财经等媒体采访内容(经编辑整理并略有删减,问题顺序有所调整):

提问:今年最希望看到的产业链进展是什么?可以是硬件软件或者数据。

姚卯青:要真正推动具身智能开始落地,既依赖硬件本体,也依赖很多模型算法和场景开放条件。在硬件本体上,期望看到国产供应链越来越成熟,在芯片、执行器、三电系统等方面,都能涌现出越来越多供应量大、质量好,且工艺精度和规格非常高的产业链企业。

软件算法方面应该是大家更关注的。因为大家都在等待一个“GPT时刻”。所谓“GPT时刻”,就是它在产品层面既易用又好用。易用,是像ChatGPT一样,大家可以用天然、自然、无需修饰的语言与它对话、指挥它;好用,是它能够开箱即用,听到指令后,以非常高的成功率完成任务。

提问:去年大家在问,想要达到ChatGPT时刻需要多少数据,当时还没有一个具体的大概数字。为什么今年有了这样的数据预测?是大家看到了什么吗?

姚卯青:需要非常大的数据规模,这是今年大家形成的一个强烈共识。其他嘉宾提到过1000万小时,我认为可能要1亿小时。总体上,需要一个远大于目前存量的规模,才能实现物理世界的“GPT时刻”。

之所以今年开始出现千万小时、亿小时这样的估算,一方面是可以把小时数据按一定频率抽样,再换算成画面和数据单元(Token)数量;另一方面,视频生成领域的一些领先模型,在千万小时级数据上已经展现出很好的效果。这给了我们很多参考价值。

具身智能模型也是多模态模型,它要生成对环境的预判和对动作的规划。所以我们认为,一个能够理解、描述和模拟真实世界的模型,大概需要千万小时以上、亿小时级别的数据。数据的种类和来源也需要非常贴近真实世界。

对于Scaling的涌现,我们的观点是能在2027年底到2028年初看到比较强的涌现时刻。

提问:这些主要都是工厂数据吗?

姚卯青:这些数据也不以工厂为主,而是广泛来自全社会、各行各业,包括生活、生产、服务和消费。所有你能想象到的人会经历的事情,我们都希望把它们汇聚起来,为AI所用。

提问:现在无本体数采推出之后,可以披露哪些成效?有了无本体数采之后,真实数据的成本大概降了多少?

姚卯青:无本体采集与真机采集是非常互补的方式。它的优势是成本更低、更便捷,也能以较低干扰进入真实作业流程。2026年的目标是千万小时级,目前已经达到百万小时级。前期我们完成了设备量产和稳定性、软件、数据治理管线、算法、存储和网络等基础设施建设,现在已经到了可以规模化上量的阶段。

从成本看,无本体采集可能降至真机采集成本的一半,有些场景甚至低于三分之一,具体取决于任务难度。

提问:WAIC大会现场多机器人在做数采,有的给自己用,有的是给行业用的。大家遵循的标准有什么不同?行业标准目前有哪些空白或者不标准的地方?

姚卯青:从我们最近的实践感受来讲,智元以及国际头部团队,大家对标准还是相对趋同和收敛的,无论是硬件类的指标,还是帧率、分辨率、曝光、FOV、时间同步标定等,都有共性要求。

同时,对于后期数据的标注和治理,比如Hand Toss提取的精度、切片的时间精度和有效性,无论是任务级还是原子动作级进行标注描述的精度和多样性,也有相对统一的标准。

至于空白或者说挑战,我认为并不是做得不好,确实行业的变化和迭代是随着模型需求迭代的,正处于快速演进的过程中,很难固化成像手机、汽车这样的成熟产品所具有的国家和行业标准,更多是在头部团队和公司的需求牵引下,事实性标准在演进。

提问:现在行业在讲具身原生,智元怎么理解这个概念?是说以前的模型不够原生吗?

姚卯青:很多工作现在还没有做到具身原生,因为背后还没有构建出支持原生训练的数据量。现有视觉语言模型(VLM)经过海量互联网数据训练,但具身数据只有几万、几十万小时的时候,很难从头进行架构设计和权重训练。到了百万小时级以上,就要做原生架构。

具身任务不是多模态问答,不是问图里有几个苹果、几个人、穿了什么衣服,而是要听一个指令,想象任务怎么完成、环境怎么变化,并规划动作。所以它需要的组件一定不是今天偏问答语义类的这些,它一定有一套自己原生的东西去做理解和生成一体化的工作。

提问:WAIC展馆里有很多企业都在做工业场景,智元也进行了工业场景方面的尝试。对于现在的具身智能体来说,做工业场景最大的挑战有哪些?

姚卯青:对于很多机器人厂商来讲,目前进入工业场景,首先需要迈过一些基础门槛。因为工业场景看重的是效率、节拍、稳定性和成本这些关键因素,非常现实。所以首先要让硬件本体在达到工业级强度的同时,还能够长时间稳定运行。在专业术语里,这叫平均无故障时间MTBF。

通过我们前期的努力,智元的机器人应该是目前行业里为数不多的能够达到数千小时稳定工作的机器人,即使在3C这种高节拍、长时间工作的场景里,也能稳定运行。现在市面上还有一些产品更多面向科研教育,它们无论是在精度、一致性还是长时间稳定性上,可能都有一定的提升空间。我相信,将来如果有更多机器人进入工厂,越来越多的硬件产品也会达到工业级标准。

其次,要适应工厂里很多任务的要求。通过模型算法和一些工程方法,机器人要满足高节拍、高成功率的要求。对于工业来讲,可能99%以上,甚至三个9、四个9,都是比较常见的要求。此外,机器人还要与产线已有系统打通、集成,实现机器人与产线其他设备之间的有效通信和调度。这也需要应用场景提供方和机器人原厂共同完成。

提问:大厂今年下场做机器人的非常多,包括蚂蚁、荣耀、京东在数据层面的运作,会不会让智元本身感到压力这些大厂的入局整个赛道以及其他的中腰部玩家有什么影响

姚卯青:如果只是数据方面来讲是非常欢迎的,1亿小时的数据需要非常多的人一起参与才能在2027年加速实现,否则凭单个品牌也很难做这样的事情。

同行进入也是对行业的促进,因为整个产业链里有不同的环节,比如说做模型的公司也在推动相关环节的发展,不管是对还是错,我们觉得都是好的,其实是在帮大家做强化学习,因为强化学习需要试错,所有的可行动作空间都要试一遍,有些是歪路,有些是正路,试过总比没试过好,所以更多人来试,我觉得能够加速并行探索和多路径探索。