在2026年外滩大会上,具身智能成为备受瞩目的焦点话题。然而,蚂蚁灵波科技CEO朱兴在接受采访时却持谨慎态度,他认为具身智能目前仍处于冷启动阶段,要实现真正落地,能力和成本是两大必须跨越的门槛,同时数据分布与质量的重要性远超单纯的数据堆砌。
朱兴指出,当前具身智能在模型能力、硬件稳定性以及成本约束等方面存在诸多问题,这使得许多应用场景难以企及。他以自动驾驶的发展历程作类比,从L1到L4等级的自动驾驶技术历经多年走走停停,具身智能同样需要经历一个发展周期。在可落地场景方面,存在明显边界,环境不能过于开放,任务也不能过于长程,因为主流的模仿学习方法在面对异常情况时表现欠佳。成本则是一个充分条件,如果无法实现盈利,长期发展将难以为继。不过,他也预计,在今年下半年到明后年期间,在任务复杂度较低的场景中,具身智能的生产力应用将会迎来量级增长。
数据在具身智能的发展中占据着关键地位,在采访中被频繁提及。有从业者表示,数据采集过程中有高达90%的数据可能是无效的。朱兴认为,场景过度重复的数据意义不大,以自动驾驶为例,每天收集上来的大量数据,更多只是增加了存储成本,关键在于如何获取真正需要的数据。灵波科技较早便放弃了购买成品数据的方式,转而采用定制化采集策略。先由模型训练定义需求,进行试采并形成标准操作流程(SOP),再交给供应商大规模采集。通过这种方式,从原始数据到进入训练环节,可用率从15%左右大幅提升至90%以上。朱兴强调,不能仅仅机械地追求数据量达到千万小时甚至亿小时,数据的质量和分布才是重中之重,分布更是模型厂商的核心竞争力。他还提到,仿真在模型的中后期训练中具有一定价值,但在预训练阶段不能过度依赖;互联网视频适合用于预训练的泛化,而越到后期训练,越需要贴近机器人的实际情况。Ego数据思想虽好,但头环加上裸手轨迹存在精度问题,未来结合高精度便携触觉手套将是重要发展方向。
在模型路线选择上,朱兴并不认同具身智能是数字智能简单嫁接的观点。他举例说明,可灵、万相、Sora等是优秀的数字世界模型,能够满足好看、创新、特效等需求;但机器人需要的是合理、符合物理规律且实时高性能的模型。比如,矿泉水在天空跳舞后落到手上,虽然画面好看,但不符合物理规律,对于机器人来说没有实际意义。灵波科技早期基于通用视频生成模型进行微调,后来转向原生研发,发布了LingBot - Video,并训练了LingBot - VA 2.0,近期还开源了小尺寸版本,希望将单向因果训练等技术贡献给社区。
对于具身智能领域的竞争格局,朱兴判断,当前该领域就像大模型“百模大战”初期一样,竞争激烈且分散,但未来必然会走向收敛,基座公司不需要太多家。灵波科技选择了具有更高上限的发展路线,其优势体现在训练规模、原生基模和数据管线等方面。在关于本体与大脑的争论中,朱兴持较为中立的观点,他认为研发需要软硬一体。灵波科技的R系列机器人承载着研发和生活服务探索的任务,但公司的核心是输出闭源基模和工具链,帮助生态伙伴进行后训练、数据采集清洗、端侧部署以及真机强化学习等工作。在工业、物流等出货场景方面,灵波科技选择不涉足,而是愿意与集成交付方展开合作。朱兴表示:“机器人属于非标产品,如果灵波科技自己去做,能做多少家呢?为什么不让生态伙伴一起参与呢?”
当谈及独立融资问题时,朱兴表示,灵波科技进行独立融资并非因为缺钱,而是出于人才激励和公司治理的需要,通过融资让公司能够更高效地应对市场竞争。在场景选择上,如药房、仓储、上下料等场景,与蚂蚁的生活服务战略紧密相关。以药房场景为例,白天外卖高峰会占用药师大量时间,夜间情况更为棘手,而机器人可以辅助药师工作,并非打造无人药房。药房场景中SKU丰富且需要与人接触,这对人机安全、抓取泛化等技术提出了要求,同时也是进入家庭场景的应用前哨。
朱兴强调,行业要实现长远发展,需要保持耐心。灵波科技不会急于通过炫酷的演示来证明自己,而是更看重真实的落地应用、数据的产生以及模型的迭代循环。他认为,具身智能的“ChatGPT时刻”终会到来,但具体时间无法预判。在他看来,ChatGPT的成功关键在于“Chat”,即交互性,而非单纯的“GPT”技术;具身智能下一步也需要发展到一定规模,形成完整的闭环。















