推广 热搜: 京东  联通  iPhone  iphone11  摄像头  网络安全  自动驾驶  企业存储  XSKY  京东智能采购 

对话蚂蚁灵波朱兴:机器人落地仍存挑战,何时能真正“替班”成焦点

   日期:2026-09-16     作者:itcg    浏览:2539    我要评论    
导读:对话蚂蚁灵波朱兴:机器人落地仍存挑战,何时能真正“替班”成焦点

机器人打拳、跳舞的视频在网络上流传已久,但人们更关心的是:它们何时能真正走进职场,替人类分担工作?近期,宇树科技发布了一段人形机器人格斗演示,宣称首次实现了由世界模型实时驱动的全自主搏击。据介绍,这款名为UnifoLM-X2-1.0的机器人能够实时预测未来状态,并完成规划、决策和动态交互。然而,当我们将场景从格斗切换到药房取货、物流分拣等日常任务时,机器人面临的挑战便截然不同。

在药房中,机器人需要应对包装各异的药品、狭窄的货架通道以及不断走动的人员。这些看似简单的操作,实则对机器人的持续可靠性和环境适应能力提出了极高要求。APPSO在外滩大会现场与蚂蚁灵波CEO朱兴交流时,他坦言:“小卖部其实也很难落地。我懂大家的焦虑,但目前机器人的能力和成本都还存在问题。”

与许多专注于整机研发的厂商不同,灵波科技将重心放在了具身“大脑”的研发上。他们希望开发出一套能够适配不同构型、不同任务的基础模型,并通过后训练降低具体场景的使用门槛。朱兴解释道:“重载作业和轻量分拣可以用不同的身体,但智能部分可以尽可能复用。”为此,灵波科技推出了生成可交互世界的LingBot-World,并训练了面向具身的视频生成基座LingBot-Video,以及在此基础上训练的动作模型LingBot-VLA 2.0。

在外滩大会上,灵波科技的机器人展示了药品拣选、物流分拣和工业上下料等操作。其中,药房演示中的货架通道仅80厘米宽,相关方案已在国大药房零售门店部署。朱兴表示,尽管灵波也保留了自己的R系列本体用于研发和生活服务探索,但做具身大脑仍然需要与硬件、具体场景紧密磨合。

在交流中,朱兴谈到了许多尚未解决的问题。例如,小模型能够完成特定任务,但为何还要投入大量资源训练基模?数据量增加为何有时反而导致效果下降?商业化进程又该如何推进?对于日常生活中产生的数据,他形象地比喻道:“今天的机器人还吃不了‘粗粮’。”

针对为何不选择更炫酷的技术展示场景,朱兴表示:“我们更在意的是与生态合作伙伴一起,做一些实实在在的落地。今天要让它做一个很炫的事情,那也是一个demo。我们看重的是真实应用和数据的产生,让模型在这个过程中迭代循环。”他坦言,目前模型能力还处于冷启动阶段,基模的作用是将小学生培养成初中生、高中生、本科生,但目前还处于比较早的阶段。

在谈到从一家门店复制到另一家门店的挑战时,朱兴指出,复制成本高本质上还是泛化性不足。不同药房、便利店的环境差异很大,短期可以先选择不那么开放的环境,压缩泛化的挑战;任务也不要太长程,先偏单任务。模型可以先驱动一部分环节,再到更多地由模型主导,能力成长需要有一个爬坡过程。

对于视频生成模型能否直接用于控制机器人,朱兴认为,具身的世界模型与数字世界、游戏里的模型有很大不同。数字世界的模型满足的是内容需求,如丰富、好看、创新等,而机器人需要的是符合物理规律、高性能和实时的动作控制。他举例说:“比如我现在想喝这瓶矿泉水,矿泉水在天空中跳个舞落到我手上,肯定好看,但不符合物理规律,没意义。”

灵波科技在训练基模时也尝试过在通用视频模型上微调,但最终决定从头开始研发。朱兴解释道:“一个问题是上限不高,另一个问题是调到最后会破坏前面模型的先验和知识,导致泛化性降低。”因此,他们很早就启动了更原生的研发,LingBot-Video训练时加入了大量机器人真实数据,再基于它训练LingBot-VLA 2.0。

在谈到数据的重要性时,朱兴表示,虽然相信Scaling Law,但不能机械地看待数据量。数据的质量和分布同样重要,甚至可以说“炼丹背后就是配方,数据的配方”。他指出,目前行业内存在数据重复的问题,模型厂商有义务定义需要什么数据、什么质量,不能将责任完全推给数据供应商。

灵波科技在数据采集方面采取了定制化策略,与供应商在作业流程、端到端数据管线的自动化集成上做了大量工作。朱兴透露,他们内部从原始数据到能进入模型训练的数据漏斗可用率已经从15%左右提升到了90%以上。同时,他们还关注数据从生产出来到进入训练的时间,与供应商基本采用流式交付,不等一大批数据攒齐再交。

对于第一人称视角的Ego数采,朱兴认为这是一个很好的思想,但要看具体怎么采。他比较看好结合高精度、便携的触觉手套的采集方式,既保留了Ego的优势,又借助硬件和算法解决了精度问题。同时,他还强调了视觉和触觉信息的天然对齐性,这类数据对模型发展意义重大。

在谈到互联网视频、仿真和真机数据的配比时,朱兴表示不要轻易谈配比,要分训练阶段。越往预训练阶段,越希望获得场景泛化,所以用无本体数据、互联网视频等更容易扩大规模的数据;越到后训练阶段,越要针对具体场景、具体任务把成功率拉上去,贴近机器人的数据就越有价值。仿真数据则更多体现在中后训练阶段,尤其是针对某个具体任务强化成功率。

对于机器人何时能边工作边积累数据的问题,朱兴认为目前还很早,是冷启动阶段,靠各种数采强制喂数据。但再往前走,有一点应用规模了,至少部分场景里的异常数据飞轮可以转起来。他强调看重的是异常数据而非成功数据。

在谈到模型架构与数据的重要性时,朱兴认为数据现在很重要、未来更重要,但模型范式还没有完全收敛。他指出世界模型的能力怎么用好、机器人未来的学习范式都还要发生变化,必须持续探索。同时他也承认大语言模型公司下场做机器人会带来一定优势,但具身面临的数据挑战仍然需要自己解决。

对于机器人构型的泛化问题,朱兴认为构型泛化是长期存在的问题也是产业需要。他指出不同生产力场景对机器人硬件配置的需求不同,家庭场景中每家的第一需求也不一样。因此他认为机器人没必要长得像人、什么都像人,更应该看具身智能作为一项技术能在社会里创造什么价值。

在谈到灵波科技为何还要做自己的R系列机器人时,朱兴表示研发肯定需要软硬一体。模型需要数据而数据由硬件产生,自己不做也得找别人定制。同时蚂蚁集团的核心业务沉淀都是围绕生活服务的,他们也想更早探索生活服务领域。R系列的特点是底盘小、感知设备多,在力控等方面做了不少软硬件处理,适合生活服务场景中的通行和避障等复杂需求。

对于为何选择药房作为试点场景,朱兴表示药房确实有需求。大药店白天外卖订单高峰时到店客人会占用药师很多时间,机器人可以辅助一下;夜间订单量大且外卖占比高时机器人也能发挥作用。同时药房场景对技术有牵引作用,对未来进入家庭的探索也有帮助。在谈到离一个可以放心留在家里的机器人还有多远时,朱兴表示这取决于具体需求是情绪陪伴还是辅助操作等,并认为可以一步步来从情绪陪伴到辅助操作逐步推进。

 
反对 0举报 0 收藏 0 打赏 0评论 0
 
更多>同类资讯
0相关评论

头条阅读
推荐图文
相关资讯
网站首页  |  物流配送  |  关于我们  |  联系方式  |  使用协议  |  版权隐私  |  网站地图  |  排名推广  |  广告服务  |  积分换礼  |  RSS订阅  |  违规举报  |  京ICP备14047533号-2