
当大模型加速进入物理世界,一个看似顺理成章的技术路径是:把已经在数字世界训练成熟的模型装进机器人,再接上动作控制。但这是否就足以构成机器人的“大脑”?
7月19日,在蚂蚁InclusionAI与PyTorch基金会联合举办的“AGI基础设施与普惠实践”论坛上,蚂蚁灵波科技首席科学家沈宇军以《蚂蚁灵波全栈2.0,打造具身原生的机器人通用大脑》为题发表演讲。他给出的判断是,物理世界不是数字世界的简单延伸,机器人需要一套从感知、预测到行动都为物理世界重新设计的基础模型体系。
蚂蚁灵波首席科学家沈宇军发表演讲
从数字世界到物理世界:机器人要跨越三道鸿沟
沈宇军把机器人大脑面临的挑战概括为三点:看得更清楚、想得更明白、干得更利索。
第一道鸿沟来自传感器。数字世界的视觉模型擅长识别“这是什么”,机器人还必须知道“它在哪里”“离我多远”“中间能不能通过”。例如,隔着透明玻璃看见一只猫,并不意味着机器人能够直接触碰它。视觉语义上“看见”,不等于物理空间上“可达”。
第二道鸿沟来自高动态交互。数字内容模型可以在相对完整的上下文中生成结果,机器人面对的环境却随时可能被人打断、被物体遮挡,或因一次接触而发生变化。它不能一次规划到底,而是要在行动中持续预测下一刻,并根据反馈实时修正。
第三道鸿沟是泛化与产业落地。机器人不仅要在一台机器、一个任务上表现良好,还要让已经学会的能力迁移到不同构型和真实场景,降低重复采集数据和重新训练的成本。对具身智能而言,能做出一次演示只是起点,能在不同本体上稳定复用才更接近通用能力。
蚂蚁灵波全栈2.0:打造具身原生的机器人通用大脑
针对这三道鸿沟,蚂蚁灵波全栈2.0形成了从空间智能、环境反馈到灵巧操作的大脑能力闭环。
蚂蚁灵波应对数字世界与物理世界鸿沟的解法
在空间感知层,LingBot-Vision从几何结构出发进行视觉预训练,为机器人建立面向空间原生的视觉基座;基于LingBot-Vision,LingBot-Depth 2.0进一步弥补传感器误差,重点处理透明、反光和密集物体等真实环境中的难题。目前,蚂蚁灵波已与奥比中光展开合作,将LingBot-Depth 2.0集成至其相机产品,搭载相关能力的相机已面向全球市场销售。
在动态交互层,LingBot-Video采用MoE架构,在推理效率、物理合理性、动作理解和任务完成度等方面实现系统提升;LingBot-World 2.0则把持续生成从分钟级推进到小时级,并支持720p/60fps实时交互,让世界能够根据动作与事件持续演化。因为对机器人而言,重要的不是生成一段更精美的视频,而是因果逻辑与实时性,让机器人能够更及时、更合理地预判环境将如何变化。
在动作执行层,LingBot-VLA 2.0面向“一脑多机”,已适配宇树、智元、银河通用、乐聚等17个品牌、20种机器人构型,并将控制扩展到头部、腰部、底盘等全身自由度。LingBot-VA 2.0作为行业首个具身原生的世界动作模型,没有“嫁接”数字世界模型,而是从头开始预训练,通过全新的语义视觉—动作分词器、严格的因果预训练、MoE架构与异步推理机制等创新,让机器人能够“边推演、边行动、边调整”。
沈宇军认为,数字世界与物理世界有不同的优化目标。对机器人来说,识别得准、生成得美,都不等于任务能够完成;模型还必须理解空间约束,遵循因果与物理规律,在实时反馈中持续行动,并把能力迁移到更多本体和场景。
在他看来,具身原生这条路注定更加艰辛:许多能力必须从头开始,不能直接依赖数字世界已经训练成熟的模型,但如果机器人要走得更远、更稳,要真正跨越数字世界与物理世界之间的鸿沟,就必须正面解决问题。
从全栈大脑1.0到2.0,蚂蚁灵波正将“具身原生”从技术主张转化为全栈能力体系,为不同本体提供可复用、可持续演进的通用大脑。同时通过开源开放,让更多开发者参与验证、适配与迭代,推动机器人基础模型成为行业共同建设、共同演进的物理世界智能底座。
盛达优配app提示:文章来自网络,不代表本站观点。