具身智能路线之争转向融合:VLA与世界模型走向混搭
2026年,具身智能领域从VLA与世界模型的路线之争转向融合。英伟达GTC和WAIC等会议上,智平方、星海图、小鹏等公司公开表示两者互补,而非对立。同时,蚂蚁灵波和面壁智能发布新VLA模型,强调通用性和本地推理,标志着行业进入落地阶段。
2026年,具身智能领域从VLA与世界模型的路线之争转向融合。英伟达GTC和WAIC等会议上,智平方、星海图、小鹏等公司公开表示两者互补,而非对立。同时,蚂蚁灵波和面壁智能发布新VLA模型,强调通用性和本地推理,标志着行业进入落地阶段。
SynthePulse Insight · AI 深度解读
版本 1 · 1 个来源
2026 年,具身智能赛道经历了一场从口头站队到落地祛魅的转变。VLA 与世界模型从对立走向融合,行业共识逐渐形成:没有终局,只有不断进化的路线。
2026 年的具身智能赛道,技术路线之争曾一度白热化。在英伟达 GTC 大会上,吉利、Momenta、华为等重量级玩家公开质疑 VLA 的局限性,而“世界模型”和 VA 路线则从不同方向给出答案。最具戏剧性的是,VLA 概念共同开创者 Generalist AI 团队公开表示要“抛弃”VLA 乃至世界模型的标签,认为“过于在意工具的标签,反而会限制通往物理 AGI 的想象力”。
然而,几个月后,争论声量变小,模型发布变多,核心较量从“谁是对的”变成“机器人到底动起来没有”。WAIC 上,机器人展品不再是“能动的演示”,而是围绕 3C 电子、汽车制造、仓储物流等真实场景的应用展示。更值得注意的是,头部玩家开始心照不宣地做“路线混搭”。
智平方创始人郭彦东明确表示,世界模型不是 VLA 的竞争路线,而是 VLA 体系中的核心组成部分。星海图 CEO 高继扬也认为两者底层逻辑相通,未来会走向融合。小鹏汽车刘先明强调,世界模型与第二代 VLA 不是互相替代或竞争的关系,而是透过不同训练信号共同提升对物理世界的理解。
尽管泛化能力被质疑,VLA 模型更新反而进入小高潮,方向转向产品化。蚂蚁灵波 7 月开源的 LingBot-VLA 2.0,预训练阶段融入 6 万小时真实物理数据,覆盖 17 个厂商的 20 种机器人构型,在 GM-100 评测中领先 π0.5 与 GR00T N1.7,推理延迟在 RTX 4090 上控制在 130 毫秒以内。灵波表示,VLA 现在还不是“拿来即用”的成熟形态,更像是具身智能的基础底座。
面壁智能发布的 MiniCPM-Robot 系列,参数量仅 1.5B,在 LIBERO、Calvin 等评测中进入第一梯队,单次决策延迟仅 120 毫秒,接近 π0.5(234 毫秒)的一半。其通过纳入历史观测,在 RMBench 中拿到约 53 分,而 π0.5 仅约 10 分,能完成叠衣服、做三明治等长任务。
擎仓机器人走轻量化路线,其 Evo-Depth 参数量仅 0.9B,仿真端 Meta-World 达 84.4%、LIBERO 达 95.4%,真机平均成功率约 90%,部署侧仅需约 3.2GB 显存、约 12.3Hz 推理频率。这些进展表明,VLA 没有“死”,而是变得更小、更快、更能干。
世界模型同样在加速进化,从“视频生成”和“轨迹预测”的学术竞赛,转向“行动一体化”。大晓机器人在 WAIC 上发布的开悟世界模型 Kairos 3.1,依托混合 Transformer 架构与共享混合注意力机制,将视觉观测、语言指令、力触状态、策略轨迹等多维数据压缩进统一隐空间,实现理解、生成、预测的原生融合。
Kairos 3.1 搭载自主反思闭环机制,执行失败时可自主定位问题、迭代优化动作策略。其 8B 版本在英伟达 Jetson Thor 平台上单次推理仅 125 毫秒,已在家务场景中展现实用价值,如洗衣服流程能自主拆分十余步操作,出错后自动重试。
然而,灵生科技合伙人蒋玉骅提供冷静视角:目前工业界与学术界的世界模型规模普遍在 10B 以下,甚至没有人画出 Scaling Law 曲线。对比大语言模型,具身智能大概相当于 GPT-3 之前的阶段。Gartner 研究副总裁高挺也表示,世界模型目前更多用于合成数据生成、仿真、评估和辅助规划,真正直接用于实体机器人控制的案例仍然比较早期。
面对“终极答案”,行业态度变得更加谦逊。灵波表示,VLA 擅长人机交互和模态融合,世界模型擅长预测未来状态,两者将加速融合,形成优势互补的闭环智能。灵波已发布 LingBot-VA 2.0,是行业首个具身原生的世界动作模型,并判断当前的 VLA 和世界模型都不是终局。
智平方提出类脑架构 NeuroVLA,仿生人类大脑的“皮层-小脑-脊髓”三层体系,在 VLA 和世界模型之上再做系统级整合。而 Generalist AI 选择“从零训练”路线,其 GEN-1 模型约 99% 参数从零开始训练,成功率超过 99%,速度提升 2-3 倍,仅需上代模型 1/10 的数据和微调。
2026 年上半年,国内具身智能赛道融资总额达 934.74 亿元,较 2025 年同期暴涨约 5 倍;融资事件 322 笔,同比增长 137%。工信部表示,今年我国人形机器人全年整机产量有望突破 10 万台。但具身智能至今仍没有一张被完整验证过的技术路线图,接下来的分水岭是让机器人真正动起来。
本文基于 AI 前线的一篇分析文章,其中包含多家公司高管和行业专家的观点,以及具体模型数据和融资数据。这些数据多为公司或机构声称,未经独立验证,且部分数据(如融资总额)来源未明确,应视为 source_claim。
具身智能的路线之争已从对立走向融合,VLA 与世界模型正在互相补充。行业共识是,没有单一终局,只有不断进化的路线。真正的分水岭在于机器人能否可靠、规模化地完成任务,而非技术标签。
主报道
主报道来源