作者 / 来源:中智凯灵 / AiDD

——从 VLA、世界模型到云边端分层架构,腾讯云赵巍在 AiDD 成都站拆解全模态演进路径 ▼
2026年,AI行业最危险的错觉,就是以为“只要模型足够大,机器人就能无所不能”。把千亿参数的大模型硬塞进机器人的躯壳,听起来是通往AGI的捷径,但在真实的物理世界中,这往往是一场灾难的开始。因为物理世界不相信“大力出奇迹”,它只相信物理定律和时间尺度。
触觉响应需要1毫秒,视觉更新需要30毫秒,而长程规划需要数秒——面对这三个数量级的“频率差”,单一大模型注定会陷入“要么来不及反应,要么决策太仓促”的死局。
在刚刚结束的 AiDD 成都站上,腾讯云华西区域解决方案总经理赵巍用这组残酷的数据,戳破了“唯大模型论”的简化误区。在《具身智能x AI大模型-全模态演进方向的思考》主题分享中,他从 VLA路线之争、云边端分层架构一路拆解到数据闭环,为行业算清了一笔真实的“工程账”。

赵巍现场演讲图片
这场分享最核心的价值,不在于罗列前沿模型,而是重新定义了具身智能的落地范式:它绝不是简单地把“大模型装进机器人”,而是要让认知、感知、行动、反馈与基础设施,按照不同的时间尺度与空间层级,实现精密的异频协同。

图 1:赵巍《具身智能 x AI大模型-全模态演进方向的思考》:触觉、视觉与认知规划存在三个数量级的频率差,需要分层分频协同(PPT 第 11 页)
从“会回答”到“能完成”,智能的衡量方式正在变化
讨论具身智能之前,需要先回答一个更基础的问题:我们究竟怎样衡量AI变得更强?
赵巍没有把AGI处理成一个简单的是非判断,而是拆成三个连续维度:性能、通用性和自主性。性能回答“在某项任务上有多强”,通用性回答“能力能否跨领域迁移”,自主性则回答“人愿意把多少决策权交给系统”。
这三个维度放在一起,才能解释为什么一个在基准测试上得分很高的模型,仍未必能够独立完成真实工作。它可能很会回答,却不会调用工具;可能能完成一个步骤,却不能维护长程状态;可能一次做对,却无法在失败后恢复。
因此,分享中提出了一个更具工程意味的指标:AI能够可靠、独立地跑完多长的任务,而不是偶然答对一次。大模型提供“通用的脑”,Agent补上规划、记忆、工具和反思,让系统从会说、会想、会用,继续走向会做。
当这个能力进一步进入物理世界,难度会再次上升。屏幕里的错误可以撤销,现实中的动作却可能带来碰撞、损坏和安全风险;数字任务可以等待推理,机器人却要面对持续变化的环境。具身智能的门槛,正是把“能完成一件事”推进到“能在物理世界持续、可靠地完成一件事”。

图 2:赵巍《具身智能 x AI大模型-全模态演进方向的思考》:大模型提供通用能力,Agent把能力组织成可持续推进的任务闭环(PPT 第 6 页)
VLA成为主线之后,竞争焦点转向世界模型与全模态
过去的多模态模型更多回答“看到了什么”“这是什么”。具身系统还要继续回答“下一步做什么”“动作会让世界变成什么样”。
这也是VLM、VLA与VTLA之间的关键差别。VLM连接视觉和语言,建立对场景与指令的理解;VLA进一步加入动作,把视觉观察和语言指令转成机器人动作;VTLA再引入触觉,让系统处理抓取、接触、受力等更精细的物理交互。
赵巍在分享中将当前VLA路线概括为两类。一类是分层或双系统路线:VLM负责相对较慢的理解和规划,运动策略负责快速控制,优点是模块化、易调试、可解释,对数据要求也相对可控;另一类是纯端到端路线,由统一模型直接完成从感知到动作的映射,理论上上限更高,动作也可能更连贯,但对数据、算力和训练稳定性的要求更高,错误定位也更困难。
短期看,两条路线不会简单地只剩一条。真实产业更可能按场景选择:安全边界严格、硬件差异明显、需要快速交付的任务,会更看重分层结构;数据规模足够、任务相对集中、追求动作自然度的场景,则可能持续推动端到端能力。
更长期的收敛方向,是“世界模型+VLA”。世界模型不只识别当前状态,还要预测动作之后的状态变化;VLA则把这种预测转成可执行动作。再叠加跨本体泛化和触觉、语音等全模态输入,机器人才能从“看懂指令”走向“理解后果”。

图 3:赵巍《具身智能 x AI大模型-全模态演进方向的思考》:VLA分层与端到端两条路线,以及世界模型、跨本体泛化和全模态演进方向(PPT 第 7 页)
为什么不能只靠一个大模型:物理世界要求异频协同
具身智能最容易被忽略的约束,是不同任务对时间的要求完全不同。
触觉和力觉负责接触密集型操作的安全底线,必须毫秒级响应;视觉负责更新场景和空间状态,通常以几十毫秒为周期;认知与长程规划负责任务拆解、失败诊断和重新规划,可以按秒级运行。如果把三者都交给远端大模型处理,网络波动和推理延迟就可能直接变成动作风险。
因此,赵巍提出的工程含义是云边端异构分工:任务理解、场景理解、复杂推理等“慢反应”任务可以上云,利用高性能算力完成;运动控制、实时响应等“快反应”任务留在本体边端,以小模型和本地算力换取更低延迟。
这不是简单地把模型切小,而是重新设计系统责任。上层认知系统负责“想清楚要做什么”,中层感知行动系统负责把目标变成连续动作,底层执行与反射系统则处理即时风险。不同层级按照不同频率运行,又通过感知、规划、行动、反馈的闭环保持一致。
分享中介绍的具身模型组合也体现了这种分工:世界认知基座模型更像机器人的“大脑”,负责高层认知、推理、规划和目标状态想象;VLA操作模型更像“小脑”,负责把视觉观察和语言指令转成连续动作;场景专项模型则围绕空间推理、精细操作、长程规划和风险判断继续优化。
真正成熟的具身系统,不是让一个模型包办一切,而是让每一类模型在合适的位置、以合适的频率承担合适的责任。

图 4:赵巍《具身智能 x AI大模型-全模态演进方向的思考》:世界认知模型、VLA操作模型与场景专项模型形成分层能力组合(PPT 第 12 页)
模型只是中间一层,真正落地需要六层技术栈
当具身智能进入企业项目,问题很快会从“用哪个模型”扩展到“整套系统怎样运行”。
赵巍给出的端到端技术栈包含六层:底部是算力层,为训练、推理和仿真提供异构资源;向上是模型层,承载多模态理解和动作控制;数据层负责真机与仿真数据的采集、标注、清洗和管理;工具链负责训练、微调、推理、仿真和模型管理;应用层连接实时音视频、远程操作和业务能力;终端层则处理音频、传感器和机器人本体。
横向还要贯穿安全合规、可观测、DevOps和节点部署。它们看起来不像“智能”本身,却决定系统能不能长期运行:数据是否被正确隔离,模型服务是否可观测,版本能否灰度升级,故障是否能够定位,能力是否能在不同区域和设备上交付。
这套分层的意义,在于把具身智能从一个模型问题还原为系统工程问题。模型决定某项能力的上限,但数据、平台、部署、通信和运维共同决定这项能力是否能成为稳定服务。

图 5:赵巍《具身智能 x AI大模型-全模态演进方向的思考》:从算力、模型、数据到工具链、应用和终端的六层技术栈(PPT 第 9 页)
具身智能真正稀缺的,不只是数据量,而是数据闭环
具身智能对数据的需求,比纯文本模型更复杂。文本可以被复制和重排,机器人数据却带着动作、时序、传感器、本体和环境条件。同一句指令,在不同机器人、不同光照、不同摩擦力和不同空间布局下,可能对应完全不同的执行轨迹。
赵巍展示的数据生命周期包含三类来源:数量少、成本高的真机数据;数量中等、成本较低的合成与仿真数据;数量更大、成本更低的互联网数据。三类数据不是简单替代关系,而是分别承担真实性、覆盖度与规模化的作用。
更关键的是,数据不能停在“采集完”。它还要经过审核、回放、挖掘、标注、标签和检索,进入预训练与后训练;模型再进入仿真训练、闭环测试和评测,最终部署到机器人,通过真实任务产生新数据,再回到平台继续更新。
这条链路说明,具身智能的核心资产不是某个静态数据集,而是一套能够持续产生、筛选、验证和回流数据的机制。没有闭环,真机采集会变成昂贵的视频仓库;没有评测,仿真数据很难证明能迁移到现实;没有回流,模型上线后遇到的新场景也无法转成下一轮能力。

图 6:赵巍《具身智能 x AI大模型-全模态演进方向的思考》:真机、仿真和互联网数据贯穿训练、评测、部署与模型更新(PPT 第 13 页)
仿真的价值不是替代现实,而是把昂贵试错前移
机器人学习离不开真实世界,但所有试错都放在真实世界完成,代价往往不可接受。设备损耗、安全风险、场地占用和采集周期,都会限制迭代速度。
因此,仿真平台在具身智能工具链中承担三项任务:生成感知模型训练所需的合成数据;为完整机器人软件栈执行软件在环测试;结合强化学习框架开展机器人学习。
仿真的价值并不是制造一个与现实完全相同的世界,而是把大量可重复、可并行、可控制的实验前移。开发团队可以先在虚拟环境里覆盖边界场景,筛掉明显失败的策略,再把少量高价值问题带到真机验证。
但Sim-to-Real也意味着另一个责任:必须持续测量仿真与现实的差距。物理参数、传感器噪声、控制时延和环境变化,都会造成迁移损失。好的仿真闭环不是“在虚拟环境里跑通”,而是让仿真结果、真机结果和失败样本不断校准彼此。

图 7:赵巍《具身智能 x AI大模型-全模态演进方向的思考》:仿真平台用于合成数据、软件在环测试与机器人学习(PPT 第 18 页)
平台化的关键,是把算法与硬件解耦
具身智能的另一个现实难题,是本体、传感器和执行器高度多样。一个算法在某款机器人上跑通,并不意味着换一种机械臂、摄像头或底盘后还能直接复用。
赵巍在分享中介绍了Tairos的三级架构:上层认知系统按需唤醒,中层感知行动系统以较稳定频率运行,底层执行与反射系统负责更高频响应。平台同时通过硬件抽象层HAL,把上层算法与具体传感器、执行器和机器人硬件解耦。
这种设计的工程价值,类似软件系统中的驱动抽象和依赖倒置。新增设备时,团队主要在HAL层实现适配,上层算法不必随着每一款硬件重新修改。配合仿真与语料工具,模型、智能体、设备和任务之间就能形成相对稳定的接口。
这一步很重要。行业早期可以依靠少数专家把单个机器人调通,但规模化要求能力可以迁移:换本体、换团队、换场景之后,仍然能够复用已有模型、工具和数据。平台的意义,正是把一次项目中的调试经验沉淀成下一次项目可调用的基础能力。

图 8:赵巍《具身智能 x AI大模型-全模态演进方向的思考》:Tairos以具身原生智能体、HAL、仿真工具和标准化接口降低适配成本(PPT 第 26 页)
全模态的终点,不是收集更多信号,而是扩大可执行半径
具身智能常被理解为机器人,但它的边界正在向更多智能硬件延伸:眼镜、耳机、录音设备、工卡以及各种贴近工作现场的终端,都可以成为感知和行动入口。
赵巍用“触点密度、上下文深度、执行半径”概括这种变化。硬件负责靠近现场,持续获得第一视角的声音、图像和状态;云端Agent负责整理、检索、生成、分派任务和调用工具。终端不必独自承载全部智能,Agent也不再只等待人在电脑前输入指令。
分享中的AI记忆眼镜案例提供了一个具体切面:眼镜负责低负担采集和实时转录,WorkBuddy负责内容加工、知识库、任务管理与多模型调度;数据与产物通过账号、任务、存储和安全层连接起来。它呈现的不是“给眼镜加一个聊天入口”,而是让现实中的会议、沟通和灵感进入可追踪、可继续执行的数字工作流。
这也解释了“全模态”真正有价值的地方。它不是简单增加摄像头、麦克风和触觉传感器,而是让更多现场状态进入系统,让Agent获得更深上下文,并把理解继续转成任务、动作和可验证结果。

图 9:赵巍《具身智能 x AI大模型-全模态演进方向的思考》:AI记忆眼镜负责现场采集,企业Agent负责加工、知识沉淀和任务执行(PPT 第 32 页)
结语:具身智能的竞争,会从模型能力走向系统能力
从VLM到VLA,再到世界模型、VTLA与全模态,模型仍在快速演进。但一旦进入物理世界,真正决定落地质量的,往往不再是某个单点指标,而是整套系统能否协同。
企业至少要同时回答几组问题:认知、感知和控制如何分层;快反应与慢推理如何分频;真机、仿真和互联网数据如何进入同一个生命周期;模型如何训练、评测、部署和回流;算法如何跨硬件复用;安全、可观测和版本管理如何贯穿全链路。
如果这些问题没有答案,再强的模型也可能停在一次演示里。反过来,当云、边、端,模型、数据、工具和设备被连成闭环,具身智能才有机会从“会做一个动作”走向“能够长期完成任务”。
这也是赵巍这场分享留下的核心判断:具身智能的下一阶段,不只是继续把模型做大,而是把智能放进一套按时间尺度分层、由数据持续驱动、能够验证与进化的工程系统。
这么好的内容,你不转一下吗 下一站 主要参考演讲

