
这两年,大家对 AI 的直观印象还停留在屏幕里:会聊天的大模型、会画画的生成模型、会写代码的编程助手。但如果你留意最近的人形机器人、自动仓储、机器人进厂拧螺丝这些新闻,会发现一个新关键词正在快速升温: 具身智能 。 一句话解释: 具身智能,就是让 AI 不只"会说",还要"能做",在现实世界里通过身体把事情真正完成。 为什么这一步几乎成了 AI 的必然方向?以及,它现在卡在什么地方?
从认知自动化到劳动自动化
过去十年,AI 很大程度上解决的是"认知工作"的自动化:写文案、做翻译、生成图片、写代码、做数据分析。这些任务都发生在"符号世界"里:文本、图片、表格、代码。
接下来几个最大的成本池在哪?在制造、物流、零售、仓储、医疗照护、家政服务这些 线下劳动 。这些任务的共同特点是: 必须在真实物理环境中完成; 要和人、物品、设备持续交互; 错误不仅是"答错问题",还可能造成设备损坏、货物丢失甚至安全事故。
如果 AI 只停留在"给建议、不下场",在经济上的空间就非常有限。要真正承接人类的劳动, AI 必须长出"身体" 。
为什么理解世界离不开身体
很多人会问:模型已经能详细讲出"如何把水从壶里倒进杯子",为什么还要身体来练?关键在于: 现实世界的知识,不是靠"读说明书"能完全学会的。 文本和图片里的"倒水动作",是抽象后的描述,不包含细致的力控、摩擦、材质、动态平衡信息。 真正倒水时,要处理杯子是否稳、桌面是否倾斜、水面晃动、壶口形状、杯子是否易碎等大量变量。 模型要真正理解这些因果关系,必须在真实环境里经历"看—>动—>再看—>再改"的闭环。
具身智能的核心,就是让 AI 形成这样的闭环:感知环境 → 做出动作 → 接收反馈 → 调整策略。 没有身体,这个闭环就无法成立,模型永远停留在"纸上谈兵"。而一旦身体介入,模型不仅要追求"能做成",还要考虑"安全地做成",这就自然把我们带到了下一个问题: 具身智能现在到底卡在哪?
数据荒:第一座大山
做过大模型的人都知道:能力能不能涌现,首先看数据够不够。文本和图片可以在互联网上被动抓取;具身数据则完全不同,它必须在现实世界中 主动生产 。 行业现在的一个粗略共识是:
截至 2026 年初,全球可用的高质量真实物理交互数据总量,大约只有 几十万小时级 ; 要训练一个真正通用、类人的具身基础模型,至少需要 千万小时级 的真实交互数据,甚至有专家认为最终需要 亿小时级 才能达到"开箱即用"的基础成功率。
更直观的一个数字是:全球研发端对高质量具身数据的需求量约 120万小时 ,而全行业每月的产能只有 25–30万小时 ,缺口巨大。 为什么这么难补?主要有四个原因:
- 贵 :一套遥操作平台或人形采集机器人成本动辄几十万甚至上百万,还要改造场地、布置多模态传感器。 - 慢 :人机遥操作一天能产生的"有效样本"有限,之后还要做同步、清洗、标注,很多原始数据会被淘汰。- 碎 :家庭、工厂、仓库、商场、医院的环境变量千差万别,单一场景的数据很难直接泛化到其他场景。 - 难对齐 :不同厂商的机器人构型、关节自由度、传感器布局不一样,控制接口也不统一,使得跨本体数据很难互通、复用。
简化理解: 具身数据必须在现实世界用机器人"一个动作一个动作地采",没有现成的互联网"宝库"可以爬,这决定了它是一个慢工出细活的行业。
还有几座必须跨的山
数据只是具身智能的第一难题,要让"有身体的 AI"真正走进工厂和家庭,还面临至少四大技术瓶颈。
【泛化与抗干扰能力:出了实验室就"掉点"】 很多具身系统在 Demo 场景中表现亮眼,一到真实复杂环境就明显"掉点": 环境动态性强:光线变化、噪音干扰、人来人往、物品随机摆放; 任务链路长:从拿取、搬运、摆放到人机交互,是一个持续数小时的动作序列; 安全要求高:不能只追求成功率,还要严格控制力、速度、安全距离。
这背后考验的是具身模型的 世界理解能力 和 长序列决策能力 。模型不仅要知道"怎么做",还要持续监控"现在还安全吗"。
【仿真到现实迁移:从仿真环境迁移到现实环境鸿沟】 大家都在用仿真环境训练机器人,但仿真毕竟是"模型中的世界",与真实世界存在差距:
- 摩擦、材质、光照、噪声都只是近似; - 仿真可以无限重启,现实试错则有真实成本。
当前比较主流的做法是: 先用现实中的机器人跑出一批可信的示范当底线,再用仿真环境把各种极端情况和冷门场景练个遍,剩下不方便用真机器人练的,就用更便宜的数据方式把空缺补齐,三者结合提高迁移效果。
【硬件与运动控制:身体还不够"工程化"】 我们已经看到很多能跑能跳的人形机器人视频,但要变成能在工厂里 7×24 小时稳定值班的设备 ,还有差距: 核心部件在高负载、高频场景下的寿命和稳定性需要长期验证; 灵巧操作(抓易碎物品、柔性物体)的力控与触觉感知还不够细腻; 电池和散热限制了连续工作时长,很多人形机器人在真实负载情况下,一次充电只能工作数小时。
这也是"机器人在岗时长有限"背后的技术原因:目前更多是验证性上岗,而不是像成熟工业机械臂那样上万小时寿命的工程状态。
【算力与系统工程:能跑的模型跑不起】 具身智能通常需要多模态 VLA 模型(Vision-Language-Action),既要理解视觉和语言,又要输出动作,这类模型天生吃算力: 端侧机器人不可能背一块服务器级 GPU; 必须在有限电池和散热条件下,实现低延迟推理解决实时控制。
同时,整套系统在软硬件上高度耦合:本体、传感器布置、控制算法、上层应用紧密绑定,模块化不足,导致研发、部署和迭代成本都很高。 再叠加标准不统一、数据孤岛、商业模式尚在探索这些因素,行业就形成了一个"难以滚雪球"的闭环:
商用部署少 → 数据不够 → 模型不够稳 → 更难大规模部署。
有身体的 AI 是趋势不是选项
把这些因素串起来看,"为什么 AI 开始需要身体"就很好理解了: 从价值看,下一块最大的自动化空间在物理世界的劳动; 从认知看,要真正理解世界的因果,必须通过身体参与现实交互; 从安全看,有身体的 AI 决策会产生真实后果,逼着我们把可靠性和风控提到新高度; 从产业看,硬件门槛正在下降,数据和系统工程成为新的竞争焦点。
如果说 2022 年是"大语言模型元年",很多报告已经把 2026 年称作具身智能数据规模化的起点 :从"拼本体"走向"拼数据",从"拼参数"走向"拼闭环"。
可以预期的是,未来几年,我们看到的"会聊天的 AI",会逐步长出"能动的身体",从屏幕里走进工厂、仓库、商场乃至家庭。真正决定谁能走在前面的是: 谁先跨过数据、泛化、工程和商业的几座大山,把"有身体的 AI"从概念变成可靠的生产力。
Takeaways
具身智能,就是让 AI 不只"会说",还要"能做",在现实世界里通过身体把事情真正完成。
如果 AI 只停留在"给建议、不下场",在经济上的空间就非常有限。要真正承接人类的劳动, AI 必须长出"身体" 。
真正决定谁能走在前面的是:谁先跨过数据、泛化、工程和商业的几座大山,把"有身体的 AI"从概念变成可靠的生产力。
Was this useful?