机器人业内专家孙立宁:注意过高预期透支具身智能行业信心
21世纪经济报道记者 邓浩
从能走、能跑、能跳,到真正理解环境并自主完成任务,具身智能机器人距离人们想象中的“类人智能”还有多远?
9月17日,在第九届中国机器人峰会上,业内知名专家、苏州大学教授孙立宁在接受21世纪经济报道等媒体采访时表示,当前人形机器人的“小脑”和肢体发展较快,在运动控制和机械本体方面已经取得明显进步,但负责感知、分析和决策的“大脑”仍面临算力、算法和数据等多重约束。
他认为,现阶段应当客观看待具身智能的发展水平,机器人有望率先在家庭服务、陪伴和工业生产中的简单、固定场景落地,但不能期待其短期内像人一样处理所有复杂任务。具身智能的发展方向是明确的,实现过程则需要长期积累。

五类关键技术支撑具身智能
Q:当前具身智能发展到了什么阶段?还需要突破哪些关键技术?
孙立宁: 以人形机器人为例,首先是本体设计。它有双腿、双臂和多个自由度,需要在有限空间内集成大量部件,因此轻量化、紧凑化和仿生化设计非常关键。
第二是关节。大家看到机器人翻跟头、跳跃,背后需要关节在很小的体积内提供较强的爆发力和较高的功率密度,同时还要解决长时间工作时的发热和可靠性问题。
第三是感知。机器人要像人一样与外部环境交互,就要具备视觉、听觉、触觉、嗅觉、温觉和滑觉等能力。比如,一只尺寸有限的灵巧手要集成电子皮肤,并感知不同物体,对材料、集成电路、MEMS、芯片和传感器技术都提出了很高要求。
第四是运动控制,也就是机器人的“小脑”。机器人跳跃、抓取或者全身协同运动,涉及多个自由度的动力学控制。
第五是机器人的“大脑”。人给机器人一个任务后,它需要把语言指令转化为一系列动作,并结合视觉、声音和力觉等信息,判断下一步做什么。这涉及大模型以及对多种传感信息的分析和决策。
总体来看,具身智能的关键技术体系涵盖软件、硬件和传感器,可以概括为“大脑、小脑和肢体”三个部分。
Q:现阶段的具身智能机器人到底有多智能?
孙立宁: 早期工业机器人没有感知能力,只能按照预先编好的程序重复动作,可以称为第一代可编程示教机器人。第二代机器人具备一定的局部感知能力,比如通过视觉识别焊缝位置,或者感知抓取物体的重量。
现在探索的第三代机器人,不只是感知,还要能够分析和决策。比如,人只告诉机器人“把杯盖打开”,而不再逐步教它如何操作,机器人需要自己决定怎样拿起杯子、放在哪里以及用多大的力。
但目前距离像人一样理解和处理复杂环境还有很大差距。现有人工智能在图像、语义和文字识别方面进步很快,可以辅助人解决一些复杂识别问题;放到机器人上以后,还要处理图像、声音、力觉和操作过程中的大量不确定因素。相关数据尚未被充分采集,系统对复杂环境的理解和决策能力仍然有限,更多是框架式、局部式的智能。对此要客观评价,不能过度夸大。
Q:机器人形成类似人的经验和自主决策能力,难点在哪里?
孙立宁: 人有很多难以直接表达的经验知识。以炒菜为例,先让机器人完整模仿人的动作,只能实现知识迁移。如果食材数量、温度或者火候发生变化,原来的动作参数可能就不再适用。
要让机器人在变化的条件下仍然完成任务,就要建立评价和反馈机制,让它通过学习逐渐积累经验。但“少许”是多少、“熟了”是什么状态、“香”如何量化,这些连人都很难完整描述。机器人要获得足够复杂的数据,并建立有效反馈,才能逐渐形成适应环境的能力。理论框架是成立的,具体执行却非常复杂。
近期将率先落地简单、专用场景
Q:未来几年,具身智能可能率先在哪些场景落地?
孙立宁: 不要指望一个机器人短期内什么都能做。更现实的路径,是先进入简单、明确和重复性较强的场景。
在家庭中,可以先在扫地机器人等产品上增加简单操作能力,例如捡起地上的袜子或鞋子,这类功能有望较快实现。家庭康养方面,机器人可以按照固定生活习惯提醒老人吃药,或者帮助拿取咖啡、手机、充电器和拖鞋等物品。此类相对简单的服务,未来三年左右有望逐步实现。
但如果要求机器人像护工一样,处理搀扶、如厕、喂饭以及认知障碍老人照护等复杂任务,短期内并不现实。未来三到五年,市场上可能会出现一批以情感陪伴为主、价格相对可接受的专用机器人。
工业场景也会从单一任务开始。比如,让机器人长期重复完成拧盖子等工作,并根据物体变化调整力度,多模态感知和控制有望在这类限定场景中发挥作用。不能期待机器人突然具备与人相同的能力,但让机器人逐步变得更智能,这条技术路线是成立的。
Q:应该如何看待当前具身智能行业的热度?
孙立宁: 新技术出现时,社会往往会给予很高期待。关注和投入能够调动更多力量参与研发,推动技术进步,这是积极的一面。
但如果公众预期过高,认为机器人三年内就能像人一样工作,现实产品又达不到这种水平,就会感到失望。具身智能是一个循序渐进的过程。它的理念和方向没有问题,但不能把它放大成“一夜之间改变世界”。
科技进入生活通常也是渐进的。汽车从机械化发展到具备影音、导航、辅助驾驶和自动泊车等功能,人们未必能感受到每一步变化,但智能化一直在持续。具身智能也会沿着类似路径,一段一段地实现。
“小脑”和肢体较快,“大脑”仍是长期课题
Q:机器人的“大脑”“小脑”和肢体,哪一部分进展更快?
孙立宁: 近几年,中国机器人在机械本体和运动控制方面进步明显。从早期只能缓慢行走,到能够跑步、参赛,再到尝试进入工厂工作,“小脑”和肢体的发展比较快。
但目前展示的机器人还不等于理想状态下的具身智能。有些依赖遥控,有些依赖示教,有些只是重复动作,另一些只能进行简单反馈。即使安装了多种传感器,也未必能够充分分析和利用这些信息。
“小脑”和肢体在产品推出后,经过三到五年迭代,有机会达到较好的水平;“大脑”则是更长期的课题。要达到科幻作品中那种接近人的综合智能,可能需要二三十年持续攻关,最终形态也未必与今天的设想完全一致。
Q:机器人的“大脑”为什么发展相对较慢?
孙立宁: 主要受到算力、算法和数据三方面限制。
首先是算力。模型既要快又要准,需要高性能芯片支撑,现有计算能力仍然存在约束。其次是算法。即使算力提高,模型对复杂环境的适应能力也未必足够,智能算法还需要持续突破。最后是数据。人的每一个动作都会产生大量视觉、触觉和运动数据,获取、标注和处理这些数据都很困难。
这三方面需要共同进步。随着芯片性能提升、算法不断改进,以及更多高质量数据被采集和利用,机器人的智能水平会逐步提高。就像移动电话和计算机经历长期演进一样,具身智能不会一步到位,而会慢慢进入生产和生活。
