从看见到行动 广东空间智能模型加速落地
“把杯子拿起来,放到桌子中央。”这句话,人听完就会伸手,机器人却可能停在原地。它认得杯子,却不知道杯柄究竟离自己多远,更不知道对应哪一处空间。几厘米,隔开了“看见”与“做到”。
今天的视觉语言模型,已经能回答“眼前有什么”。但机器人生活在三维世界里。它每一次抓取、放置和移动,都要把语言变成可以执行的坐标。过去,这条链路常被拆成多个模块:视觉模型负责识别,抓取模块寻找位置,深度传感器测算距离,导航系统再规划路线。模块之间只要出现一次误差,行动就可能失败。
SpatialPoint试图把这些步骤接到同一个接口中。它由视启未来联合清华大学、粤港澳大湾区数字经济研究院研发,将彩色图像、深度信息和自然语言纳入同一套空间推理过程,直接输出相机坐标系下的三维坐标。它把机器人需要的位置归为两类:杯柄、按钮、门把手,是能够触碰的“实点”;桌面中央、可通行区域、避让位置,是位于自由空间的“虚点”。抓取、放置、导航,由此有了可以共同理解的空间语言。
实测中,SpatialPoint在实点任务上的有效操作位置准确率达到79%,有效操作区域内的平均误差可降至9.3毫米。相较于传统纯彩色图像方案,定位精度提升超过30倍。
这组数字真正要回应的,是工厂里不断发生的变化。传统工业机器人在固定位置重复固定动作,一旦工件挪动、产品换型,工程师往往要重新编程和调试。空间智能模型希望让机器人先观察现场,再决定下一步在哪里行动。它可以装在机械臂、移动机器人或人形机器人之上,让“算法大脑”与不同硬件协同,降低产线变化带来的重新配置成本。
不过,从测试台到生产线,模型还要经受噪声、异常、实时性和安全性的考验。算法需要的,不只是一间实验室,更是一个足够复杂的真实世界。广东恰好提供了这样的土壤。电子信息、家电、汽车、智能装备等产业在这里密集生长,工厂、仓库、物流和零售场景彼此相连。
于是,开头那个挪动杯子的场景,不再只是一次实验。它背后,是广东把制造场景变成训练场,把产业需求变成技术问题,再让技术回到生产线的循环。机器人学会伸手之前,广东正在为它准备一个可以反复试错、不断长大的世界。
(封面设计:刘妍妍)
