具身智能:从身体到大脑的转变
身体能力的提升与局限
在过去两三年间,机器人本体取得了显著进步,能够实现行走、跳跃等动作,工业场景中的机械臂也具备了高精度的操作能力。在实际人机协作场景中,机器人的短板逐渐显现。工业产线中,预先编程的机器人面对任务和工件的变化时,缺乏灵活性;日常场景里,语音交互存在噪音环境下识别率低、复杂指令处理链路长等问题。
大脑:具身智能的新焦点
具身智能行业正将重点从“身体”转向“大脑”。目前多数机器人采用“一机一脑”模式,更换场景或任务时需重新采集数据和训练。行业主流的大脑技术路线分为“视觉—语言—动作”(VLA)和“视觉—动作”(VA)两派。VLA路线成熟但预测能力不足,VA模型则补充了动态建模功能,不过行业对技术路径尚未形成定论。

大脑技术路线的探索与比较
VLA路线:成熟与不足
VLA路线的机器人把看到的多模态内容转化为文字,再通过理解文字转化成动作执行。其优势在于多模态理解语言精准,推理算力需求较少,商用成本较低。它在预测方面存在欠缺,例如难以预料杯子放在桌子边缘可能掉落的情况,不利于机器人在真实世界中的操作。
VA路线:直接与补充
VA路线的机器人直接理解多模态内容并预判下一步动作,省去了文字转换环节。蚂蚁灵波发布并迭代的VA模型,补充了动态建模功能,让模型对未来有一定的预判能力。但VA是否是具身大脑的终点尚无定论,未来可能会出现结合VA和VLA的更好模型。
数据短缺:行业规模化的瓶颈
真机数据:昂贵与匮乏
真机数据采集价格昂贵,但能贴近真实场景。上海觅蜂科技推出无本体采集硬件MEgo系列,可实现“随行即采”。真机数据也存在问题,如机械臂每次抓取有磨损,数据成本高,且长尾场景数据极度匮乏,具身模型可能因小概率事件受限。
仿真数据:便宜与局限
仿真数据成本低,但泛化性差,与物理世界存在差距。上海松应科技引入混合体系,包含10%真机数据、80%仿真合成数据和10%微调数据,有效降低了成本,提升了模拟环境到现实世界的迁移成功率。

相关问答
具身智能行业为什么要从身体转向大脑?
目前多数机器人“一机一脑”,更换场景或任务需重新采集数据训练,成本高。行业希望开发通用可迭代的具身大脑,提升机器人灵活性和适应性。
VLA路线有什么优缺点?
优点是多模态理解语言精准,推理算力需求少,商用成本低;缺点是预测能力欠缺,不利于机器人在真实世界干活。
VA路线相比VLA路线有哪些改进?
VA路线省去文字转换环节,蚂蚁灵波的VA模型补充了动态建模功能,让模型对未来有一定预判能力。
数据短缺对具身智能行业有什么影响?
数据短缺是行业规模化的最大瓶颈之一,限制了具身智能模型的训练和应用,真机数据采集成本高且长尾场景数据匮乏。
松应科技的混合体系是如何解决数据问题的?
松应科技的混合体系包含10%真机数据、80%仿真合成数据和10%微调数据,降低了仿真合成数据成本,提升了迁移成功率。
未来具身大脑的技术路线可能会怎样发展?
未来可能会出现结合VA和VLA的更好模型,但具体如何结合仍在探索中,两三年内可能会出现新的具身大脑架构。
简短标题:具身智能竞赛为啥从身体转向大脑?
转载声明:欢迎分享本文,转载请保留出处!发布者 财云量化
