8月25日消息,刚刚落幕的2026世界机器人大会,一个最直观的变化是“跳舞的少了,干活的多了”。
在宇树、优必选、银河通用等热门企业的展厅中,机器人开始模拟产线上拧螺丝、分拣货品、叠衣服、做早餐的真实作业场景。具身智能不再是学术论文中的概念,而是真切地走到了产业化的大门前。
然而,从实验室到工厂车间、到家庭客厅这一步,远比想象中艰难。
行业仍处发展早期 数据质量是核心瓶颈
在火山引擎具身智能技术与应用论坛上,火山引擎具身智能产品线负责人王运凯坦言,尽管公众常被展厅中灵动的机器人DEMO所震撼,但若以自动驾驶的L1-L5等级来类比,具身智能目前“充其量仍在初级阶段”。
他进一步解释称,当前大多数机器人完成炒菜、取物等长程任务时,中间的动作衔接、导航切换仍依赖大量手写规则代码,远非端到端的VLA模型一以贯之。即便如Gen-1.5等模型在单点抓取等“原子技能”上可实现Zero-shot 60%的成功率,但面对真实工业或家庭场景的长流程,各模块间的“泥泞”串接仍是工程化主体。
火山引擎副总裁、具身智能工程院院长杨立伟则从数据侧印证了这一判断。他指出,行业普遍使用EGO数据做模型能力提升,不少企业拥有千万小时级别的海量数据,但数据规模并没有带来模型能力的同步增长,核心瓶颈在于数据质量参差不齐,一方面多模态、跨模态的数据表征统一存在难点;另一方面数据真实性难以保障。
过往参考自动驾驶的开发经验,大量依托测试场、仿真环境人工构建场景库采集的数据,与真实世界存在差距,训练产出的模型很难在实际环境稳定运行。如何在真实环境采集有效数据,挖掘异构数据中对机器人动作执行有用的信息,是行业亟待攻克的重点课题。
火山引擎解法:从基建到仿真交互全链路支持
面对上述挑战,火山引擎依托自身云基建与豆包大模型能力,构建了覆盖底层基建、数据生产、数据治理、仿真扩增、人机交互的全链条具身智能赋能体系。
在交互侧,豆包大模型的多模态能力成为关键突破。王运凯现场播放了一段演示视频,显示搭载全双工语音大模型Seeduplex的机器人,能根据环境视觉变化和用户语音实时调整回应。
他特别提到,特斯拉在中国未使用Grok而选择豆包,正是看中其在端到端实时语音(S2S)和视觉-语音联合理解上的优势。未来,火山引擎还将融入更多模态并探索可交互的世界模型,让机器人不再沦为“移动音箱”,而是具备主动感知与共情能力的智能体。
在数据生产侧,杨立伟透露,目前国内估值TOP 20的具身智能公司中,已有15家与火山引擎深度合作,其中绝大多数利用豆包模型进行数据切片、自动打标和语义理解。由于EGO和UMI采集的数据长度陡增且无预标注,传统人工方式完全失效,而豆包系列模型能以帧级精度切分动作并生成全局检测标签,每月处理数十万级数据已成常态。
同时,火山引擎的Seedance视频生成模型被用于数据增广。例如将第一视角采样的主视觉数据合成为稀缺的第三视角或腕部视角,解决遮挡问题;还可将裸手替换为不同构型的机械臂,低成本扩充训练集。此外,基于Seed 3D生成的仿真资产会附带物理属性和语义标签,确保尺寸、交互逻辑与现实一致。
宇树科技高级副总裁、创始合伙人张阳光在谈及与Seedance的合作时表示,宇树科技联合Seedance打造的便捷动捕方案,有效规避传统技术短板,实现机器人动作生成的轻量化、高效化落地,已完成简单、复杂多场景动作验证。
张阳光称,相较于传统动捕,Seedance方案最核心的优势是省去数据打标分类成本。Seedance通过提示词生成动作数据,提示词本身即为数据天然标签,可直接跳过数据预处理环节,大幅节省人力成本与研发时间,提升机器人运动控制数据的生产效率。
在底层架构上,火山引擎提供了专为具身多模态数据设计的列式存储方案和湖仓一体平台,内置视频理解、动作切分等,让企业能够快速托管、检索和预处理PB级异构数据。杨立伟强调,火山工程院自身也在主动下场“趟路”,通过后训练和强化学习在真实场景中打磨闭环,并将积累的难题反哺给基模团队,形成“真实场景采集、模型迭代、更高成功率”的数据飞轮。
具身智能的产业化进程,注定不会像大语言模型那样在短短两三年内迎来爆发式普及,更多是一场以十年为单位的持久战。杨立伟最后表示,欢迎行业各界伙伴开展交流协作,也期待更多优秀人才加入,共同推进基础模型迭代与具身智能商业化落地。





京公网安备 11011402013531号