当前位置: 首页 » 资讯 » 新科技 » 正文

不藏了!Meta曝光Muse Spark 1.2核心具身能力

IP属地 中国·北京 编辑:孙雅 量子位 时间:2026-08-21 18:11:37

鹭羽 发自 凹非寺

不ber?写代码的大模型,还能帮忙满屋找鸭子?

自动播放

meta最新释出的这段demo,还真有点意思。

以Coding能力见长的Muse Spark 1.2,突然长出了具身手脚:

读画面、拆任务、定路线、调工具,再根据每一步的新观察修正行动,直到完成任务。

在另一段演示中,Muse Spark 1.2还能指挥双臂机器人整理桌面,各种长链任务均不在话下。

自动播放

发布半个月后,meta终于摊牌了……

Muse Spark 1.2更强的二段技原来在多模态

它可以同时完成视觉编码、机器人规划以及视听理解,并通过Agent工具将全部能力串在一起。

从meta公开成绩来看,这颗「大脑」委实很顶:

高难视觉推理测试ZeroBench中,Muse Spark 1.2狂揽54.0%,与旗舰模型GPT-5.6 Sol也只差0.6个百分点。

负责多模态Agent评测的Zengyi Qin,更是直接点出团队下一站:

继续押注多模态智能体,让它从感知走向行动,从数字世界走进物理世界。

以及……模型即将开源

meta给具身搭了两层大脑

先划重点,演示中的Muse Spark 1.2,并不是看一眼画面就直接输出机械臂的电机指令。

按照官方blog披露的架构,整套机器人系统分为上下两层

上层是一款Muse Spark专用变体,负责充当具身总指挥。

用户给出一个抽象目标后,它先理解当前场景,识别周围物体和分清容易混淆的目标,再将整件事拆成一连串可以执行的子任务。

每个子任务则交由下层的同系列VLA模型执行。

整套流程其实和Muse Spark 1.2写代码时,底层逻辑是相通的。

都是接收目标后,拆分任务再逐步执行,只不过运行操作从写程序变成了移动和抓取,反馈内容也换成了摄像头画面。

具体来说,Muse Spark 1.2会对视频进行深度理解和密集描述,持续提取其中的场景变化,并调用网页开发、实时搜索和空间定位等Agent工具,把音视频里看见的信息转成下一步可执行的任务。

而这也是meta首次如此集中地展示Muse Spark的具身能力,足以说明模型的视觉感知、任务推理和高层规划已然成熟,可以将模型决策推入物理世界中。

除了指挥机器人,视觉编码也是meta此次强调的重中之重。

它能够根据一张图片或者一段视频直接生成网页和游戏,效果be like:

自动播放

模型会先识别参考素材里的布局、层级、字体和视觉风格,再将这些信息翻译成能够运行的代码。

期间也会实时查看页面的渲染结果和交互行为,对照原始素材的偏差,再继续修改,这里依然是同一套自我迭代SOP

另外,模型在Design Arena的多项榜单上均排名靠前,尤其是“视频生成网站”上位列第一。

一个模型干完全部活

为了更好地判断多模态Agent在真实任务中的交付能力,meta还同步预览了一套内部评测工具——WildArtifactBench

首批公开的10项任务覆盖得相当杂:

识别鸟鸣、分析心脏超声、判断冠状动脉狭窄、生成猫的3D网格、设计厨房布局、创建强化学习驾驶训练器、编辑视频……

以鸟鸣任务为例,会一次性交给模型46段音频和一份鸟类声音描述,要求它识别每段声音对应的物种,最终提交一张格式正确的CSV表格。

其中要求模型不仅能听懂,还要管理文件、记录判断、按照指定格式输出,并接受程序逐项验证。

难度相当之高,市面现有模型的表现均距离满分相差甚远。

目前,Muse Spark也已在meta内部被部署在媒体生成等多个领域应用。

比如和Muse Image混合食用,协同完成智能媒介生成,同时输出精细的图像描述,作为Muse Image和Muse Video的训练数据。

Muse Spark还可以把原始文本和图视频内容打包整理成特征信号,供后续业务继续调用。

自动播放

外部开发者也可以通过meta Model APIMuse Code使用到Muse Spark 1.2,后续还将正式开源。

标签: 模型 meta 模态 agent 机器人 代码 网页 格式 画面

免责声明:本网信息来自于互联网,目的在于传递更多信息,并不代表本网赞同其观点。其内容真实性、完整性不作任何保证或承诺。如若本网有任何内容侵犯您的权益,请及时联系我们,本站将会在24小时内处理完毕。