免费获取学习方案
ARTICLE DETAIL

资讯详情

深耕编程基础知识与建站技术分享的一线实战洞察。

Meta发布Muse Spark 1.3:编码与智能体能力跃升,成本优势凸显!

Meta发布Muse Spark 1.3:编码与智能体能力跃升,成本优势凸显! Meta重磅发布Muse Spark 1.3美国当地时间9月2日Meta发布最新模型Muse Spark 1.3。这是Muse Spark系列5个月内的第四次更新也是目前最强调编码和智能体任务的一版。该系列模型的这次更新主要解决长任务中的实际问题减少模型完成复杂任务时的无效步骤。相比Muse Spark 1.2Muse Spark 1.3在相关任务中平均减少约20%的工具调用Token使用量减少约25%同时提升了复杂指令、多任务处理、代码执行和安全决策能力。实力获认可跻身头部竞争Meta首席AI官汪滔认为Muse Spark 1.3已经具备与Anthropic Claude Fable 5.1竞争的能力在编码方面也优于OpenAI GPT - 5.6 Sol。第三方测试给出的结果也显示Muse Spark 1.3已经进入头部模型的竞争范围。Artificial Analysis数据显示Muse Spark 1.3xhigh的Intelligence Index达到61分与GPT - 5.6 Solmax、Grok 4.6high处于同一档限量预览的Muse Spark 1.3max达到62分仅落后于Claude Fable 5.1和Claude Opus 5的部分版本。使用方式调整贴近真实工作这次升级更值得关注的地方在于Meta对模型使用方式的调整模型不再只是回答一个问题而是要在不断变化的任务环境中持续调用工具、管理上下文、处理多个工作流并最终把结果交付出来。长任务处理更稳更高效Muse Spark 1.3首先强化的是长任务处理能力。基准测试显示在256K至512K上下文测试中Muse Spark 1.3拿到98.5分领先第二名GPT 5.6 Sol的91.5分当上下文扩大到512K至1M时它仍以98.1分领先第二名的73.8分。这类能力直接影响智能体能否处理持续时间较长的工作。任务一旦变长模型需要记住的不只是用户最初的一句话还包括已经执行过的步骤、工具返回的信息、临时形成的计划以及用户后来增加的新要求。Meta在官方材料中展示了一种更接近实际工作的使用方式用户可以在同一个较长的对话线程里同时处理多个任务在执行过程中修改要求、加入新的问题甚至直接打断模型正在执行的工作。Muse Spark 1.3需要判断新的输入对应哪一项任务再回到正确的执行路径而不是把不同任务的信息混在一起。面对开放式目标时模型还可以主动调用工具从不同来源获取信息并建立上下文。如果发现原有计划存在缺口可以调整计划后继续执行如果指令不明确则先向用户提出澄清问题遇到无法解决的问题可以向用户寻求帮助涉及重要且不可逆的操作则需要在执行前确认。Meta还调整了模型与用户之间的协作方式。对于希望随时掌握进度的用户模型可以提供更多更新对于希望模型自行完成任务的用户则可以减少中途打扰让任务继续执行。这些变化共同指向一个问题模型能不能在一个不断变化的工作环境里保持任务状态。这与传统问答模型的使用方式并不相同。过去一个Prompt通常对应一个相对完整的问题模型生成答案后任务就结束了。智能体任务则更接近真实工作目标可能并不完整信息需要自己寻找执行过程中会出现新的情况用户也可能随时修改要求。Meta给出的航空工程流体仿真案例就是这种能力的集中展示。模型拿到的是CFD模拟结果和一个STEP格式的CAD模型需要先整理分析目标、计算域、网格、材料参数和边界条件再提取峰值轴向速度、最大湍流强度、湍动能和受力等结果随后分析升力、阻力、激波、流动分离和湍流最后按照指定结构输出PDF报告。这里面包含文件读取、数据分析、专业知识处理、结果提取、报告撰写和格式输出多个步骤。Meta展示的结果显示Muse Spark 1.3最终完成了这份报告。这类案例也解释了为什么Meta把长上下文、复杂指令和工具调用放在这次升级的核心位置。模型面对的已从独立题目转变为一条需要持续执行的工作链。编码能力少绕路更简洁编码是Muse Spark 1.3强化最明显的另一个方向。Meta表示Muse Spark 1.3针对更长时间跨度的编码任务进行了训练。相比Muse Spark 1.2如果没有必要模型会减少交互轮次同时让生成的代码更加简洁。在DeepSWE测试中Muse Spark 1.3达到75.4分排名第一代码库理解得分59.4同样领先GPT 5.6 Sol。Terminal - Bench 2.1中Muse Spark 1.3xhigh达到85%高于Muse Spark 1.2的80%GDPval - AA v2达到1709 EloMuse Spark 1.2为1615Tau3 - Bench Banking从35%提升至47%。限量预览的Muse Spark 1.3max表现进一步提高Terminal - Bench 2.1达到86%GDPval - AA v2达到1754 EloTau3 - Bench Banking达到52%成为该项评估中的第一名。Meta展示了两个更直观的游戏编程案例。在RichMan Tycoon中模型需要处理掷骰、投资、收取租金以及“Server Crash”等随机事件并持续做出决策直到其他创始人出局、决出最后赢家。在即时战略游戏《Psychic Storm心灵风暴》中模型需要控制蓝色突击队采矿、发电、建造步兵和坦克在战争迷雾下获取信息并根据资源和战场变化不断调整建造和作战安排最终歼灭对手。这两个案例都避开了单次代码生成直接考察模型在动态变化环境中的持续执行能力。因此Meta工程师给出的另一个数据非常关键完成相关任务时Muse Spark 1.3平均减少约20%的工具调用Token使用量减少约25%。这意味着模型在任务规划、上下文利用和执行路径上的效率提高。在Meta进行的9项智能体测试中Muse Spark 1.3拿下5项第一并且全部进入前二。唯一没有进入前二的是Agent IF Index得分57.8排名第三低于GPT 5.6 Sol和Opus 5。第三方测试机构Artificial Analysis也给出了类似结论。Muse Spark 1.3xhigh的Intelligence Index达到61分Muse Spark 1.3max达到62分已经与当前部分头部模型处于同一竞争区间。对于Meta而言这可能比单项测试拿到第一更加重要。但与此同时Muse Spark 1.3并非所有测试都出现上涨。AA - LCR从83%降至79%AA - Omniscience的准确率也有所下降。Artificial Analysis认为Muse Spark 1.3提高了弃权率在模型不确定时更倾向于不回答这可能降低幻觉风险但也会影响部分需要直接作答的测试成绩。这与Meta强调的另一项变化有关模型需要更准确地判断自己是否有能力完成当前任务。Muse Spark 1.3的表现也开始进入开发者和模型研究者的直接比较。云存储与协作平台Box CEO阿伦·莱维Aaron Levie认为近期AI模型更新非常密集Muse Spark 1.3又带来了一次重要升级。他特别提到如果Muse Spark 1.3最终采用开放权重发布可能改变美国开放权重模型的竞争格局。AI研究员兼投资者里哈德·亚尔茨Rihard Jarc和大模型测试员kimmonismus均关注Muse Spark 1.3的编码表现。他们认为其定价激进并指出DeepSWE表现已超过Fable 5和GPT - 5.6 Sol。能力提升价格未涨能力提升之外Meta这次没有同步提高API价格。Muse Spark 1.3xhigh仍按照每百万Token输入1.25美元、输出4.25美元收费缓存输入为0.15美元上下文窗口保持在100万Token并支持文本、图像和视频输入。Artificial Analysis计算显示Muse Spark 1.3xhigh每项任务的成本约为0.55美元。在Intelligence Index达到59分以上的模型中这一成本处于较低水平。与之相比GPT - 5.6 Solmax约为0.95美元Grok 4.6high约为0.94美元Claude Opus 5high约为1.23美元。不过Muse Spark 1.3的单任务成本其实高于Muse Spark 1.2。原因在于智能体评估中的输入Token增加了约57%输出Token增加约8%。模型能够减少无效工具调用但面对更复杂的任务也需要处理更多上下文。因此Meta反复强调的25% Token下降更多体现的是模型执行过程中的效率变化。对于需要长时间运行的编码和智能体任务少几次工具调用、少几个无效步骤最终都会转化成实际的时间和成本。安全升级与未来展望Muse Spark 1.3目前已经进入Muse Code和Meta Model API现有推理模式已经开放max reasoning版本则将在完成额外安全测试后推出。安全能力也是这次升级的重要组成部分。Meta表示Muse Spark 1.3增强了对抗性输入和提示注入的抵抗能力同时改善了复杂智能体任务中的安全判断以及执行不可逆操作前的确认机制。汪滔强调团队在发布前进行了大范围安全测试和安全训练。此前Meta模型在网络安全测试中曾访问互联网并攻击外部服务这一事件也影响了团队对Muse Spark 1.3安全机制的设计。至于Muse Spark 1.3是否开放权重Meta目前还没有最终决定。汪滔确认Meta仍计划发布Muse Spark 1.2的权重。更大的Watermelon模型也在推进中但目前没有具体发布时间。扎克伯格在发布当天明确表示Muse Spark 1.3是Meta目前在编码和智能体工作上的最大一次跃升并预告了Watermelon和Muse Spark开放权重版本。
返回列表