Meta 新模型把第一梯队 AI 推理成本压到八分之一:Agent 应用迎来成本拐点

Meta Muse Spark 1.3 以 62 分进入 Artificial Analysis 第一梯队,同时把输入输出成本大幅压低。对 Agent 应用来说,前沿模型的竞争开始从“谁更聪明”转向“谁更值得调用”。

Meta 最新发布的 Muse Spark 1.3 让前沿大模型的竞争焦点从单纯跑分转向“成本—性能”曲线。根据 Artificial Analysis 的 Intelligence Index 数据,Muse Spark 1.3(max)取得 62 分,进入当前评测体系的第一梯队,并超过 GPT-5.6 Sol(61 分)、Kimi K3(60 分)和 Gemini 3.8 Flash(59 分)。更受关注的是,其输入价格约为 Claude 同类产品的 1/8,输出价格约为 1/12。

这意味着,原本需要高价模型支撑的部分 Agent 工作流,可能迎来新的定价锚点。

62 分进入第一梯队,Agent 能力是主要增量

Artificial Analysis 的 Intelligence Index 是覆盖 Banking、I-Bench、SciCode、Humanity’s Last Exam 等维度的综合评测体系。Muse Spark 1.3(max)拿到 62 分后,目前仅落后于 Claude Fable 5.1 和 Claude Opus 5,与 Claude Fable 5、GPT-5.6 Sol 等顶级模型处于同一分数区间。

值得注意的是,Meta 此次宣传中的 62 分对应的是 max 模式,目前仍处于有限预览阶段;当前可公开调用的是 xhigh 模式,得分为 61 分。两者相差 1 分,但可用性和成本策略并不完全相同。

Muse Spark 1.3 的能力提升主要集中在两个方向:

  • Agent 工作流能力:在 Terminal-Bench 2.1 的 agentic coding 测试中得分 88.8,接近 Claude Opus 5 的 89.1;
  • 长周期软件工程能力:在 DeepSWE v1.1 中得分 75.4,高于 GPT-5.6 Sol 的 72.7。

这两个指标对应的正是 AI Agent 在实际项目中最消耗 token 和算力的场景:多轮工具调用、代码执行、错误修正和长期任务规划。Muse Spark 1.3 在这些任务上的表现,说明 Meta 并非单纯追求泛化智能,而是把优化重点放在了高频生产场景。

“便宜 8 倍”需要区分 max 与 xhigh 模式

素材中提到,Muse Spark 1.3 的输入成本约为 Claude 同类产品的 1/8,输出成本约为 1/12。但这个说法主要对应 max 模式的理论定价,而 max 模式目前尚未全面开放。

如果以当前可调用的 xhigh 模式计算,Muse Spark 1.3 的单任务成本约为 0.55 美元;对比 Kimi K3 的 0.86 美元、GPT-5.5 的 1.18 美元,仍然具有明显优势。若进一步参考 max 模式约 0.4 美元的单任务成本,成本差距会进一步拉大。

在一个典型 Agent 任务中,假设项目需要 20 轮对话、每轮平均输出 6000 token,使用 GPT-5.6 Sol 的成本约为 12 美元,而 Muse Spark 1.3 约为 2 美元。这类长链路、多轮调用的任务,正是低成本模型最容易体现价值的地方。

不过,Muse Spark 1.3 也有明显的代价。Artificial Analysis 实测显示,该模型完成完整 Intelligence Index 需要输出 120M token,而行业中位数约为 72M token。也就是说,它完成同类任务时的输出量约为行业中位数的 1.7 倍,会带来更高的吞吐开销和潜在延迟。对于实时对话或 token 预算严格受限的场景,这一特性可能削弱其成本优势。

MoE 架构与专家复用,是压低推理成本的关键

Muse Spark 1.3 的成本优势并非单纯来自降价,而更可能与 MoE(Mixture of Experts)架构有关。MoE 模型的核心特点是“大参数总量 + 小激活参数量”,推理时只激活与任务相关的部分专家参数,而不是全量参数运行。

如果 Meta 在该模型中采用动态专家选择策略,即根据输入任务特征只调用相关专家子集,那么成本压缩就不是简单依赖规模效应,而是架构层面的效率优化。这与 Llama 系列强调开源、通用和可定制的路线形成区分:Muse Spark 更强调闭源商业场景下的成本—性能平衡。

专家复用机制也能解释为什么 Muse Spark 1.3 在 Agent 和科学推理能力上提升明显,却没有按比例推高推理成本。同一套专家网络可以被多个任务类型共享,使能力增量被分摊到更少的激活参数上。

从输出速度看,Muse Spark 1.3(xhigh)约为 182 token/秒。这个速度不一定超过所有轻量模型,但在 61 分左右的智能水平区间内属于合理区间,能够支撑 Agent 链路中的连续调用。

对 API 定价和 Agent 部署意味着什么

Muse Spark 1.3 的真正意义,不只是“比 GPT-5.6 便宜”,而是它给行业提供了一个新的成本锚点:在 Agent 工作流中,接近第一梯队的智能水平可以用明显更低的价格获得。

这会影响两类决策:

  • API 定价:当高质量模型的输入输出成本大幅下降,其他模型服务商在同类价格区间将面临更大压力;
  • 应用架构:开发团队可以把高容错、长链路、成本敏感的任务交给低成本模型,把最终表达、复杂决策或低风险要求更高的环节交给更强模型。

换句话说,过去架构设计更多考虑“模型能不能完成任务”,现在则开始转向“值不值得用这个价格完成”。如果差 5% 的分数可以用差 80% 的成本获得,那么高频 Agent 场景的经济模型会被重新计算。

不过,这种替代并非没有限制。Muse Spark 1.3 更适合高频调用、成本敏感、对输出长度有一定容忍度的任务;而对响应时间敏感、单轮 token 预算有限、或需要严格控制输出格式的场景,仍需要更谨慎地评估。

原创文章,作者:点点,如若转载,请注明出处:https://www.dian8dian.com/meta-xin-mo-xing-ba-di-yi-ti-dui-ai-tui-li-cheng-ben-ya-dao

Like (0)
点点的头像点点
Previous 16小时前
Next 3小时前

相关推荐