文章 / #105

61 分打平 GPT-5.6 Sol,Meta 价不到三分之一

61 分打平 GPT-5.6 Sol,Meta 价不到三分之一

Muse Spark 1.3 标准档官方价输入 $1.25、输出 $4.25 每百万 token,第三方榜单给它 61 分,与 GPT-5.6 Sol(max 档)同分,而 Sol 的价签是 $4 / $20。同分价差三到五倍,这是标准档的便宜,不带附加条件;真正要拿东西换的,是再便宜约 20 倍的 contributor 档。看清那一档拿什么换,再决定这单要不要换过去。

同分不同价:$1.25/$4.25 对 $4/$20

先说结论

61 分是谁评的,榜怎么读

61 分是第三方跑分机构 Artificial Analysis(AA)评的,评分指数叫 Intelligence Index v4.1.1,由九项评测合成:GDPval-AA v2、𝜏³-Banking、Terminal-Bench v2.1、SciCode、Humanity’s Last Exam、GPQA Diamond、CritPt、AA-Omniscience、AA-LCR。这九项里有银行 agent 干活、终端编码这类真任务,也有科学问答和长上下文,比拿单项刷题更接近“这模型能接什么活”的判断。

榜上 Muse Spark 1.3 分两档。max 档 62 分、636 个模型里排第 6,前面只剩 Claude Fable 5.1 和 Claude Opus 5;xhigh 档 61 分、推理类 #10/196,与 GPT-5.6 Sol(max 档)、Grok 4.6(high 档)、Claude Opus 5(high 档)并列,一上来就卡进第一梯队。

Artificial Analysis Intelligence Index:62 分那格打着「Not currently available」

图:Artificial Analysis 官方发布帖配图(2026-09-02)。带网格纹的 62 分即 max 档,标注为当前不可用。

max 这 62 分你今天买不到。 AA 原话是 limited preview for Meta’s partners,它的 providers 页上 0 家可调用,Meta 博客也写明 max reasoning coming shortly after we finish additional safety testing。公众能用的只有 61 分的 xhigh,读榜时先认清这个前提。

AA 模型页:#6 / 636、62 分、Not publicly available

图:Artificial Analysis 的 Muse Spark 1.3 模型页(2026-09-03 查询)。

两个排名别混着看:#6/636 是全量池,#10/196 是推理类池,AA 分了两本账。再往上还有 66 分的 Fable 5.1(max 档)、63 分的 Opus 5(max 档)和 62 分的 Fable 5.1(high 档),都压在 Muse 上面。61 分在第一梯队,但不在榜首;#6 是 max 档(62 分)的位置,不是 61 分这档的位置。

版本爬坡很直:1.1 是 53 分,1.2 到 57 分,1.3 到 61 分。首版 2026-04-08 直接叫 Muse Spark,没有 1.0,之后 07-09 出 1.1、08-05 出 1.2、09-02 出 1.3,五个月里第四个版本。这个节奏本身就是冲着榜位去的:从 1.1 起每版都比上一版涨 4 分,发得勤,榜上就待得稳。

Muse Spark open weights 还没发:官方博客里它仍是 roadmap 预告,原文是 including bigger models, the Muse Spark open weights release, and more——今天还下载不到权重。

顺手记两个硬参数:1M 上下文窗口,输入支持文本+图+视频,输出是文本,模型页写的,不是榜单推断。上下文能装多少、能读哪些模态,决定它接不接得住你要它干的活——装不下你那份代码库,分再高也没用。

Meta 官方博客的 benchmark scorecard(官方自评,非第三方)

图:Meta Superintelligence Labs 官方发布博客内的 scorecard(2026-09-02)。这是官方自评口径,与下文 AA 的第三方分数不是一回事。

官方价和跑分价是两本账

先看官方 per 1M tokens 价,查询日期 2026-09-03:Muse Spark 1.3 标准档输入 $1.25、输出 $4.25,缓存输入 $0.15。同分的 GPT-5.6 Sol(max 档)是 $4 / $20,输入差 3.2 倍、输出差 4.7 倍——同分(61 分这一档),价差就是这么摆出来的。

再看 AA 的 per-task 口径,它算跑完同一套评测要花多少钱。Muse Spark 1.3(xhigh)$0.55/task,AA 逐字写 lowest cost per task for any model at 59+;同榜 GPT-5.6 Sol(max 档)$0.95、Grok 4.6(high 档)$0.94,都贵 70% 以上(AA 原话);Claude Opus 5(high 档)$1.23 更贵,贵出一倍多。per 1M 是纯单价,per-task 把输入输出和缓存混算——两本账算法不同,翻到同一个结论。

比它便宜的也有:DeepSeek V4 Flash(max 档)官方价 $0.44 / $1.32,但只有 52 分,进不了 59+ 这个圈。所以“最便宜”前面那个 59+ 限定不能省——混着档位比价没有意义,同分(同一分数段)才算数。

更便宜的那个,没进 60 分这条线

分更高的更贵:Claude Fable 5.1(max 档)$10 / $50、Claude Opus 5(max 档)$5 / $25。把 61 分上下的这一批放一起看,官方价和跑分价两本账都落在同一行:Muse 的 xhigh 档最便宜。

还有一组数字别和上面混:Meta 工程师内部对比说,1.3 比 1.2 少约 20% tool calls、少约 25% tokens,这是官方自测;AA 第三方验证的是 61/62 分、$0.55/task、100M/120M verbosity 这些。两组来源不同,谁也不能替谁背书。

便宜的那档要什么

同一个模型,两个价签。标准档 $1.25 / $4.25;另一档叫 muse-spark-1.3-contributor,$0.10 / $0.20 per 1M tokens,缓存 $0.002,价差约 20 倍。

便宜的条件写在同一张定价页上,Meta 原话:Heavily discounted token pricing in exchange for permission to use your prompts and completions to train future Meta models——大幅打折的价,换你允许它拿发进去的 prompt 和回给你的 completion 去训练 Meta 未来的模型。翻译成大白话:你付的 $0.10 / $0.20 里,已经含了数据使用权。

便宜的来路:拿对话换折扣

两行价签的区别就一句话。标准档写 Not used to improve our products,contributor 档写 Used to improve our products。而且这句定义,Meta 官方定价页和 OpenCode Go 的文档里用的是同一句英文——第三方转售这一层,条款一个字没变。

差价不来自算力成本。同一份算力标了两个价,这 20 倍差价,是拿数据使用权补的——Meta 现在把“数据换折扣”做成了公开价目表上的正式档位,contributor 就是产品名。你在 API 里选 muse-spark-1.3 还是 muse-spark-1.3-contributor,选型号的同时就选了数据条款。

往后比价,比的是哪家把“数据换折扣”写成了正式条款、写没写清楚。

两个 10 美元套餐怎么选

把范围收回到订阅:两个 $10/月的套餐都能用 Muse Spark 1.3——GOAT 标准档和 contributor 档都在,OpenCode Go 只有 contributor 档。

两个 $10/月:一个两档都收,一个只收 contributor

Command Code GOAT 是 $10 买 $70 credits,7 倍杠杆,标准档和 contributor 档都在模型表里。按典型用量,标准档约 2,140 请求/月,contributor 档约 90,900 请求/月。

Command Code 模型表里的两个 Muse 型号

图:Command Code 官网可用模型页(2026-09-03 查询),contributor 行标注 up to 95% off。

OpenCode Go 同样 $10/月,官方写 we aim to give you 6x that in usage,约 $60 额度;但它只有 Muse Spark 1.3 Contributor(limited regions),45,300 请求/5h,标准档不在 Go 里。两家的额度窗口不一样:GOAT 按月计,OpenCode Go 按 5 小时计。

OpenCode Go 的模型额度表里只有 Contributor(limited regions)

图:OpenCode Go 官方定价页(2026-09-03 查询)。

订哪个,等于当场选了数据要不要外流。

OpenCode Go 这条 $10 入口,等于替你把数据决策做完了:活不能外流,这条路直接出局,只剩 GOAT 用标准档烧 credits。

边界看你的活能不能见人。客户数据、未公开代码、内部文档、含隐私的对话,沾一样就别碰 contributor 档;能外流的批量活、公开代码生成、学习用的 prompt,contributor 档才划算。便宜 20 倍的前提,是这单本来就不怕被看。

还有一笔账单外的账。AA 记录里,xhigh 跑评测吐了 100M tokens(#67/196,中位 71M),评语是 somewhat verbose;max 档更到 120M(#139/636,中位 72M),评语是 very verbose。xhigh 的 100M 对中位 71M,每次大约多烧四成 token——按 AA 记录的评测用量折算,不是官方口径。

输出速度 181.7 t/s,但 TTFT 27.51s,第一个字要等 27 秒多。话多、等得久、吞吐快,这三件事会一起算进体感和账单——Muse 话多,用的时候得把它算进成本。

我们自己实测只作旁证:n=8 中文题、单通道经 Command Code,中位延迟 30.6s,1.2 是 14.1s,慢一倍多;输出里 82% 是隐式思考 token,不通过 reasoning_content 回传但照样计费,目录自报 reasoning: false,实测却有 16,256 reasoning_tokens。题少,这数不承重,只说明一件事:单价便宜不等于单任务便宜。

我们自己那 8 道题:打平、慢一倍多、八成输出是没说出口的思考

按我的用法:能外流的活,直接走 contributor 档,便宜约 20 倍,多等的那半分钟我认;客户代码、没公开的仓库,一分便宜都不占,回标准档。换不换,先问你这单过不过得了“能见人”那关。真要换,先用自己一份真活各跑一遍,对着实际 token 数和延迟再拍板。

挑便宜套餐,先看模型名后缀

9 月 2 日发布当晚,Meta 首席 AI 官 Alexandr Wang 转 AA 的榜,配了一句 i really hate to say it, but… gemini who? 🏎️💨,按原意翻过来是“我真的很不想说出口,可……Gemini 是谁?”。这句话距 AA 官方发榜只隔 8 分钟;同一句,7 月 21 日 Muse Spark 1.1 在 AA 榜上超过 Gemini 3.6 Flash 时他也发过一次。狂不狂,看前面的分数和价签就知道了。

Alexandr Wang 转 AA 榜的原帖

图:@alexandr_wang 原帖(2026-09-02 20:37 UTC)转引 @ArtificialAnlys 发布帖。头像已遮除。

落到动作就一句:打开定价页或 API 控制台,搜 contributor,有,就看数据条款那行写什么,再决定用哪档。价格以 2026-09-03 查询为准。

留个判断题给你:同一个 61 分,便宜约 20 倍但要交出对话,贵的那档不拿你数据。你手头这份活,值得为这份便宜交出去吗。

省下的钱够不够抵这些

来源

Meta 官方

第三方评测:Artificial Analysis

第三方平台定价

Alexandr Wang 原帖

DAVID YIN · 2026 · 09 · 03 · 杭州
← Older · #104
李飞飞造了个新AI叫世界模型:视频画得再像,也不懂物理
Newer →
— 这是最新一篇 —