文章 / #093

AI 不再上云:Meta 开源 Muse Glimmer,按用量付费的生意要变

每天跟 AI 说一句话,就扣一次钱。翻译、写邮件、查资料,用一次算一次。我们都习惯了,就像没人质疑水费电费按表走。可昨天,Meta 开源了一个叫 Muse Glimmer 的模型,300 亿个参数,装进一张显卡就能跑,还说以后 AI 助手要常住你的电脑,不再依赖云端。早该这样了。

可就在同一天,Meta 放了三件事:模型开源、旗舰模型 Muse Spark 的开源版本预告、扎克伯格亲自写的《超级智能应人人可用》。技术动作、开源承诺、价值观宣言,一天打包。把这三件摆在一起读,才算看懂 Meta 想干什么。

你为 AI 花的每一分钱,默认都上交给云端

按字扣钱,行业里有个正式说法叫 token 计费。token 就是模型眼里的「字」。今天主流 AI 产品几乎都这么收钱:你问一句,它扣一笔,月月如此。这个模式成了默认,没人问过你同不同意。

这步棋的重点,藏在付费方式里。 Meta 超级智能实验室在发布文章里自己点破了现状:大多数部署仍依赖云端和网络。依赖云端,就意味着每次提问都要先把数据送出去,等结果传回来,再按用量付钱。

本地跑,消解的是延迟、隐私、按字扣钱这三件事。模型装进你的电脑,天天在线,随叫随到,扣钱就停了,等于把持续交钱这根线,从根上剪了。

云厂商和 API 商靠用量持续收钱的那条收入线,也被从根上撬了一下。

一张显卡才多大点地方,它凭什么装得下这些?

55GB 是怎么塞进一张显卡的

官方称,这个模型按原始规格跑,整个就要占 55 个 G 以上的内存,超过市面上任何一张消费级显卡,得上专业设备。Meta 给的办法是量化,也就是给模型瘦身:砍掉占地方的精度,语言模型压到 20 个 G 以内,剩下的空间再装看图的、记上下文的配件,整体落进一张中高端游戏显卡。

官方说,瘦身对这类干活型的任务几乎没什么损失。这话先听一半:是官方自己说的,第三方还没复测过。

他们还配了个提速的副手,官方叫投机解码。官方给出的口径是:同样等一句话出来,旗舰显卡上快了三倍,本来要等三秒的,一秒出头;苹果芯片上也快了五成到八成。不用买工作站,手头这台就能跑。

模型是装进去了,可它住下来以后,想要的东西比显卡金贵得多。

常驻的智能体,要接管你的日程、消息和文件

官方给这个模型的定位,是常驻本地的智能体,替你干活的 AI 助手。它管日程、理文件,官方的说法是,这样的助手需要深入接触你的个人上下文。日程、消息、文件,基本就是一个人数字生活的全部。

它干活的水平,官方列了一串:能自己完成一整套任务,工具报错能自己诊断、重试,不会停在那不动;能读截图、翻文档;一次读得下约十几万字,相当于一本长篇小说的量,全装在一个能随身跑的模型里。主流的本地运行工具,Ollama、LM Studio 这些,都已经适配好了,Mac 也能跑。

把这些都交给它,你敢把它放在别人家的服务器上吗?

这次 Meta 把自家开源规则改了

许可一放开,你就有第三个选项:不放云端、不租别人的服务器,放自己电脑里。

Llama 系列这些年用的,是一套带门槛的「Llama 社区许可」,业内管它叫开放权重,严格说够不上开源社区公认的开源许可。门槛就摆在明处。你用 Llama 训练出新模型,名字必须以 Llama 开头,产品页面要显著挂着「Built with Llama」。产品月活超过 7 亿,得向 Meta 申请,批不批全看 Meta 的脸色。

Muse Glimmer 这次直接换成 Apache 2.0,一套老牌的正经开源许可:商用、修改、再分发,都没有额外条件,任何体量的公司都能直接用。

同一个集团,一边给 Llama 上着锁,一边给 Muse Glimmer 开了门。更巧的是,这个开源小模型是闭源的旗舰 Muse Spark 蒸出来的。蒸馏,就是大模型当老师,把本事传给小模型。闭源养开源,Meta 这次把这条路线明着走了一遍。

同一天,扎克伯格发了篇长文,其中写道(译文):「如今 Meta 超级智能实验室已经就绪运转,我们将很快恢复发布一些开源模型。」这是编排好的战略宣示。编排是我的解读,能确认的事实是,这三件事真的在同一天落地。

开源圈吵了很久的「真开源还是假开源」,这次 Meta 自己先让了一步。

对标名单里,这次有 Qwen

让了一步的不只是许可,连对标名单都变了。

Meta 官方给这个模型选了两个对标对象,都是同尺寸的:谷歌的 Gemma、国产的 Qwen。这份名单里,也出现了国产模型的身影。

对中国开发者,最实在的变化有两条:许可彻底放开,一张中高端显卡就能跑。本地运行工具也已经接好,装上就能用,不用看谁的脸色。

不过这份名单是 Meta 自己选的,不等于第三方实测排名。官方点名,可能是抬举,也可能是真把你当对手。信几分,你自己掂量。

别高兴太早

先把冷水泼够。第一,所有性能说法目前都是官方口径,「瘦身几乎无损失」「能力清单」都是官方称的,第三方还没复测。第二,本地跑的现实速度:按苹果 M5 Pro 的实测换算,一分钟约一千字上下,够日常对话和轻任务,撑不起狂飙式的长文生成,复杂推理和云端旗舰的差距客观存在。

第三,这次放开的只是权重和代码,训练数据、蒸馏细节、旗舰 Muse Spark 的权重都没公开。开源权重,不等于可复现。第四,Muse Spark 的开源版本目前只是预告,说是几周内发布,还没落地。

端侧是方向,但别拿它当「AI 全包」——先在特定场景里用起来,再谈慢慢变主流,判断就落在这。

本文事实来源

DAVID YIN · 2026 · 08 · 11 · 杭州
← Older · #089
AI 浏览器来了:Cloudflare 造的,没给人留界面