文章 / #103

AI 画的不再是图,是能点的界面:Runway 刚把「界面」变成模型产物

先说你手机里最日常的东西:打开微信,对话框、发送键、底下那排导航按钮——这些你天天点、闭着眼都能摸到的页面和按钮,就叫「界面」。我干这行十几年,有个默认前提从没人质疑过:界面是写出来的、编译出来的,定版之后就冻在那儿,等下一个版本再解冻。8 月 31 日 Runway 发布的 Solaris,让这个前提不成立了。它演示里的界面,是模型现场画出来的——你点一下,它跟着变一下。第一眼看到那个虚拟服装店,我分不清它算视频还是算软件。

我判断,把它归进又一个视频生成模型,会错过最值得讨论的东西。Solaris 是 Runway 声称的第一个「界面世界模型」,应用和网站的界面由模型实时逐帧生成,官方原话叫「整帧即界面」,中间没有代码这一层。界面这种产物的存在方式变了。 以前是编译产物,写一次、冻结、等更新;现在变成生成产物,随你的每一步操作现场演化。这篇把三件事讲清楚:它到底是个什么东西、为什么现在才做得出来、以及它自己承认的边界在哪。

界面世界模型:整帧即界面

先说传统软件的路子。任何界面,都得先有人把视觉设计翻译成代码——这个中间表示。官方对这一步的批评很直接:软件「以有损压缩的形式发布,冻结在任何用户到来之前」。翻译本身丢视觉保真,翻译完又只能按事先定义好的行为走,交互空间被压扁了。你碰到的每个界面,都是被代码这层中间表示限死过的界面。

Solaris 的路子是跳过代码。模型直接理解你点在哪、想干什么,然后逐帧把界面画出来。这三个能力,我一个一个拆开看。

最好理解的是纯视觉这条。虚拟服装店里,你把一件衬衫拖到自己身上,试穿效果当场出来。没有商品模型,没有购物车逻辑,衬衫和「穿」这个动作都是画面的一部分。

界面是活的,不等你。你说「把桌子移开看看」,桌子就移开;「沙发换个颜色」,光照变了,反光跟着变。传统界面是你输入一步它响应一步,Solaris 的界面自己在那儿演化,你的操作只是插进去的一步。

最反直觉的是开放式这条。官方举的例子:同一张手部 X 光片,同一个拖拽手势,可以有两种完全不同的合理响应。按官方演示,开发者没预设过的行为,它也能给出说得通的响应。

这三条凑在一起,串题的风险也来了,很多人会把它当视频生成。它生成的是交互层,跟视频内容两码事。视频是放给你看的,它是给你点的。画面只是载体,交互才是本体。

为什么现在才做得出来

方向不难想,难在三个工程坎。

速度。交互感有个临界点,大约半秒的延迟,一超过这个数,人就会觉得卡。视频扩散模型生成一段画面要几秒到几分钟,离交互差着十倍上下、甚至更多。

连贯。文本、布局、物体身份,要在整个会话里保持一致,这是生成视频的老毛病,搬到界面上就成了硬伤:上一帧看到的商品,下一帧不能变成别的。

成本。逐帧生成比一次构建的页面贵,这是常识。官方称实时化改造把运行成本压到比标准视频扩散模型低几个数量级。这是官方定性,没给具体数字,先当它这么一说。

技术路线上,Solaris 是拿自家 Gen-4.5 改造的,走的是通用世界模型 GWM-1 那条路:自回归逐帧生成,把多步去噪蒸馏到少数步,再用模型自己的输出回炉训练保质量。这里面有个拆分得单独拎出来说:LLM 负责推理,决定界面怎么演化;世界模型负责渲染,把每一帧画出来。推理和渲染分离,两个模型各干各的。

对智能体的意义,比界面本身更硬

官方给这个模型的动机,听着像绕回老问题:最强的大模型也搞不定订酒店、买杂货这种基础电脑操作。问题出在文本模型被训练在「编码界面」上,学的是训练过的那个具体布局,换个差不多的酒店网站就懵了。

这不是官方一家之言。6 月底挂在 arXiv 的 OSWorld 2.0 基准,把 108 个长程真实电脑任务甩给人和模型。人类完成一个任务的中位耗时约 1.6 小时;工具调用最多的那组 agent(Claude Opus 4.7 开满思考档,平均 318 次)。

模型这边差得远。最强的 Claude Opus 4.8 开满思考档,500 步内只完成 20.6%,按部分分算 54.8%;GPT-5.5 平台期约 13%。

翻译成人话:人类一个多小时能干完的活,最强 agent 五百步只完成约五分之一。卡在它见过的界面太少,它学的是某一个酒店网站的布局,学不到酒店网站这种界面一般长什么样。

Solaris 的立场正好反过来:在「不断变化、可能从未存在过的布局」上训练 agent。让 agent 学的是界面背后的世界规律,某个具体布局只是顺手见过的样本。顺着这个思路推一步:能实时预测界面状态,就等于在给操作系统这个世界建模。这一步是我的推演,官方没这么说。官方给的定义是,界面世界模型既要理解意图,又要持续渲染交互世界,这两件事第一次合体。

官方自己列的做不到清单

把话说满很容易,官方这次倒是列了一份做不到清单,值得存下来。

实时稳定的文本还是开放难题。官方说现实路径是混合系统:在停顿的地方,用图像模型渲染文字多的视图。满屏文字的场景,眼下还得交给非实时的生成模型。信任锚定没解决:演示和商业场景里,一个说服力很强的错误答案比没有答案更糟。长会话连贯性还在研究中。屏幕阅读器这类无障碍 API 也没集成。

还有一个容易被忽略的事实:产品还没公开上线,只有 early access 申请表单,官方说在跟关键合作伙伴推进公开发布。现在看到的演示全是官方口径,没有第三方复测。连那个听起来很漂亮的偏好数据,也是 Runway 自家测出来的:250 人参与的用户研究里,Solaris 在 61% 的两两对比中被认为更听话、71% 被认为更自然,对照是 Claude Opus 5 写代码做出来的界面。数据是自家测的,只能算官方说法。

界面没死,是界面从编译产物走向生成产物这条路刚开工。落到大众这边:以后你点开的每个 App 界面,都可能是模型现场画的;商店也不再给每个访客发同一套固定布局,改成保留品牌、按你实时重排的生成环境;官方展望里更远的一步,App 不再是交互单元,你要什么,界面自己长出来。

对前端和 UI 工程师来说,岗位还在,工作对象换了:从写界面代码,变成写界面背后的 prompt、约束、品牌锚点,还有怎么评测一个模型画出来的界面。

这事跟之前写过的那篇 Cloudflare 无界面浏览器,是同一枚硬币的两面。那边把执行层的界面拿掉,让 agent 直接跑;这边把表现层的界面变成生成产物,给人操作。一条线无人化,一条线生成化。我写这篇的时候也拿不准它三年后会长成什么样。能确定的是,界面不再是写完就定版的东西,这个变化已经发生在演示里,剩下的只是时间问题。

来源引用

DAVID YIN · 2026 · 09 · 01 · 杭州
← Older · #102
Mac Studio 新款发布:苹果想让你的 AI 从「交房租」变「买房」