当视频模型开始生成界面:Runway Solaris 观察 runway solaris interface world model Runway WorldModel Interface GenerativeAI ProductEngineering AI工程
2267 字
11 分钟

当视频模型开始生成界面:Runway Solaris 观察

先说结论#

8 月 31 日,Runway 发布了 Solaris 研究预览,并把它称为 Interface World Model

官方描述很大胆:这不是一个普通的视频生成器,而是一种新型“操作系统”,窗口、菜单、滑杆等界面由视频模型实时生成,方向包括场景化视频、游戏界面、创意工具和产品原型。

我对这件事的判断是:如果 Solaris 的可操作性能够成立,它改变的不是“视频能生成得更漂亮”,而是界面本身可能不再是预先写好的组件集合。

但现在还不能把它写成成熟产品。当前公开信号主要来自 Runway 官方账号和一个 X List 旁证,公测资格、API、状态持久化和独立测试都没有明确资料。下面是方向分析,不是能力评测。

过去的界面是什么样的#

我们熟悉的软件界面有一个稳定假设:

固定组件
+ 固定状态
+ 固定事件处理
+ 固定数据模型
= 可操作应用

一个按钮是一个 DOM 节点,一个滑杆有明确的数值,一个菜单项对应一条路由。即使界面由游戏引擎或 Canvas 绘制,背后通常仍然有一套确定的 UI 状态机。

传统的生成式 AI 主要生成的是内容:

提示词 → 图片 / 视频 / 音频

它可以生成一个看起来像软件的画面,但这个画面通常只是结果,不是一个可以持续操作、保存状态、撤销和再次打开的应用。

Solaris 想挑战的是中间那条边界:

意图
→ 模型生成当前界面
→ 用户动作
→ 模型理解动作后的世界状态
→ 生成下一帧界面

如果这条循环稳定,界面就不再只是“渲染数据”,而变成了模型对世界状态的一种实时投影。

它和 GUI Agent 不是一回事#

最近也有很多 GUI Agent:模型看屏幕,点击按钮,输入文字,拖动鼠标。这些系统通常是在已有界面上行动。

可以这样对比:

GUI AgentInterface World Model
界面从哪里来人或程序预先构建模型实时生成或重构
模型的主要动作点击、输入、滚动生成状态,同时响应动作
状态来源DOM、Accessibility Tree、截图、应用 API视觉/世界状态与动作反馈
主要难点找到正确控件并执行保持界面、状态和动作的一致性
失败形态点错、找不到、权限不足界面好看但状态不真实或不可持续

所以不能因为两者都“会用界面”,就把 Solaris 当成另一个 computer-use 模型。它更接近:模型不仅使用工作台,还参与生成工作台。

真正困难的不是画出一扇窗#

从演示画面看,窗口、菜单和滑杆并不难想象。真正难的是这些东西必须具备软件的性质。

1. 状态要持久#

用户拖动滑杆之后,数值应该进入某个可恢复的状态,而不是下一帧又随机回去。

动作 A
→ 状态 S1
→ 关闭界面
→ 重新打开
→ 仍然得到 S1

如果状态只存在模型的短期上下文里,它就更像一次互动幻觉,而不是应用。

2. 动作要可重复#

同样的点击在同样的状态下,应该产生相同或可解释的结果。视频模型天然带有生成随机性,而软件交互依赖确定性。

这会要求系统把“视觉帧”和“真实状态”分开:

可生成的显示层
可验证的状态层
可执行的动作层

如果没有状态层,用户看到的按钮和系统真正接受的动作可能不是一回事。

3. 界面要能被机器理解#

固定 UI 有 DOM、Accessibility Tree、语义标签和键盘焦点。模型生成的界面如果只有像素,接入自动化、辅助功能和测试都会变得困难。

一个真正可用的 Interface World Model,至少需要回答:

  • 当前有哪些控件
  • 每个控件的语义是什么
  • 哪些控件可以操作
  • 操作会改变哪些状态
  • 屏幕阅读器和键盘如何访问它们

“看起来像按钮”不等于“它是一个按钮”。

4. 延迟必须足够低#

普通视频生成可以等几秒甚至几分钟。界面交互不能每次点击都等一段完整视频生成。

用户会期待:

按下按钮
→ 立即看到反馈
→ 状态逐步稳定

因此 Solaris 更像实时世界模型,而不是离线视频模型。它要解决的不是单次画质,而是连续生成、状态更新和输入响应之间的延迟。

5. 失败要能撤销#

固定应用里的错误操作通常可以 undo、回退或重新加载。生成式界面如果把每次状态变化都当成新一帧,就必须有明确的历史:

S0 → S1 → S2 → S3
undo / fork

否则用户很难知道一次错误是模型生成错了,还是自己的操作真的改变了数据。

我会怎样评估它#

如果 Solaris 之后开放试用,我不会先截几张好看的图,而会做一套重复性测试。

测试项需要观察的结果
同一 prompt 重复生成结构和交互是否稳定
连续拖动滑杆状态是否连续、是否丢输入
关闭后重新打开状态是否持久化
快速连续点击是否丢事件或进入错误状态
断网后恢复能否继续或明确失败
键盘操作是否有焦点和可访问语义
自动化操作是否能通过 API/语义层定位控件
撤销与分支是否能回到之前的状态
长时间运行延迟和状态漂移是否累积

我尤其关注“同一个任务跑十次”的成功率。生成界面最容易在单次演示里看起来惊艳,真正决定它是不是产品的是第十次还能不能找到同一个按钮。

它可能先在哪些地方成立#

游戏#

游戏本来就接受动态世界和非固定界面。模型生成一个场景化的控制层,可能比在办公软件里生成表单更自然。但游戏仍然需要物理规则、存档、碰撞和多人同步,视觉生成不能替代底层状态机。

创意工具#

创作工具的界面本来就经常围绕当前任务变化。用户在做分镜、调色或构图时,需要的控件不一样,动态生成一个任务专用工作台有实际价值。

产品原型#

这是最容易落地的方向:不是直接替代生产软件,而是让用户用自然语言快速得到一个可交互的原型。这里对确定性的要求相对低,但仍然需要能保存和分享。

场景化学习#

教学界面、模拟实验和可视化解释也可能受益。模型不只是给一段答案,而是根据用户的理解程度生成一套可以探索的界面。

也要警惕一个误区#

“界面由模型生成”不代表界面一定更好。

固定组件的价值就在于稳定、可预测、可测试。动态生成会带来新的成本:

  • 用户每次打开都看到不同布局
  • 团队无法复用操作教程
  • 自动化脚本容易失效
  • 产品问题难以复现
  • 视觉一致性和品牌规范变复杂
  • 安全敏感的操作可能被模型藏在不明显的位置

所以我不期待所有软件都变成生成界面。更现实的形态可能是:稳定的底层状态和权限 + 针对当前任务生成的工作台视图。

最后#

Runway Solaris 目前还是研究预览,很多关键问题没有答案。它值得关注,不是因为一条视频里出现了会动的菜单,而是因为它把一个问题摆到了台面上:

界面究竟是程序的固定外壳,还是模型理解世界后生成的一种临时视图?

我暂时不会把它叫作“下一个操作系统”。但如果它能把生成画面、真实状态、语义操作和持久化历史接在一起,那它可能会成为一种新的软件入口。

现在先等它从演示里出来,给别人真正点几下。

参考资料#

当视频模型开始生成界面:Runway Solaris 观察
https://bangwu.me/posts/runway-solaris-interface-world-model/
作者
棒无
发布于
2026-09-01
许可协议
CC BY-NC-SA 4.0