近期,知名AI企业Runway正式发布了全新“界面世界模型”(Interface World Models)系列的首个重磅模型——Solaris。这一创新系统的诞生,意味着软件和网页不再依赖于预先写好的代码与固定框架,而是能够在你使用的过程中直接实时、逐帧地渲染出整个图形交互界面。
在传统的软件工程中,数字界面通常建立在两套割裂的系统之上:“知晓事物”的 AI 助手(如大模型和搜索引擎,擅长提供文本与图片等静态内容)和“实时响应”的传统程序(如游戏引擎和前端代码,擅长渲染动态效果,却对你的任务一无所知)。长久以来,每一个操作系统与应用之间的交互,都必须事先通过代码等中间表示进行明确定义,这无形中牺牲了视觉表现的丰富性,并将可能的操作空间严重“有损压缩”。
而 Solaris 的核心突破,在于将渲染和交互合二为一。它不再需要中间代码层的转译,而是作为一个单一的世界模型直接生成每一帧画面,并对用户的每一次输入做出即时、连贯的动态响应。用户在浏览虚拟服装店时,甚至可以直接以自己的照片为参考,像在现实中一样自然地拖拽衣架上的衣服试穿;或者通过一句简单的语音指令,让场景中的桌椅位置和物体颜色随光影实时演变。这种开放式、沉浸式的体验,让软件更像是一个鲜活的场景,而非冰冷脚本的堆叠。
在客观的学术与用户评测中,Solaris 展现出了独特的优势。在对比多模态大语言模型仅凭截图重建界面的基准测试中,研究发现传统转译方式会随着视觉复杂度的提升而不可避免地丢失细节,而 Solaris 则从第一帧起便完美保留了界面的视觉与语义状态。在包含7500多次成对比较的用户研究中,参与者在遵循指令的准确度以及行为的自然度两项指标上,对 Solaris 的偏好度分别达到了61%和71%,远超传统编码界面孤立更新UI的表现。