阿里巴巴和腾讯近期相继发布了各自的“世界模型”(world model),用户只需输入一句话或一张图片,即可生成完整的3D虚拟空间。这一技术不仅支持多模态输入,还允许用户以导演或玩家的身份,自由切换视角、调整场景,甚至进入虚拟世界进行探索。
据阿里巴巴介绍,其推出的Happy Oyster模型突破了传统AI生成流程的限制。传统流程通常为“输入提示-等待渲染-生成结果”,而Happy Oyster在生成过程中可实时响应用户的指令。该模型提供导演模式和漫游者模式。导演模式允许用户通过文字、语音或图像控制镜头角度、角色动作及剧情走向;漫游者模式则让用户以第一人称视角沉浸式体验虚拟世界。
腾讯的混元世界模型2.0(HY World 2.0)同样支持多模态输入,并强调生成的3D场景具备可编辑性。腾讯表示,该模型生成的内容不仅是一个“仅供观看的视频”,而是可以与Unity、Unreal Engine等3D创作工具结合,进行二次编辑和修改。这大幅降低了3D建模的成本和时间门槛,为创作者提供了更多便利。
据业内人士分析,腾讯积极布局多模态模型,与其游戏业务的发展密切相关。与此同时,2025年8月Google DeepMind发布的Genie 3进一步推动了世界模型的关注度。这类模型的核心亮点包括一句话生成场景、第一人称视角探索以及场景记忆能力。
相比之下,OpenAI在2024年2月推出的Sora模型虽曾引发轰动,但因成本过高,已于近期宣布停止服务。Sora曾被认为在自动驾驶和机器人领域具有潜在应用价值,但OpenAI决定将资源集中于企业市场。
根据NVIDIA的定义,世界模型是一种“用于理解现实世界动态的神经网络”,其输入数据包括文本、图像和影音,生成的内容则可模拟真实的物理环境,为机器人和智能汽车的开发提供支持。