腾讯发布并开源了混元世界模型2.0,用一句话就能生成3D游戏原型。
今天,腾讯正式发布并开源了混元3D世界模型2.0,简称HY-World 2.0。据介绍,这是一个多模态世界模型,能理解文字、图片、视频等多种输入,自动生成、重建和模拟3D世界,还支持导出Mesh、3DGS、点云等多种格式的3D资产,可以跟现有的游戏工作流无缝对接,用来快速生成游戏地图和关卡原型。
跟谷歌的Genie 3以及混元世界模型1.5不一样,那两款只能生成视频文件,而世界模型2.0的实用性更进一步:它能直接生成可以二次编辑的3D资产文件。这些生成的3D资产可以直接导入到游戏制作或者具身仿真引擎里,做到真正可玩、可用。
目前,世界模型2.0已经上线到腾讯混元3D创作引擎官网,用户可以申请使用。混元世界模型2.0支持文字、图片、视频多种输入方式。输入一段文字或者一张图片,模型就能精准解析复杂的语义,一键生成风格多样的可漫游世界。跟混元世界模型1.0相比,2.0的模型架构全面升级,画面的精细度和真实感都大幅提升。用户还可以自定义风格,按需生成真实风、漫画风、游戏风的3D空间。生成完成后,用户可以把资产导入到Unity、UE等引擎里进行二次编辑,大大降低了游戏地图的创作门槛。
模型还支持角色模式,用户可以操控角色在街道、建筑、场景里自由探索,没有时间限制,还有物理碰撞,就像在真实游戏里一样。同时,世界模型2.0还支持复刻真实3D场景。用户输入一段真实空间的视频或者多视角图片,模型就能构建出高精度的数字孪生空间。基于升级后的WorldMirror 2.0架构,模型支持任意尺寸的图像和视频输入,可以一次性预测密集点云、多视角深度图、表面法线以及相机参数,一次生成就能永久复用。未来像室内装修预览、城市规划、文化遗产保护这些场景,都可以靠这个能力快速构建和还原。
混元世界模型2.0以3D为主线,通过统一空间的理解、生成和重建架构,实现了SOTA级别的生成效果。跟其他世界模型相比,混元世界模型2.0在场景完整度(比如物体的侧面和背面)以及跟输入图片的匹配程度上表现更好。混元生成的3DGS与Mesh混合表征,也让用户可以开启角色模式,进行有真实物体碰撞的交互。





