- 地址:
- 北京市昌平区城北街道鼓楼西街1号
- 邮箱:
- zkhqyjy@163.com
- 电话:
- 010-56288028
- 传真:
- 010-56288055
这个假期,当大家在朋友圈晒国旗、晒旅行、晒美食的时候,华为选择在国庆节这一天扔出了重磅产品——
发布会上有太多值得聊的东西,但有一个细节——一款叫「摸小宠」的鸿蒙独占应用,惊艳地亮了个相。
不是那种只能转圈圈的3D模型猫,而是一只有空间结构、会动、能从任意角度看、你走近它它还在摇尾巴的4D数字猫。
而做到这件事的魔芯科技,也成为全球范围内率先将4D世界模型推进到产业应用落地的公司。背后的技术叫MoWorld。

过去我们说AI能生成图片,比如你给Midjourney一句话,它给你一张图。
后来AI能生成视频了,Sora们开始造出能动的画面。但本质上,那还是一段录像带,它的视角是选定的,不会变,你不能走过去看看那栋建筑背后长什么样。
而MoWorld做的事情,是把一张照片变成一个「可以走进去」的世界。或者用更技术的线D世界模型,它从一开始「原生」生成的就是一个4D空间。
你给它几张普通手机拍的照片,甚至几段随手拍的视频。MoWorld不会简单地「复制」画面,而是去理解这些画面背后的空间结构——那堵墙在哪儿?那张桌子离镜头多远?桌子后面被挡住的部分长什么样?
然后,它会基于这种空间理解,把平面的图像扩展成一个三维空间。你可以在这个空间里前进、后退、转弯,看到照片里没有直接展示过的角度和区域。
你上传几张猫的照片,MoWorld先理解猫的三维形体结构,真正从有限的视角信息里推算出猫的空间结构、毛发纹理、体型比例。
猫在摇尾巴?好,当你切换到侧面视角的时候,尾巴的摇晃动作依然是连续的、符合空间逻辑的。你绕到猫的背后,猫不会突然僵住。它该怎么动还怎么动,只是你观察的角度变了。
模型不仅知道物体在哪里、长什么形状、从不同角度看应该是什么样子,还知道物体正在怎么运动、动作在不同视角下怎么连续呈现、场景随时间发生了什么变化。
如果用一个更直观的比喻:以前的AI生成内容是「给你看一部电影」,而MoWorld生成的,是一个「你可以走进去逛逛的片场」。
就像《黑客帝国》里Neo躲子弹那个经典镜头:模型根据少量图像恢复场景和物体的空间关系,从不同角度生成连续、稳定的环绕视图。

魔芯科技最值得关注的一点,恰恰是它在应用落地上的领先——摸小宠只是其中一个消费级入口,MoWorld已经在多条产业线上同步推进,多个合作项目进入技术验证和具体实施阶段。
影视和游戏。传统的影视制作流程中,一个场景需要经历建模、贴图、灯光、动画等多个漫长环节。
MoWorld可以把前期场景搭建周期大幅压缩,快速生成场景资产,支持自由运镜、天气切换、物体编辑。
在游戏产业,500FPS以上的资产渲染能力和移动终端的高帧率运行,有望降低互动世界对高端显卡的依赖。

具身智能训练。以前训练一个机器人抓取、避障、搬运,需要在真实环境里反复试错。设备损耗、场地成本、还有碰撞伤人的安全隐患。
MoWorld搭建的数字仿真训练场,可以让机器人在虚拟空间里完成所有动作演练,碰撞和失误只产生虚拟损耗,支持高频次复盘迭代。
自动驾驶。MoWorld可以在3D空间中调整道路环境、交通参与者和物体运动状态,特别适合生成那些现实中成本高、风险大、难以重复采集的长尾场景。例如雨雪天气、坑洼路面、突发事件。3D/4D资产可以方便地调整、复用和重新渲染,提高训练数据的生产效率。

工业数字孪生。工厂产线、矿山等场景中,MoWorld可以将真实环境快速转化为空间资产,用于设备布局调整、改造方案预演、远程培训和异常场景模拟。

城乡规划与文旅。虚拟游览、沉浸式内容生产、方案展示、空间重建,这些以前需要大量人工搭建的工作,MoWorld可以用算法来加速。

MoWorld的价值不是单纯地「画面更好」或「帧率更高」,而在于它能以低成本方式生成高质量、可复用的3D/4D空间资产,让这些资产真正流入产业系统被反复使用。

听到这儿你可能会问:这种级别的AI运算,不得在数据中心里烧几百张GPU才能跑?手机?开什么玩笑?
确实不全是手机在算,摸小宠背后是一条端云协同的链路:照片上传到云端,昇腾NPU上的扩散模型先生成高质量3D高斯模型——这一步算力需求大,交给服务器。
然后魔芯科技做了一个「瘦身版」MoWorld-2.0-Flash,约6亿参数,经过量化裁剪和算子适配,直接跑在Mate 90的麒麟芯片上。最终渲染呈现也在手机端完成。
一部分计算搬到手机上,云端负载就下来了,运营成本随之降低。对一个面向普通消费者的应用来说,这一点决定了它能不能大规模铺开。
这条路线让MoWorld的推理成本只有同等进口GPU方案的30%。降本70%,这才是世界模型能规模化落地的真前提。

如果它只是能生成逼线D场景,那不过是个高级建模工具。真正让它配得上「世界模型」四个字的,是它开始理解物理规律。
今年7月MoWorld 1.0发布时,主打一个「快」——全国产NPU,最高约50 FPS实时交互。那时候它已经证明自己不是论文demo,而是真能跑起来的系统。
物理属性进来了。重力、弹力、刚性、外力,这些真实世界的规则被显式融入模型。
踢一脚足球,球沿地面滚动弹起;碰一下花草,花草会摆动;同一场景可以切换晴天雨天雪天。
渲染帧率提高了。3D/4D高斯资产渲染突破500 FPS,手机端侧也能跑到100 FPS。不需要高端显卡,普通手机就能流畅呈现三维交互世界。
输出的东西能用了。MoWorld生成的不再只是「好看的3D视频」,而是标准化的3D/4D高斯资产,可以直接导入游戏引擎、影视制作系统、数字孪生平台、机器人训练环境。生成一次,到处调用。
场景还能改。增删物体、调整位置、切换天气,同一条街可以一键从晴天变暴雪,同一个影视场景换道具换镜头,不用从开云头重建。
把这些能力叠在一起看,MoWorld更接近于在模拟一个遵循物理规律的平行世界。
而摸小宠恰恰是这个看着最「轻」的场景,证明了一件最「重」的事——4D世界模型可以跑在每个人的手机上。
过去,世界模型一直漂在实验室和论文里,从Sora到Atlas,大家讨论的都是能力多强、效果多好,但很少有人认真回答一个问题:普通人什么时候能用上?

2026年9月,李飞飞创立的World Labs发布了Atlas——一个多模态世界模型,核心能力是使用少量照片生成可交互的3D世界。

这个产品在业内引发了巨大关注,某种程度上甚至标志着世界模型赛道正式进入国际主流视野。
Atlas和MoWorld有不少共同点:都可以用少量普通照片作为输入,都能输出三维场景结构,都支持自由浏览和新视角合成,都利用大模型来补全有限观测之外的空间信息。
动态4D理解。Atlas目前主要聚焦于静态3D空间的生成与理解。MoWorld则已经做到了动态4D——不仅理解空间,还理解时间。
物理交互能力。MoWorld已经将重力、弹力、刚性等物理属性引入生成空间,物体能够对用户动作做出基于物理逻辑的响应。而Atlas目前更侧重于空间结构和多模态理解。
推理效率与成本。MoWorld在推理速度和成本控制上具有优势。基于国产昇腾NPU的部署路线让它的推理成本只有进口GPU方案的30%,并且已经探索出了手机端侧运行的能力。
可以说,如果Atlas代表了世界模型在「空间理解深度」上的国际标杆,那么MoWorld的核心优势不仅在模型能力上不遑多让,更在应用落地上全面领先——
从4D动态理解到物理交互,从云端到端侧,从实验室到真实产品和产业流程,它已经跑出了一条完整的路。

魔芯科技的创始人陈天润是一个00后。浙江大学博士在读,师从中国工程院院士潘云鹤。
陈天润在Science、Nature Photonics、IEEE TPAMI等顶级期刊,以及ICCV、CVPR、ICML、SIGGRAPH等顶级会议上发表高水平论文50余篇。2022年获得共青团中央科技创新最高奖项「中国青少年科技创新奖」,是浙江省高校唯一获奖者。
他在央视的采访中说过一段话:「世界模型更像是给机器提供一个理解世界的大脑,让机器去理解它所在的环境,就像人一样,给机器提供了预测下一个世界状态的能力。这是一种冒险,但是冒险背后是我们真切地拿着这把舵在开这艘船,所以我相信既然这个舵掌握在我们手上,希望能够把这艘船开得很远。」

这不是一句空线轮融资,最新一轮融资规模达10亿元量级,公司估值已经逼近100亿元。投资界的评价是,这是世界模型赛道上跑得最快的中国选手之一。
从全国产算力训练到鸿蒙应用端的完整链路,魔芯科技已经成为4D世界模型领域的基础设施构建者。
下一篇:没有了


