手机做 3D 建模动辄几小时?鸿蒙把 3DGS 端侧重建开放了

想把一个实物变成 3D 模型,传统路径是这样的:用专业软件手工建模,或者拿专用设备扫描,重建放到云端排队。快则几小时,慢则两三周。对一款消费级应用来说,这个门槛基本等于"做不了"。
为了解决这个问题,鸿蒙把 3DGS(3D 高斯)端侧重建与渲染能力开放了出来:用户拿手机对着物体拍一圈,后台自动重建,当场就能 360 度看。2026 年 9 月 18 日 HDD·HarmonyOS 创新论坛上海站上,华为终端图形图像团队与小卡健康技术负责人先后分享了这套能力的架构、接入流程与两个真实的踩坑经验。
本文基于该场分享的现场录音与课件照片整理,按"技术转向 → 空间建模 → 空间渲染 → 案例与踩坑 → 小卡健康落地"的顺序梳理,内容与数据均出自现场分享。
一、技术转向:从"程序渲染什么"到"用户定义什么"
现场先用三个效果把方向讲清楚:
- 物理真实的仿真:角色与墙壁碰撞时,角色形变而墙体保持刚性;
- 空间时钟:时钟文字被"放进"壁纸画面里的空间,与图像融为一体;
- 3D 空间壁纸:手指滑动,壁纸跟着转动。
背后的变化是:过去十几年里,程序的渲染是固定的——程序员预定好资源与渲染方式,系统按部就班地跑;现在用户参与进来了。现场把新的要素归纳为五个:理解、建模、生成、交互、渲染。鸿蒙方舟图形引擎基于 NPU 与 GPU 的端侧算力,把这五件事做成系统能力,再向生态开放。
开放架构自下而上是:系统能力层(软硬芯结合优化)→ SpatialReconKit(空间计算核心技术,提供理解、建模、渲染、生成)以及采集、音频、渲染相关能力 → 应用层(通用、购物、室内、室外场景)。
二、空间建模:拍一圈,剩下的交给后台
传统建模的高门槛现场说得很直白:要么程序员用专业软件手工建,要么用专门设备扫描,都需要专业设备或云端排队。
现在消费者只需要拿着手机对着物品拍一圈:
- 开发者接入后完成数据采集;
- 重建任务可以在后台进行——消费者可以切到前台发视频、回消息,进度由通知卡片提示;
- 重建完成后,在应用内以自由视角浏览;
- 满意就保存到图库(运镜视频也可以保存)。
除了物品重建,后续还会上线室内重建(会议室、咖啡厅)与室外重建(景点、街道,一段视频即可重建),全景相机的重建能力也在准备中。
端侧重建六个步骤
现场的接入流程压成了六步,注意最后一步别漏:
- 检查设备是否支持 3DGS 重建能力,不支持就直接处理兜底;
- 创建空间重建会话,指定模型类型与工作目录;
- 推送数据帧——支持两种输入:直接推 AR 帧(利用实时跟踪信息,重建效果更好),或手动组装相机内参、位姿、时间戳与图像数据;
- 启动重建(支持暂停与重启),可配置输出信息实现自动保存;
- 保存结果——支持 MP4(运镜视频)与 PLY(点云) 等格式;
- 释放资源——现场特别强调,不做这一步会引发资源泄漏。
三、空间渲染:能效、清晰度与亿级高斯球

渲染侧的底座是 3DGS 实时渲染引擎(基于 ArkGraphics 3D 能力),通过 Component3D API 开放。相比 Web 渲染,两个优势:能效更好(同功耗下帧率更高、更流畅)与清晰度更高(材质表现力更强),现场给出的口径是单帧能效提升 30%+。支持的格式是行业通用的 ply / glb / mp4,不需要额外转换。
真正难的是大场景。现场给了一组数量级,方便建立直觉:
| 场景 | 高斯球数量 |
|---|---|
| 一般物体 | 几十万 |
| 室内场景 | 约一百万 |
| 大场景 | 约一亿 |
手机端要做到亿级高斯球的实时渲染,靠的是三层工程手段:流式加载(磁盘与网络的下载与缓存调度)、空间分块、LOD 分级与高效可见性剔除。现场给的案例是 2 平方公里、20 家店铺、累计约 4 亿高斯球,在手机上实现空中、地面、室内的一体化渲染。
3D 资产还形成了闭环:重建的模型保存到图库后可以设为壁纸,配合转场动效与实时交互,形成了"拍摄—存储—消费"的完整链路。
四、两个案例与一个更值得记的踩坑
Remy App:基于端侧重建能力,向用户开放无限次的免费扫描,应用市场下载量 280 万+、评分 4.8,获得 AppGallery Awards 2025 年度手机应用。3D 店铺采集:在店铺里扫描采集,建模后上传,用户可以在 3D 场景里走动、从不同视角逛店。
而真正让人有收获的是小卡健康技术负责人分享的两个开发经验,因为它们说的都是"看起来成功了,其实没有"。
经验一:"拍过了"不等于重建"收到数据"
- 现象:用户快速绕拍时,界面上的覆盖球已经全部点亮,但最终帧数很多,模型仍有缺面和视角空洞。
- 根因:相机经过某个角度、帧提交成功、SDK 实际接收,是三个不同的事件。只按轨迹或帧数计算覆盖,会产生虚假反馈。
- 解法:产品侧引导用户缓慢环拍;技术侧保证空间点的有效点数量,同时提醒"采集数据越多,重建时间越长",具体取多少要看业务需要。
经验二:SDK 返回成功不等于模型可用
- 现象:加载 GS 模型时立刻做资产提取,提取出的主体不可见。
- 根因:模型加载之后没有等首帧渲染完成(画面还是灰白渐变)就去做物体分割,自然提不到主体。
- 解法:增加多层验收——用二维分割能力确认主体可见、连续两帧稳定、提取结果可用之后,才进入下一步。
这两条合起来就是一句话:跨模态的链路里,"接口返回"从来不等于"业务可用",中间必须自己加验收层。
五、小卡健康:把 3D 用在"坚持不下去"这件事上

小卡健康是一款体重与健康管理 AI 应用,2024 年底立项,目前全平台用户超 500 万。现场对行业的判断很准:健康管理的难点不是不会做,而是坚持不下去。
记录一碗米饭有多麻烦?得先知道重量、再查单位卡路里、再做一次计算,最后输入。就算算出来了,饮食、体重、运动数据分散在不同平台,也得不到统一判断。
他们的切入点来自一个观察:大家吃饭前都会先拍一张照。于是把拍照识别卡路里做成入口,再用鸿蒙的 3D 能力把它变成"有趣":
- 流程是拍照识别 → 确认主体位置 → 环绕实物轻拍 → 3D 建模 → 提取到收藏页;
- 其中只有前两步需要用户操作,后面全自动;
- 最终得到一枚属于用户的 3D 贴纸。
技术上分了三层:业务层(相机入口、食物识别、结果页与食物记录)→ 平台适配层(通过通道做能力查询、页面打开与结果回调,应用侧包含扫描、预览、编辑三个模块)→ 鸿蒙系统能力(端侧重建、二维分割定位主体、稳定帧与空间锚点、模型展示、3D 主体提取)。
执行的流程里有个工程优化值得抄:AR 体积与营养计算、3D 重建并行处理,缩短结果生成的等待时间。具体步骤是能力查询 → 释放相机 → 打开原生页 → 锁定锚点 → 确认拍摄主体 → AR 环拍(双路并行)→ 结果汇合。
环拍本身也做了空间感知:打开 AR 模式后检测桌面平面与深度信息建立真实尺度参考,用准星命中桌面或空间点来锁定食物中心并持续跟踪,再通过位姿引导实时反馈覆盖进度。锚点全程保持在实物中心,贯穿"主体确认"与"环拍采集"两个环节。
现场还给了两个延伸规划:基于空间能力做 3D 食物秤(用体积与重量自动估算热量,AI 拆解碳水、蛋白、脂肪),以及基于穿戴能力做随身健康顾问(小艺自动记录后同步到手表与手机)。
总结
这场分享的可用结论有四条:
- 3D 采集的用户成本已经降到"拍一圈",剩下的都是后台任务,这是消费级产品能不能用 3D 的分水岭;
- 接入只有六步,别漏释放资源;格式走通用的 ply / glb / mp4,不需要自己发明;
- 跨模态链路的"成功"必须自己验收——帧提交成功 ≠ SDK 收到,模型加载成功 ≠ 画面渲染完成,两处都要加校验层;
- 3D 要挂在"用户本来就有的动作"上——小卡健康选择的是"吃饭前拍照",而不是教育用户去学一个新流程。
如果你想判断自己的产品该不该上 3D,先回答一个问题:用户今天已经在拍什么? 答案往往就是入口。
关于我
13 年 IT 全栈,.NET、Python、Office 自动化(VSTO/VBA/Python)都做,也做 AI 应用实操(智能体开发),主业是帮企业和团队把重复劳动自动化——报表一键生成、数据对接、文档批量处理、工具定制。
本科物理化学、硕士计算机化学,在一线实验室待过 13 年(9 年制药 + 4 年第三方检测),现在主要服务药企、检测机构和实验室:SOP、合规、样本流、仪器数据接口这些词不用你解释。
这几年做得比较多的是这几类:Office 自动化(VSTO/VBA/Python)工具定制、数据对接与 LIMS 咨询、技术陪跑。
不是外包码农,是听得懂业务的自己人。有同类场景的朋友欢迎评论区聊聊,先聊清楚再动手不迟。
更多推荐




所有评论(0)