文丨YARRN
在生成式AI快速演进的大背景下,3D内容生成正逐步从传统的几何重建迈向原生生成与空间智能的新阶段。作为3D生成领域的头部企业,影眸Hyper3D凭其自研的Hyper3D Rodin大模型与Hyper3D等核心产品,在行业内树立了独树一帜的技术标杆。日前,我们在ChinaJoy现场影眸Hyper3D展台与其联合创始人曾初啸进行了一场深入对话,共同探讨原生3D生成的技术选型、开源与闭源壁垒、生产级资产交付标准以及空间智能的未来边界。
事实上,从亮相英伟达黄仁勋CES 2026主题演讲中的工作流演示,到被OpenAI首届黑客松冠军项目选为核心方案,Hyper3D已多次站在全球技术标杆的舞台中心。目前,其产品生态已汇聚全球近千万创作者,并深度服务于Lowe’s、字节跳动、网易等行业巨头,在游戏、电商、具身智能及空间计算等关键赛道建立起领先的商业化壁垒,企业级客户体量已超越业内同类公司总和。

为何坚持“原生3D”而非2D升维重建?
2024年以前,行业主流技术方案选择通过2D升维或多视角预测来训练3D生成模型,但影眸Hyper3D却选择了直接研发原生3D的技术路线。影眸科技联合创始人指出,这一选择的最根本原因在于信息的维度与误差积累。2D图片所蕴含的信息本质上永远是二维的,通过单图或多图去猜其他视角,本质上都是一种推测。如果在前级使用多视角预测生成图像,再拿着这些预测出的多视角图片去做3D重建,前后级之间的误差会产生叠加。
更关键的是,原生3D模型必须具备3D特有的底层结构特征,这是单纯从2D图像重建无法根本解决的。例如平面、边角等几何结构,以点云或原生3D视角来呈现时,其本质就是一个确定的3D平面,表达比2D照片更直接、更精准。原生3D是从真正理解空间几何的角度去思考和构建模型,而不是靠图像去“拼凑”视角。
选择这条没有先例的原生3D路线,影眸Hyper3D也付出了更多的心血。受访联创坦言,当时最大的挑战就是“难”。市场上的主流思路多是基于已有的2D底层快速搭建,可借鉴的开源项目和学术论文很多;但原生3D路线几乎没有任何可以参考的成熟范例,团队完全是在摸着石头过河,纯靠自己探索。但影眸Hyper3D最终验证了这条路线的壁垒与价值,并让业内主流技术路线随之转向。

开源与闭源的护城河
目前市场上也相继出现了一些开源的3D生成模型。谈及开源与商业闭源模型之间目前的区别,受访联创表示,当前行业内的开源3D模型在生成质量上差距还比较明显。主要原因在于两方面:第一,和大部分商业闭源模型相比,开源项目缺乏高质量、大规模的3D数据积累;第二,像谷歌等大厂,3D并非其核心主业,投入的研发资源和行业直觉相对有限。
影眸Hyper3D的核心护城河主要由三部分构成:首先是团队最早定义了3D生成底层框架,且团队在图形学与AI生成赛道深耕多年,具备非常敏锐的技术直觉,能精准洞察下一步的技术突破方向;其次是具备业内规模第一梯队的训练数据集;最后是高效率的研发与团队磨合度——影眸Hyper3D有着清晰的技术转化路径,大约70%以上的学术研发成果转化为商业产品。

如何达到“Production Ready”?
在生成的3D资产落地真实应用场景的过程中,“Production Ready(生产就绪/可投产)”一直是影眸Hyper3D对于研发产品的第一准则。在影眸Hyper3D团队看来,“Production Ready”实际上包含主观与客观双重维度。客观维度上,关注生成模型的几何、拓扑、贴图等表现;主观维度上,最终的评判权掌握在游戏、影视、具身等行业的客户与专业建模师等用户手中。
结构准确度与图像还原度有时并非完全重叠。比如2D AI生成的图片,其物体结构或几何关系本身可能就是错误的。这种情况下,Hyper3D的模型会优先保证3D几何结构的正确性,使生成的3D资产可以直接接入现有的游戏或影视工业管线使用,真正为客户实现降本增效。

目前来看,算力与产能拓展在公司内部处于稳定可控的状态,并不是制约发展的瓶颈。在定位上,影眸Hyper3D负责提供最底层的3D生成与空间表达技术,而将终极的艺术创作权交还给拥有专业技能的创作者。

从显式建模到虚拟渲染
针对行业内关于“世界模型”与“空间智能”的讨论,影眸Hyper3D正在探索场景级生成,基于其研究成果CAST(《CAST:基于单张 RGB 图像的组件对齐式 3D 场景重建》),即将正式上线的世界生成模型Hyper3D WorldGen实现了仅凭单张图片直接生成包含物体、物体关系和物理约束的可交互三维场景,可服务于具身智能仿真训练、游戏内容构建、空间设计等前沿场景。相比之下,某些基于2D视频生成的“世界模型”,本质上是在预测下一个视频帧的状态,核心偏向于交互端。但若缺乏持续交互,这种“世界”便无法作为客观环境独立存在,可控性与可替换性也较弱。
在物理场景构建上,影眸Hyper3D的核心优势在于快速构建虚拟物理世界的大批量训练数据。例如,可以将一张图片快速转化为可用于具身训练的3D场景,生成的3D场景天然具备正确的物理关系、空间摆放位置,避免了穿模、重叠等问题,能高效赋能虚拟仿真与训练场景。
从单体3D资产的精准生成,到复杂空间物理关系的理解,再到赋能机器人等具身智能在现实环境中的安全推演与交互,影眸正在逐步拓展面向物理世界的3D空间智能版图,致力成为连接生成世界、仿真环境与真实物理空间的3D智能基础设施。
