GPT-6 Astra 发布之后,网上出现了很多惊艳的 demo。我看了之后深受启发,也因此做了一些有意思的小实验,想探索一下在这种新的 3D 建模的能力的支持下,我们到底能发掘出怎样有意思的应用场景。
我做的第一个小实验是让它做一个相对简单的建模,具体地说,让它去做东方Project里面博丽神社的模型。工具上我选用的是Blender这个建模工具。我用的prompt也贴在下面。这个是在餐厅里面对着语音识别说的,可以看到有很多错误。但现在AI都可以很轻松地理解背后的含义。
嗯,我们去试试看哦,就是首先用 Blender 建一个伯利神社,就是东方project 里面的伯利明神社。你得先上网调研一下,它这个神社大概要长什么样,有哪些基本元素,然后你用 Blender 就把它建一下,然后渲渲出一个环视的动画
这里面我并没有给它一个参考图像,而是让它自己上网调研。在工作了半小时左右,它给出了下面的模型。注意这是一个真实的3D模型,下面只是一个视角的渲染图。

我觉得这个质量还是相当惊艳的。虽然可以看见里面有很多近似,比如每棵树的面数都比较低,但是整体的风格和布置都是蛮可爱和符合角色身份的。
在解决了建模本身之后,基于这个我们能做哪些很酷的事情呢?由于我平时比较喜欢看方猫的视频,里面的爆炸视图特别厉害,所以我又给了GPT一个相对详细的prompt,让它来生成一个爆炸视图的视频。也就是先展示这个神社内部有什么结构,然后把它组装起来,最后在沙盘上把树木和石头也加进来,形成一个展示。在几十分钟之后,GPT也非常优秀地完成了这个任务。下面是结果。
在完成了这件事情之后,我对它的信心大增。考虑到AI写代码的能力已经非常厉害了,下一步我就让它把这个场景移植到浏览器里,加入第一人称渲染和碰撞检测,让用户在这个场景里可以自由探索和行走。它也非常顺利地完成了这个任务。一个有意思的地方是,在写代码的时候,它似乎是有点不耐烦,直接调用了Grok来写,它自己进行视觉验证。我不知道这是偶然现象还是训练的结果,但最终在时间和质量上取得了比较好的平衡。我们也把结果部署到了网站上,大家感兴趣的话可以在这里玩一玩。里面有三个Tab,分别可以在虚拟世界里面行走,观察整个沙盘,以及查看上面的爆炸视图。
我也尝试了让它做其他类型的建模。感觉人物上的建模还是有比较大的改进空间的。出来的形象和原作一般相去甚远。GPT擅长的主要是建筑和场景。对于人物,不是说绝对做不了,就是需要花很多的精力去微操。也许这个问题可以在下一个版本的模型中改进。
在做完了这样的尝试之后,我又在想有没有可能把它推向更复杂的应用。于是我又尝试了两个场景。第一个是动作捕捉。看B站直播的小伙伴可能知道有一位东西叫VTuber。它指的是一种特殊的直播形式。主播在整个过程中不会真人出镜,而是面向摄像头,通过电脑端运行的动作捕捉算法来驱动屏幕上的虚拟形象和观众进行互动。这是一个蛮大的市场,也牵扯到一个非常复杂的技术链条。
一般来说,主播需要先和某些公司签约,由公司为他定制一套三维模型,然后对这个模型进行所谓的骨骼绑定。也就是像人类一样,给这个模型特定的位置埋设关节。通过改变这些关节的位置就可以让模型做出逼真自然的动作。在绑骨之后,就可以结合动捕算法来驱动。具体来说需要对摄像头捕捉到的主播的真人画像进行视觉分析,找到人类的关节位置,再经过一些算法去对动作进行适配,从而让虚拟形象做出和真人一样的动作。
即使不深究里面的技术细节,整个流程也是高度复杂的链条,每一个环节都有一定技术门槛。一般来说,会由不同的人员进行分工。有的负责立绘,有的负责建模/绑骨,有的负责动捕。整个公司再把成品进行交付。为了看AI能不能完整走完整个链条,我让 AI首先针对可达鸭做了一个三维模型,在这个基础上进行绑骨,然后又写了一个浏览器 Web App,进行动作捕捉和模型渲染。当我在浏览器里做出什么动作的时候,屏幕中的可达鸭会跟着我做出一样的动作。大家感兴趣的话可以在这里试试。它非常顺利地完成了整个流程。我录了一段截屏,效果如下所示。
我感觉质量还是挺好的。当然它和真正的人工精雕细琢出来的结果还是有差距,但是考虑到交付的时间和成本比人力的公司好了一两个数量级,我觉得已经蛮惊艳了。在后期加入更多优化以后,可能会更好。
我验证的第二个场景是基于3D建模的AI视频生成。比如我们可以用一两句话就给娃生成一段一两分钟的科普视频。这里用的例子是瓷器烧制的过程。我给了一个相对详细的prompt,让GPT首先调研瓷器烧制的流程是什么样子,然后思考怎么分镜、怎么配旁白、怎么建模。
AI首先进行了调研和分镜,有了分镜之后对相关的形象进行blender建模和关键帧的绘制。这些出来的中间结果保证了成片的物理和形象都是正确合理的。在此之上,它调用了一个挺一般的视频生成模型,我这里用的是Grok Imagine,因为可以嫖SuperGrok的订阅,不用额外花钱。大约过了几小时以后,它生成出来了一个带音效、带旁白的科普视频。如下所示。
考虑到现在AI视频的市场和技术都已经相对成熟,我的这个工作流是没办法和商业工作流竞争的。但是一个很有意思的地方是,它探索了一条道路,把高质量的Blender建模渲染和AI视频生成结合了起来,这个可能可以让视频里面形象和物理上的一致性更好。
在整个过程中,我反复被GPT-6 Astra三维建模的能力惊艳。其实以前我也折腾过这几个东西,包括用OpenSCAD和Blender去建模,但是都还很坎坷。现在同样的场景用GPT-6 Astro,很快很顺利就搞出来了。当然也不是说我们无脑给Prompt就可以拿到很棒的结果。里面有一些思路,尤其是让 AI 能够自我迭代的思路,还有Blender 方面细节的经验教训还是很重要的。我把这些经验教训和方法论都总结了一下,写成了一个 Skill,大家直接用这个 Skill 就可以 reproduce 类似的结果。它已经开源在 GitHub 上,希望对大家有用。