虚拟偶像的诞生——数字人产业与技术研究

我们了解的数字人
近年来,数字人的概念在互联网上极为火爆,业界涌现出许多知名的虚拟数字人或虚拟偶像,如Lil Miquela、洛天依、初音未来、鹿鸣、暖暖、AYAYI等。这些数字人的商业模式或市场价值通常是:通过运营积累流量,依托流量进行变现。例如:

品牌代言(IP、活动)
粉丝经济(二次元)
虚拟主播(游戏、带货)
本文为虚拟数字人定义了三个核心要素:
1. 形——具有人类或拟人化的外形,拥有特定的外貌及其他角色特征。
2. 动——具有类似人类的行为,能够用语言、表情和肢体进行表达。
3. 神——具有类人思维,能够识别外部环境,并可与人沟通交流。
这三个要素对虚拟数字人的"完整度"而言是递进关系。
市场格局
近年来,虚拟数字人在电商、金融、影视、游戏等各行业呈现出不同的市场规模。例如,2020 年中国虚拟偶像产业市场规模为34.6亿元,预计2021年将达到62.2亿元。
市场规模的增长也印证了技术的发展:制作成本逐年降低,形象和外观更加逼真,语言交流更加自然。自虚拟数字人诞生以来,已经历了三个重要阶段:
初创期:市场处于起步阶段,技术不确定性高,进入门槛高。
发展期:市场竞争者增多,技术逐渐成熟,进入门槛降低。
平台期:市场红海来临,平台化趋于成熟,领导者+细分市场并存。
解决方案
在当今的平台时代,各厂商也纷纷在不同层面提供解决方案:

基础层:为虚拟数字人提供基础软硬件支持。硬件包括显示设备、光学器件、传感器、芯片等,基础软件包括建模软件和渲染引擎。只有少数顶级科技公司具备出色的软硬件能力。

平台层:包括软硬件系统、制作技术服务平台和AI能力平台,为虚拟形象的制作和开发提供技术能力。目前有许多公司提供平台服务,对外销售服务和技术。 应用层:除了最终的企业用户外,一些具备出色营销和运营能力的公司或团队也为行业带来出色的创意和想法。

我们在做什么

虚拟角色组成立于阿里前端委员会的互动图形方向。该组由以下团队组成:大淘宝互动团队、达摩院智能数字人团队、优酷数字人制作与播出团队、考拉互动与内容导购团队、蚂蚁数字以及金融科技内容社区团队。他们共同分享和研究虚拟数字人领域的技术和应用。业务涉及三大场景:游戏、视频和直播。

游戏:虚拟数字人在游戏行业基本已是标配,许多游戏都需要进行角色塑造。其中,这类
游戏允许玩家自定义角色形象,该功能也被称为"捏脸"。

淘宝人生:这是淘宝 App 内的一款可以创建虚拟形象的游戏,包括捏脸、换装、美颜、拍照、购物、家居等功能。
养考拉:这是考拉海外购物 App 内的一款考拉养成游戏,包括换装、喂食等玩法。
它们均采用基于 Web 的技术方案,通过自研引擎完成角色的渲染、表情、动作等形态和动作表现。
视频:虚拟数字人短视频能够为用户带来出色的感官体验,同时也能为业务带来增量价值。在制作虚拟数字人视频时,可借助动作捕捉、智能识别和导演系统等手段,让虚拟数字人栩栩如生。
直播:直播与虚拟数字人的结合仍处于早期探索阶段,因为这两个现象级产业要实现融合并形成新的商业模式并非易事。涉及的技术还包括直播场景下的实时动作捕捉、算法训练与合成、云渲染与流式传输等。

共同创作

随着应用场景的专业化和深入,技术研究还将涵盖工程、算法等多种综合解决方案,在不同应用场景中侧重点各有不同。接下来以大淘宝互动团队的淘宝人生业务为例,展示如何从美术制作、渲染风格、捏脸、表情、导演系统和语音合成六大主题出发,打造一位超级虚拟偶像。
在本章中,我们将完成虚拟数字人的造型——“具有人或拟人化的外形,并拥有特定的面容等角色特征”。

从模型雕刻到3D美术工作流

虚拟数字人的基本体型特征,例如采用真人比例的7头身、卡通比例的5头身;男性、女性或动物拟人化等。基本形态特征确定后,即可由3D美术制作基本造型。整个流程通常在传统DCC软件中完成,但3D美术与2D美术最大的区别在于:2D内容的美术制作中,技术可以在美术成品交付后再介入;而3D内容的美术制作中,技术需要直接参与制作过程。原因在于3D美术制作流程较为冗长复杂,需要美术与技术频繁协作,以确保交付质量和交付效率。这一过程也称为3D美术工作流。
举一个直观的例子:艺术家开始设计和雕刻一个杯子模具,生产线需要解决模具使用什么材料、如何将材料注入模具、如何顺利脱模等"技术问题"。这些通常由技术部门负责,需要提前与艺术家协商模具规格,确保后续工序顺利进行,最终完成模具交付。3D美术工作流也有许多类似的方案。主要原因是3D内容制作也有特定的工业化标准。但细节上的差别在于,细节与艺术家使用的软件和技术实现的引擎密切相关。以淘宝人生的美术工作流为例,大致经历这些步骤:
1. 使用Maya制作白模和骨骼,过程产物暂存至OSS,并提供预览工具
2. 使用Photoshop制作纹理贴图,将纹理上传至CDN
3. 在Maya中定制GLTF Exporter插件,导出glTF(包含模型数据、骨骼数据、材质、纹理数据)
4. Web端嵌入式材质编辑器调整自研材质的效果
5. 人体glTF通过EVA Figure引擎中的GLTF Importer导入,并定制材质Shader进行渲染。
经过前期与美术师的磨合,最终会形成一套适用于当前需求的美术工作流,并稳定运行。
精心打造——捏脸
完成角色的基础形态后,每个人都可以用它来继续实现自己想要的外观。虽然不同的外观可以在美术环节完成,但成本相当高,而且每个人喜欢的外观不同,需要多次美术制作或修改。因此在基础形态上增加了捏脸系统,可以轻松完成定制需求。淘宝人生提供了捏脸功能,可以体验捏脸的乐趣。捏脸技术的实现基础是对现有模型数据进行局部修改和变化,最终实现千人千面的效果。通过这样的系统如何实现改变基础模型的目的呢?通常一组模型数据就是顶点数据的集合,改变模型通常就是改变顶点数据,而改变顶点数据通常有两种方式:
骨骼蒙皮
通过对顶点施加某种“变换”来模拟“外力”作用,本质上是一组包含位移、旋转和缩放三种变换的数学公式。实现这种变换的外力可以借助“骨骼”来完成。这里的骨骼可以类比人体骨骼:当关节对手指的作用发生变化时,手的形态就会随之改变。在淘宝人生的捏脸功能中,我们为面部预设了约20种骨骼,可改变头围、眼球、眼角、眼窝、颧骨、脸型等。
虚拟偶像的诞生——数字人产业与技术研究
Blend Shape
骨骼带来的顶点变形较为粗糙,无法完成嘴型等精细定制,因为这类看似简单的外观变化实际上涉及模型中数万个顶点的不同规律变换。因此,我们为这组顶点变形设置了一个变形器,业界通常称为“Morph Target”或“Blend Shape”。其原理是为顶点准备一个参考位置,再提供一个经过“极大变化”后的最大位置,然后乘以一定的“权重比例”,使顶点可以处于参考位置或极端位置之间的任意位置。但由于面部需要局部变形的地方太多,一次变形可能涉及数万个顶点,对实时计算而言压力也不小。
对比两种技术,骨骼蒙皮简单高效但灵活性不足,顶点变形更自由但制作和计算成本较高。因此在实际开发中,选择骨骼蒙皮还是顶点变形,是“效果”与“效率”之间的权衡,需要具体问题具体分析,反复调优。在淘宝人生中,“捏脸”功能有一小部分使用了骨骼蒙皮,大部分使用的是混合变形,这也是长期磨合和经验积累的结果。
时尚穿搭——装扮与美妆
有了身体和面容之后,还需要为角色穿上时尚的服装,画上精致的妆容。对人类来说,穿衣和化妆是“动作”;在虚拟世界中,同样需要很好地完成“穿”和“画”这两件重要的事。
换装
在现实生活中,衣服穿在身上时贴近皮肤或留有一定间隙。这一概念在虚拟世界中实际上很难实现。因为皮肤和衣服实际上都是Mesh(网格),当衣服穿到身上时,两套网格实际上“碰撞”在了一起,这就引出了以下两个问题:
当身体运动时,衣服也随之与身体一起运动。身体有骨骼,骨骼外面包裹着一层“皮肤”;同样地,衣服实际上也是包裹在同一套骨骼上的一层“皮肤”。在淘宝人生中,身体和衣服使用同一套骨骼模板,并在渲染时实现两套骨骼数据的实时同步。
如何解决身体网格穿透衣服的问题。用同一套骨骼实现“穿衣”效果很巧妙,但也容易出问题。比如某件衣服非常贴身,身体皮肤就容易凸出衣服,俗称“穿模”。由于逐件精调的成本太高,我们采用了一个取巧的方案:将人体“切割”,标记每件衣服覆盖的身体部位,渲染某件衣服时直接隐藏被遮挡部位的 Mesh。
借助这两项技术,可以通过美术制作规范和流程批量生产服装,换装只需加载不同模型,无需逐一做特殊处理。
美妆
妆容细节要求很高,最便捷的方式是使用贴图。基础脸型已有基础贴图,可简单理解为“素颜”;在素颜脸上绘制不同妆容,采用“贴图动态合成”。整个流程分为两步。
1. Render To Texture:第一步是创建可渲染对象(Render Target),将基底纹理贴图渲染到该可渲染对象上,再将妆容纹理贴图渲染到同一可渲染对象上。此步骤需注意,美术师在绘制妆容纹理时,基底纹理的 UV 需要一一对应。
2. 使用可渲染纹理:第二步是将合成后的纹理渲染到模型上。
2D还是3D——渲染风格
最后是风格化环节。有人偏爱写实风格,有人喜欢卡通风格,有人钟情朋克风格,也有人青睐纯欲风格。这些不同风格的实现需要依赖渲染功能来完成。谈到渲染,就不得不提图形渲染管线,它可以根据不同需求进行组合调整。例如,最简单的渲染管线为:加载模型 → 顶点着色器 → 片段着色器 → 光栅化。其中片段着色步骤负责完成材质纹理的绘制,以实现所需的角色风格。材质纹理的渲染通常分为两大类:
PBR
全称为Physically Based Rendering,顾名思义,是基于物理的渲染。既然基于物理,其渲染的最终结果会非常接近真实世界。因此不难理解,这类材质能够决定角色是写实风格还是超写实风格。该技术包含8个核心理论和若干重要的光照模型,此处不再列举。感兴趣的读者可以阅读《Real-Time Rendering》中的PBR相关章节,或SIGGRAPH的《Physically Based Shading in Theory and Practice》系列文章。例如在淘宝人生中,次表面散射技术根据不同部位在渐变图上选取采样色进行模拟,实现了人脸红润通透的质感。
NPR
全称为Non-photorealistic Rendering,即非真实感渲染。其主要应用之一是非常流行的二维风格,尤其是日式卡通风格。与PBR不同,NPR不追求各种物理模拟,而是从油画、素描和卡通动画中汲取灵感。例如角色描边、卡通着色、边缘光照、头发高光等是常用的技术。这些特殊的材质渲染效果在专业论文和案例中也可以找到,可自行搜索。
动作
在本章中,将完成虚拟数字人的动作——"具有类似人类的行为,具备用语言、面部表情和身体进行表达的能力"。
表情与动作
成功塑造虚拟数字人的关键之一,在于真实细腻的表情和动作。真人的表情和动作由骨骼与肌肉的相互作用呈现。在虚拟世界中,同样运用数字技术模拟骨骼和肌肉的功能来呈现表情和动作。前文"造型"章节已介绍面部采用骨骼蒙皮和混合变形来改变顶点。在"动作"章节中,将继续运用这两种技术,借助动画让顶点"动起来",完成相应的表情和动作。
手动K帧动画
在面部表情的塑造方面,顶点动画(即Morph Target Animation)是主要的实现技术之一。淘宝人生的"捏脸"功能中,骨骼蒙皮用于确定脸型大小和五官位置,混合变形用于完成脸颊、额头等五官部位的变形。其中用于表情动画的BlendShape多达50个,与Apple Animoji使用的BlendShape非常接近。表情设置(当然许多微表情实现难度很大)。

在身体动作的制作方面,骨骼动画(即Skeletal Animation)是主要的实现技术之一。骨骼动画包含骨骼和蒙皮两类数据。首先将网格的顶点绑定到骨骼上生成蒙皮,这些顶点受多根骨骼以不同权重影响,然后通过改变骨骼的朝向和位置来生成动画,此时蒙皮会跟随骨骼一起运动。
动作捕捉
动画制作成本较高,因为上述两种动画技术通常采用关键帧动画。假设一个人抬起肘部,手臂和手腕也会随之产生连贯动作。要实现这样的动画需要大量关键帧,制作难度极大。为有效降低制作成本,需要采用动作捕捉技术。通常将动作捕捉技术分为两大方向、四大类别,可用四象限图来描述:
我们通过手机摄像头实现的 AR 互动游戏、AR 面具等功能,实际上属于光学识别+可穿戴设备象限中的技术。
编舞 - 导演系统
对比几种方案的成本和灵活性。手工关键帧动画的制作成本无疑最高,灵活性和效果也最好,但需资深绑定师和动画师完成。动作捕捉需要一套专业动捕设备、可容纳设备并满足所需动作的场地,一个动作制作周期从几小时到几天不等。面对多舞蹈场景等运营需求,最合适的方案是将已完成的动作自由或智能地编排成脚本,如同电影拍摄中导演预先设计脚本、演员按脚本表演即可,因此也称为“导演系统”。
这一系列动作需要解决一个问题:如何从动作1过渡到动作2。这就需要用到混合动画(Blending Animation)技术。混合动画的基本原理是,以动作1的当前状态为起点,以动作2的指定状态为终点,计算关键帧的插值。简单的可以采用线性插值,复杂的也可以使用贝塞尔曲线插值等。关于混合动画有大量知识点和解决方案,适用于不同场景和需求,可以自行搜索。例如Unity和Unreal也提供了多种不同的混合方案。
借助导演系统,可以实现自由组合的能力。例如想要举办一场虚拟演唱会,同样可以通过导演系统来完成演出。
本章将探讨虚拟数字人的"神"——具备类人思维、能够识别外部环境、并可与人进行沟通交流的能力。在"神"的研究方面,我们仍处于非常早期的阶段。一方面需要大数据的支撑,另一方面与前沿应用尚有相当距离。为使虚拟数字人更加逼真,"神"将是未来研究的重点方向。
角色表情 - 自然语音合成
虚拟数字人的语言表达需要借助语音合成技术,如TTS(Text To Speech)。阿里达摩院拥有非常完善的TTS引擎,可以让虚拟数字人开口说话。但这仅仅是“说话”,实际上大家都能感受到,这种语言非常苍白无力,缺乏“情感”,无法根据不同的性格和情绪表达不同的语调。业界可以看到一些优秀的成果:雅马哈的歌声合成系统“VOCALOID”(初音未来和洛天依使用的就是这个系统)、Google基于深度学习的端到端语音合成系统“Tacotron”,以及科大讯飞的语音合成系统等。阿里达摩院也在持续研究更符合自然表达的语音合成系统,通过为虚拟数字人设定人设,利用大数据深度学习生成不同风格的情感语调。

至此,我们已经完成了现有技术水平下一个超级虚拟偶像的出道首秀。
我们憧憬的数字人
淘宝人生是基于Web技术的数字人。经过两年的技术打磨和升级,我们也面临着Web数字人技术的困境。在性能方面,Web应用与原生应用之间存在不可避免的差距。WebGL(基于OpenGL ES 2.0)作为Web端的主要图形接口,无论在能力还是性能上都无法赶上Vulkan、DirectX和Metal。此外,在不同移动设备的软硬件上仍然会出现各种兼容性问题。这一系列困境已成为Web数字人难以逾越的瓶颈。
相比之下,业界的数字人技术——超写实渲染、微表情、肌肉模拟、物理材质、光线追踪等,令我们在Web技术方面难以企及。与此同时,阿里的虚拟数字人技术刚刚起步,基础软硬件、中间层技术和大数据支持均起步较晚,带来了不少困难和阻力。
面对这些困境和差距,将从多个方向为淘宝人生中虚拟数字人技术的发展做出努力和尝试。
首先是基于Web技术的优化:依托Serverless渲染云服务,结合EVA Figure(虚拟人像渲染引擎)和Puppeteer技术,借助最新的WebGPU、WASM等,可以提升虚拟数字人的渲染效果和质量。同时正与阿里云服务团队和大淘宝Node架构团队合作,在Web技术体系下构建云渲染流程。计划将其应用于非实时渲染任务,如淘宝人生用户形象的全身照制作、短视频、动作帧等。这些产品也可供淘宝人生或其他商家使用。
其次是业务能力的升级。在业务与技术相互滋养的土壤中,业务能力持续沉淀为平台服务,将实践经验逐步积累到阿里的虚拟数字人技术中,并通过商业化方式将部分解决方案以云服务的形式服务公众。
在元宇宙、超写实、XR/6G、脑机接口等行业风向标的辐射下,畅想未来Web数字人技术的可能性。
文末感谢阿里巴巴前端委员会图形交互虚拟角色团队成员的出色工作,让我得以完成本文内容。也欢迎大家继续关注虚拟角色组和各团队的最新成果。

相关文章

探索更多特惠

  1. 短信服务(SMS)与邮件服务

    5万封邮件套餐包低至1.99美元,120条短信仅需1.00美元

phone 联系我们
你好,我是AI助理。
可以解答问题、推荐解决方案等。