バーチャルアイドルの誕生:デジタルヒューマンの産業・技術研究

私たちのデジタルピープルに関する理解
近年、仮想デジタルヒューマンの概念はインターネット上で非常に人気となり、Lil Miquela、洛天依、初音ミク、暖暖、AYAYI など、多くの人気バーチャルデジタルヒューマンやバーチャルアイドルが業界に登場した。これらのデジタルヒューマンのビジネスモデルや市場価値は通常、プロモーション活動でトラフィックを集め、そのトラフィックを収益化に活用する仕組みである。例:

ブランドエンドースメント(IP、イベント)
ファンエコノミー(二次元)
バーチャルライブストリーマー(ゲーム、商品販売)
本記事では、以下で述べるデジタルヒューマンの 3 つの核心要素を定義します。
1. 形 - 人間または擬人化された外観を持ち、特定の容姿やその他のキャラクター特性を備える。
2. 動作 - 人間と同様の動作を持ち、言語、表情、身体による表現能力を備える。
3. 神(心) - 人間のような知性を持ち、外部環境を認識し、人とコミュニケーションやインタラクションができる。 これら 3 つの要素は、仮想デジタルヒューマンの「完全性」に対して段階的な関係にあります。
市場状況
近年、仮想デジタルヒューマンは E コマース、金融、映画・テレビ、ゲームなどの業界でさまざまな市場規模を形成しています。たとえば、中国におけるバーチャルアイドル産業の市場規模は 2020 年に 34.6 億元に達し、2021 年には 62.2 億元に達すると見込まれています。
市場規模の拡大は技術の発展を裏付けている。制作コストは年々低下し、映像や外観はよりリアルになり、言語コミュニケーションはより自然になっている。仮想デジタルヒューマンの登場以来、3 つの重要な段階を経てきた。
創業期:市場が成長を始める段階で、技術は不確実であり、参入障壁が高い。
発展期:市場の競合他社が増加し、技術が徐々に確立され、参入障壁が低くなる。
プラットフォーム期:市場がレッドオーシャン化し、プラットフォームが成熟して、リーダーとニッチ企業が共存する。
ソリューション
現在のプラットフォーム時代において、各メーカーは異なるレベルでソリューションを提供するようになっています。

基礎層:仮想デジタルヒューマンに基本的なソフトウェアとハードウェアのサポートを提供します。ハードウェアにはディスプレイデバイス、光学デバイス、センサー、チップなどが含まれ、基礎ソフトウェアにはモデリングソフトウェアやレンダリングエンジンが含まれます。優れたハードウェアとソフトウェアの両方のケイパビリティを持つのは、一部のトップ技術企業に限られています。

プラットフォーム層:ソフトウェア・ハードウェアシステム、制作技術サービスプラットフォーム、AI ケイパビリティプラットフォームを含み、仮想イメージの制作と開発に必要な技術ケイパビリティを提供します。多くの企業がプラットフォームサービスを提供し、他の企業にサービスと技術を販売しています。

アプリケーション層:最終的な企業ユーザーの他にも、優れたマーケティング・運用能力を持つ企業やチームがこの業界に優れたアイデアや構想をもたらしています。

取り組んでいること

アリババフロントエンド委員会のインタラクティブグラフィックス部門に仮想キャラクターグループが設立されました。このグループは、大 Taobao インタラクティブチーム、Dharma Academy スマートデジタルヒューマンチーム、Youku デジタルヒューマン制作・配信チーム、Koala インタラクティブ&コンテンツショッピングガイドチーム、Ant Digital、金融コンテンツコミュニティチームで構成され、仮想デジタルヒューマン分野の技術とアプリケーションを共同で研究・共有しています。主にゲーム、動画、ライブ配信の 3 つのシナリオに対応しています。

ゲーム:仮想デジタルヒューマンはゲーム業界ではほぼ標準的な存在であり、多くのゲームでキャラクターの造形が必要です。
中でも、プレイヤーがキャラクター画像をカスタマイズできる機能を持つゲームがあります。このキャラクター画像のカスタマイズ機能は「顔のカスタマイズ」とも呼ばれます。

Taobao Life:Taobao アプリ内のアバターを作成できるゲームです。顔のカスタマイズ、着せ替え、ビューティー、写真撮影、ショッピング、ホームなどの機能を備えています。
コウラの育成ゲーム:Koala 海外ショッピングアプリ内のコウラを育成できるゲームで、着せ替えや餌やりなどのゲームプレイを含みます。
いずれも Web ベースの技術ソリューションを採用し、自社開発エンジンでキャラクターのレンダリング、表情、アクションなどの造形と動作を実現しています。
動画:仮想デジタルヒューマンのショート動画は、ユーザーに優れた感覚体験をもたらし、ビジネスに増分的な利益をもたらすことができます。仮想デジタルヒューマンの動画を制作する際は、モーションキャプチャ、インテリジェント認識、ディレクターシステムを活用し、仮想デジタルヒューマンに命を吹き込むことができます。
ライブ配信:ライブ配信と仮想デジタルヒューマンの組み合わせは、2 つの注目産業の融合であり、新たなビジネスモデルや増分モデルを構築することが容易ではないため、まだ探索の初期段階にあります。関連する技術には、リアルタイムモーションキャプチャ、アルゴリズムトレーニングと合成、ライブ配信シナリオでのクラウドレンダリングとストリーミングなどが含まれます。

共に創る

専門的なアプリケーションシナリオが深まるにつれて、技術研究もエンジニアリングやアルゴリズムなどの包括的なソリューションをカバーするようになり、アプリケーションシナリオによって重点が異なります。次に、大淘宝インタラクティブチームの Taobao Life ビジネスを例に、アート制作、レンダリングスタイル、顔のカスタマイズ、表情、ディレクターシステム、音声合成の 6 つのテーマから、スーパーバーチャルアイドルの制作方法を紹介します。
本章では、仮想デジタルヒューマンの造型を仕上げる。「人間または人間に似た姿を持ち、明確な外見とキャラクター性を備えている」ものである。

型から彫る - アーティスティックワークフロー

仮想デジタルヒューマンの基本的な物理特性として、たとえば現実の比率に基づく 7 頭身、アニメ風の 5 頭身、男性、女性、動物の擬人化などの選択肢があります。基本形状が決まったら、3D アートによる制作を開始できます。一般的な制作工程は従来の DCC ソフトウェアで完了しますが、3D アートと 2D アートの最大の違いは、2D コンテンツの制作では成果物の納品後に技術が介入できるのに対し、3D コンテンツの制作では技術が制作プロセスに直接関与する必要がある点です。その理由は、3D コンテンツの制作工程は比較的長く複雑で、品質と効率を保証するためにアートと技術の密接な連携が頻繁に必要となるためです。この工程を 3D アートワークフローと呼びます。
具体的な例を挙げます。アーティストがカップの金型の設計と彫刻を始めると、生産ラインでは金型の素材の選定、素材の注入方法、スムーズな離型方法などの「技術的課題」を解決する必要があります。通常、これらは技術チームの責任であり、アーティストと事前に金型の仕様を調整して、後続の工程の順調な進行を確保し、最終的に金型の納品を完了する必要があります。3D コンテンツ制作のワークフローにも同様のアプローチが多く存在します。その主な理由は、3D コンテンツの制作にも一定の業界標準が存在するからです。細かな違いとしては、詳細がアーティストが使用するソフトウェアや技術側で実装されるエンジンに密接に関連している点です。Taobao Life のワークフローを例に、これらのステップを大まかに確認してみましょう:
1. Maya で白型とボーンを制作し、中間生成物を OSS に一時保存してプレビューツールを提供する
2. Photoshop でテクスチャを制作し、テクスチャを CDN にアップロードする
3. Maya の GLTF Exporter プラグインをカスタマイズして glTF(モデルデータ、ボーンデータ、マテリアル、テクスチャデータを含む)をエクスポートする
4. Web 側の組み込みマテリアルエディタで独自開発マテリアルの効果を調整する
5. EVA Figure エンジンの GLTF Importer を通じて人体の glTF を読み込み、カスタムマテリアルシェーダーを適用してレンダリングする
初期段階でアーティストとの調整期間を経て、最終的に現在のニーズに対応する一連の美術ワークフローが確立され、安定して運用されるようになります。
造形 - 顔のカスタマイズ
キャラクターのベース形状が完成したら、各自それを使って希望の外観にカスタマイズできます。異なる外観はアート制作段階でも実現できますが、コストがかかる上、ユーザーの好みが異なるため、何度も制作や修正を繰り返す必要があります。そこで、ベース形状に顔のカスタマイズシステムを追加し、簡単にカスタマイズできる機能を提供しています。Taobao Life では顔のカスタマイズ機能を提供しており、自由に外観を調整する楽しさを体験できます。顔のカスタマイズ技術の実現基盤は、既存のモデルデータを部分的に変更し、無限のバリエーションを実現することです。通常、モデルデータは頂点データの集合であり、モデルの変更は頂点データの変更を意味します。頂点データを変更する方法は主に 2 つあります:
ボーンスキニング
「外力」によって頂点に何らかの「変換」を適用することは、すなわち平行移動、回転、スケーリングの 3 つの変換を含む一連の数学的計算式です。この変換を実現するために、外力として「ボーン」を使用できます。ここで言うボーンは、人体の骨格と同様に理解できます。指の関節の動作が変化すると、手の形状も変化します。Taobao Life の顔カスタマイズ機能では、顔用に約 20 種類のボーンをあらかじめ設定しており、頭囲、眼球、目頭、眼窩、頬骨、顔の形状などを変更できます。
バーチャルアイドルの誕生:デジタルヒューマンの産業・技術研究
ブレンドシェイプ
ボーンによる頂点変形は大まかな変形に過ぎず、口の形状のような細かいカスタマイズは実現できません。一見シンプルに見える形状変化でも、実際にはモデル内の数万の頂点に異なる規則的な変換を適用する必要があるためです。そのため、この頂点変形のセットに対してデフォーマーを設定します。業界では一般的に「モーフターゲット」または「ブレンドシェイプ」と呼ばれます。この変換の原理は、頂点の基準位置を用意し、「極限変形」後の最大位置を設定した上で、一定の「重み比率」を掛けることで、頂点を基準位置と極限位置の間の任意の位置に配置できます。ただし、顔の局所的な変形が必要な箇所は非常に多く、1 つの変形で数万の頂点が関わるため、リアルタイム計算においても無視できない負荷となります。
両手法を比較すると、スキニングは簡潔で効率的だが柔軟性に欠け、頂点変形は自由度が高い反面、制作コストと計算コストがかさむ。そのため、実際の開発でスキニングと頂点変形のどちらを採用するかは「効果」と「効率」のトレードオフであり、詳細を検討し繰り返し調整する必要がある。Taobao Life では、顔カスタマイズ機能の一部にスキニングを使用し、大半はブレンディング変形を採用している。これは長年の運用経験の蓄積による結果である。
ファッション着せ替えとビューティー
ベースボディと外見を用意したら、次はキャラクターにおしゃれな服を着せて、美しいメイクを施す必要がある。現実の世界では、服を着ることやメイクをすることは「行為」である。仮想世界でも、「着る」と「ペインティング」という 2 つの重要な要素をしっかり実現できなければならない。
着飾る
現実の世界では、衣服を身に着けると肌に密着したり、ある程度の隙間ができたりします。この概念を仮想世界で実現するのは非常に困難です。皮膚も衣服もメッシュであり、衣服を身体に着せると、2 つのメッシュが実際に「衝突」するため、次の 2 つの問題が発生します。
体が動くと、服も体と一緒に「動作」する。体にはボーンがあり、ボーンの周りには「スキン」が巻き付けられている。同様に、服も同じボーンに巻き付けられた「スキン」の層である。Taobao Life では、体と服に同じスケルトンテンプレートを使用し、レンダリング時に両者のスケルトンデータをリアルタイムで同期させている。
ボディのメッシュが衣服からはみ出す問題への対処法です。同じスケルトンを使って「着用」効果を再現するアプローチは巧妙ですが、問題も発生しやすくなります。たとえば、衣服の形状が大きく凹んでいる場合、ボディのスキンが衣服を貫通してしまう、いわゆる「型抜き」と呼ばれる問題が起きがちです。個別に調整するコストが高すぎるため、次のような工夫を凝らしました。人体を分割し、各衣服で覆われる部分をマーキングしておき、特定の衣服をレンダリングする際に、覆われる部分のメッシュを非表示にします。これで貫通部分を隠すことができます。
これら 2 つの技術により、アート制作の仕様とワークフローに沿って衣服を大量生産できます。衣服の切り替えは異なるモデルをロードするだけで実現でき、個別の処理は不要です。
ビューティー
メイクアップの仕上がりには非常に細やかなディテールが求められるため、最も効率的な方法はテクスチャ合成を活用することです。基本形状の顔には既にベースとなるテクスチャが適用されており、これはシンプルに「ノーメイク」の状態と捉えられます。この素顔をベースにさまざまなメイクを施すために、テクスチャの動的合成を行います。このプロセスは 2 つのステップに分けられます。
1. Render To Texture:第 1 ステップでは、レンダリング可能なオブジェクト(レンダーターゲット)を作成し、ベーステクスチャマップをこのレンダーターゲットにレンダリングしてから、メイクアップテクスチャマップを同じレンダーターゲットにレンダリングします。このステップで注意すべき点は、アーティストがメイクアップテクスチャを描画する際、ベーステクスチャの UV と一対一で対応している必要があることです。
2. レンダリングテクスチャの使用:第 2 ステップでは、合成されたテクスチャをモデルにレンダリングします。
2D または 3D - レンダリングスタイル
最後にスタイリングの段階です。リアルなスタイル、カートゥーンスタイル、パンクスタイル、光沢のある純粋なスタイルなど、人それぞれ好みが異なります。これらの異なるスタイルは、レンダリング機能によって実現されます。レンダリングについて語る際、グラフィックスレンダリングパイプラインが話題になります。これはさまざまな要件に応じて組み合わせや調整が可能です。たとえば、最もシンプルなレンダリングパイプラインは「モデルのロード → 頂点シェーダー → フラグメントシェーダー → ラスタライゼーション」となります。フラグメントシェーダーのステップでは、マテリアルテクスチャの描画を行って、目的のキャラクタースタイルを実現します。マテリアルテクスチャのレンダリングは、通常 2 つのカテゴリに分けられます。
PBR
正式名称は Physically Based Rendering(物理ベースレンダリング)です。その名の通り、物理法則に基づくレンダリングです。物理に基づくため、レンダリング結果は現実の世界に非常に近いものになります。そのため、このタイプのマテリアルがキャラクターの写実性や超写実性を左右することが容易に理解できます。この技術は 8 つの中核理論といくつかの重要なライティングモデルで構成されていますが、ここでは割愛します。興味のある方は、「Real-Time Rendering」の PBR 関連章节や、SIGGRAPH の「Physically Based Shading in Theory and Practice」シリーズの記事をお読みください。たとえば Taobao Life では、サブサーフェススキャタリング技術を、部位ごとにグラデーションマップ上のサンプリングカラーを選択することでシミュレーションし、人脸の赤みのある透明感を実現しています。
NPR
正式名称は Non-photorealistic Rendering、すなわち非写実的レンダリングです。主な用途の 1 つは、現在非常に人気のある二次元スタイル、特に日本のアニメ風スタイルです。NPR は PBR とは異なり、物理ベースのシミュレーションを追求するのではなく、油画、デッサン、カートゥーンアニメーションからインスピレーションを得ています。たとえば、キャラクターの輪郭線、カートゥーンシェーディング、リムライティング、髪のハイライトなどがよく使用される技法です。これらの特殊なマテリアルレンダリングについては、専門論文やサンプルも公開されているので、興味があれば調べてみてください。
動かす
本章では、仮想デジタルヒューマンの動作、すなわち「人間に近い動作を備え、言語、表情、ボディランゲージで表現する能力」の実現について解説します。
表情とアクション
仮想デジタルヒューマンを成功させるための鍵の 1 つは、リアルで繊細な表情と動作です。実在する人間の表情や動作は、骨と筋肉の相互作用によって生み出されています。仮想世界でも、デジタル技術を用いてこれらの骨と筋肉の機能をシミュレーションし、表情や動作を再現します。「Shape」の前章では、顔の造形においてボーンスキニングとブレンディング変形を使用して頂点を変化させることについて既に述べました。「Motion」の本章でも、これらの技術を引き続き活用し、アニメーションによって頂点を「動かす」ことで、目的の表情や動作を実現します。
ハンド K アニメーション
表情の表現において、頂点アニメーション(モーフターゲットアニメーション)は主要な実装技術の 1 つです。Taobao Life の「顔のカスタマイズ」機能では、スキニングを使用して顔の大きさと各パーツの位置を決定し、ブレンディング変形を使用して頬や額などの顔パーツの変形を実現しています。中でも表情アニメーションに使用される BlendShape は最大 50 種類に達し、Apple の Animoji で使用される BlendShape に非常に近い構成となっています(ただし、多くの微細な表情の再現は非常に困難です)。

身体の動きの制作においては、スケルトンアニメーションが主要な実装技術の 1 つです。スケルトンアニメーションはスケルトンとスキンの 2 種類のデータで構成されます。まず、メッシュの頂点をボーンにバインドしてスキンを生成します。これらの頂点は異なるウェイトを持つ複数のボーンの影響を受け、ボーンの方向と位置を変更することでアニメーションが生成されます。このとき、スキンはボーンに合わせて動きます。
モーションキャプチャ
アニメーションの制作コストは比較的高くなります。上述の 2 つのアニメーション技法はいずれもキーフレームアニメーションが基本となるためです。たとえば肘を上げる動作では、腕や手首も連動して動きます。このようなアニメーションを実現するには、膨大な数のキーフレームが必要になり、制作は非常に困難です。制作コストを効果的に削減するため、モーションキャプチャ技術の導入が必要になります。通常、モーションキャプチャ技術は 2 つの大きな方向性と 4 つのカテゴリに分類でき、四象限図で表すことができます。
スマホカメラで実現する AR インタラクティブゲームや AR マスクなどの機能は、実は光学認識とウェアラブルデバイスの技術に分類されます。
演出 - ディレクターシステム
いくつかの手法のコストと柔軟性を比較してみましょう。手付けによるキーフレームアニメーションの制作コストが最も高いことは言うまでもなく、柔軟性とクオリティも最も優れています。同時に、経験豊富なリガーとアニメーターが必要です。一方、モーションキャプチャには専用の機材一式と、それらを収容でき、かつ必要な動作に対応できる場所が必要で、制作サイクルは数時間から数日かかります。ダンスシーンなど多くのモーションが必要な場面では、事前に制作した複数のモーションをスクリプトで自由に、またはインテリジェントに組み合わせる方法が最も適しています。映画の撮影で監督が事前に脚本を設計し、俳優は脚本に従って演じるのと同じ仕組みで、「ディレクターシステム」とも呼ばれます。
一連のアクションでは、アクション 1 からアクション 2 へどのように移行するかという問題を解決する必要があります。ここで必要となるのがブレンディングアニメーション技術です。ブレンディングアニメーションの基本原理は、アクション 1 の現在の状態を開始点、アクション 2 の指定された状態を終点として、キーフレームの補間を計算することです。シンプルな場合は線形補間、複雑な場合はベジエ曲線補間などを使用します。ブレンディングアニメーションに関する知識やソリューションは豊富にあり、さまざまなシナリオや要件に対応しています。詳細は各自で検索してください。たとえば、Unity や Unreal も複数の異なるブレンディングソリューションを提供しています。
ディレクターシステムにより、自由な組み合わせ機能を提供できます。たとえば、バーチャルコンサートの開催も、ディレクターシステムで実現できます。
本章では、仮想デジタルヒューマンの「神(心)」——人間のような知性を持ち、外部環境を認識し、人とコミュニケーションやインタラクションができる能力——について探ります。この「神」の研究はまだ初期段階にあります。一方面ではビッグデータの裏付けが必要であり、もう一方ではフロントエンドの段階とはまだ大きな隔たりがあります。仮想デジタルヒューマンをよりリアルにするために、「神」の研究は今後の重要な焦点となります。
キャラクターの表情 - 自然な音声合成
仮想デジタルヒューマンの言語表現には、TTS(Text To Speech)などの音声合成技術が必要である。Dharma Academy には非常に充実した TTS エンジンがあり、仮想デジタルヒューマンに喋らせることができる。しかし、これはただ喋るだけである。実際、誰もが感じることだが、この種の言語表現は非常に単調で、「感情」が欠如しており、異なる個性や感情に合わせて声色を変えることができない。業界では優れた成果が見られる。YAMAHA の音声合成システム「VOCALOID」(初音ミクや洛天依が使用)、Google のディープラーニングに基づくエンドツーエンド音声合成システム「Tacotron」、iFLYTEK の音声合成システムなどである。Dharma Academy でも、自然な表現にさらに適した音声合成システムの研究を続けており、仮想デジタルヒューマンに個性を設定し、ビッグデータからのディープラーニングを用いて、さまざまなスタイルの感情豊かな音声を生成する取り組みを進めている。

以上で、既存技術に基づくスーパーバーチャルアイドルのデビューが完了した。
私たちが目指すデジタルヒューマン
Taobao Life は Web テクノロジーをベースとしたデジタルヒューマンである。2 年間の技術的な磨き上げとアップグレードを経て、Web デジタルヒューマン技術のジレンマにも直面している。パフォーマンス面では、Web アプリケーションとネイティブアプリケーションの間に避けられないギャップがある。WebGL(OpenGL ES 2.0 ベース)は Web の主要グラフィックスインターフェースでありながら、Vulkan、DirectX、Metal に能力面でもパフォーマンス面でも追いつけていない。さらに、異なるモバイルデバイスのハードウェアやソフトウェアでは、依然として奇妙な互換性の問題が発生する。こうした一連の課題が、Web におけるデジタルヒューマンにとって越えにくい壁となっている。
一方で、業界のデジタルヒューマン技術を見ると、ハイパーリアリスティックレンダリング、マイクロエクスプレッション、マッスルシミュレーション、物理ベースマテリアル、レイトレーシングなど、Web 技術では到底及ばない領域があります。同時に、Ali の仮想デジタルヒューマン技術はまだ発展途上にあり、基礎となるソフトウェアとハードウェア、ミドルウェア技術、ビッグデータ支援のいずれもスタートが遅く、多くの課題と障壁に直面しています。
こうした課題やギャップに直面しながらも、Taobao Life における仮想デジタルヒューマン技術の発展に向けて、あらゆる方向から取り組みと挑戦を続けていきます。
まず、Web 技術ベースの最適化です。サーバーレスレンダリングのクラウドサービスをベースに、EVA Figure(仮想ポートレートレンダリングエンジン)と Puppeteer 技術を組み合わせ、最新の WebGPU や WASM などを活用することで、仮想デジタルヒューマンのレンダリング効果と品質を向上させることができます。また、Alibaba Cloud クラウドサービスチームや大淘宝の Node アーキテクチャチームと連携し、Web 技術におけるクラウドレンダリングプロセスの構築にも積極的に取り組んでいます。Taobao Life のユーザーイメージの全身写真、ショートビデオ、アクションフレーム制作など、非リアルタイムレンダリングタスクへの適用を予定しています。これらのプロダクトは Taobao Life だけでなく、他のビジネスでも利用できます。
次に事業ケイパビリティのアップグレードです。事業と技術が相互に高め合う土壌において、事業ケイパビリティはプラットフォームサービスとして継続的に蓄積され、Alibaba の仮想デジタルヒューマン技術に少しずつ経験を積み重ねています。一部のソリューションをクラウドを通じて商用化し、一般に公開しています。
メタバース、ハイパーリアリズム、XR/6G、ブレインコンピュータインタフェースなどの業界トレンドの影響のもと、今後の Web デジタルヒューマン技術の可能性を展望します。
最後に、Alibaba フロントエンド委員会のグラフィックスインタラクティブ仮想キャラクターチームの皆様が素晴らしい成果を残してくださったおかげで、本記事を完成させることができました。心より感謝申し上げます。仮想キャラクターグループおよび各チームの今後の成果にもご注目ください。

関連記事

特別オファーをもっと見る

  1. ショートメッセージサービス (SMS) とメールサービス

    5 万通のメールパッケージが USD 1.99 から、120 通のショートメッセージが USD 1.00 から

phone お問い合わせ
Hi, I'm Alibaba Cloud AI Assistant!
I can help with questions and solutions.