AI Portrait Approaches the Real World

ガイド付き読書

ユーザー生成コンテンツ(UGC)は、インターネット上のマルチモーダルコンテンツの重要な構成要素です。UGC データの継続的な成長は、ほとんどのマルチモーダルコンテンツプラットフォームの繁栄を促進しています。大量のマルチモーダルデータとディープラーニングモデルを活用することで、AI 生成コンテンツ(AIGC)は爆発的な成長を示しています。中でもテキストから画像生成タスクは、与えられたテキストに対応する画像を生成することを目的とした人気のクロスモーダル生成タスクです。代表的なテキストから画像生成モデルとして、OpenAI が開発した DALL-E や DALL-E2 があります。最近では、Google が提案した Parti や Imagen、拡散モデルに基づく Stable Diffusion など、より大規模で新しいテキストから画像生成モデルが業界でもトレーニングされています。

しかし、上記のモデルは一般的に中国語の要求に対応できず、パラメータ数が膨大なため、オープンソースコミュニティのほとんどのユーザーがファインチューニングや推論に直接使用することは困難です。また、テキストから画像生成モデルのトレーニングプロセスでは知識の理解が不足しており、常識に反するコンテンツが生成されやすいという問題があります。そこで今回、EasyNLP オープンソースフレームワークでは、Transformer ベースのテキストから画像生成モデル(こちらを参照)に加えて、ナレッジグラフの豊富な知識を組み込んだテキストから画像生成モデル ARTIST を導入しました。ナレッジグラフのガイダンスの下、より常識に合致した画像を生成できます。ARTIST の生成効果を中国語テキストから画像生成評価ベンチマーク MUGE で評価したところ、その生成効果はランキングで 1 位を獲得しました。また、知識強化型中国語テキストから画像生成モデルのチェックポイントと、対応するファインチューニングおよび推論インターフェイスをオープンソースコミュニティに無料で公開しています。ユーザーは公開されたチェックポイントに基づいて少量のドメイン固有のファインチューニングを行い、大量の計算リソースを消費せずにワンクリックでさまざまな芸術的創作を行えます。

EasyNLP( https://github.com/alibaba/EasyNLP )は、Alibaba Cloud 機械学習 PAI チームが PyTorch をベースに開発した、使いやすく充実した中国語 NLP アルゴリズムフレームワークです。標準的な中国語事前学習モデルと中国語モデルのデプロイメント技術を提供し、トレーニングからデプロイメントまでの中国語ワンストップ型 NLP 開発体験を提供します。EasyNLP は、NLP AppZoo や事前学習 Model Zoo を含むシンプルなインターフェイスを提供し、大規模事前学習モデルをビジネスに効率的に適用するための技術サポートを提供します。クロスモーダル理解の需要の高まりに伴い、EasyNLP はさまざまなクロスモーダルモデル、特に中国語分野のモデルをオープンソースコミュニティに公開しており、より多くの NLP およびマルチモーダルアルゴリズム開発者や研究者にサービスを提供し、コミュニティと共に NLP / マルチモーダル技術の発展とモデルの実用化を推進することを期待しています。

本記事では、ARTIST の技術的解説と、EasyNLP フレームワークでの ARTIST モデルの使い方を簡単に紹介します。

ARTIST モデルの詳細

ARTIST モデルは Transformer モデルをベースに構築されており、テキストから画像生成タスクは 2 つのフェーズに分かれています。第 1 フェーズでは、VQGAN モデルを通じて画像をベクトル量子化します。つまり、入力画像をエンコーダーで固定長の離散シーケンスにエンコードし、デコードフェーズではその離散シーケンスを入力として再構成画像を出力します。第 2 フェーズでは、テキストシーケンスとエンコードされた画像シーケンスを入力とし、GPT モデルを使用してテキストシーケンスに基づく画像シーケンス生成を学習します。モデルの事前知識を強化するため、Word Lattice Fusion Layer(単語格子融合層)を設計し、ナレッジグラフ内のエンティティ知識をモデルに導入して、画像内の対応するエンティティの生成を支援することで、生成画像のエンティティ情報をより正確にします。以下の図は ARTIST モデルのシステムブロック図です。テキストから画像生成の全体的なプロセスと知識注入の 2 つの観点から紹介します。

第 1 フェーズ:VQGAN ベースの画像ベクトル量子化

VQGAN のトレーニングフェーズでは、画像再構成をタスク目標として、画像辞書のコードブックをトレーニングします。このコードブックには各イメージトークンのベクトル表現が格納されています。実際には、画像に対して CNN Encoder でエンコードして中間特徴ベクトルを取得し、特徴ベクトルの各エンコード位置についてコードブック内の最も近い表現を見つけることで、画像をコードブック内のイメージトークンで表される離散シーケンスに変換します。第 2 フェーズでは、GPT モデルがテキストに基づいて画像シーケンスを生成し、そのシーケンスを VQGAN Decoder に入力して画像を再構成します。

第 2 フェーズ:テキストシーケンスを入力とした GPT による画像シーケンス生成

ナレッジグラフの知識をテキストから画像生成モデルに組み込むため、まず中国語ナレッジグラフ CN-DBpedia を TransE で学習し、ナレッジグラフ内のエンティティ表現を取得しました。GPT モデルのトレーニングフェーズでは、テキスト入力に対してまずすべてのエンティティを識別し、学習済みのエンティティ表現をトークンエンベディングと組み合わせてエンティティ表現を強化します。ただし、各テキストトークンは複数のエンティティに属する可能性があるため、すべてのエンティティ表現をモデルに導入すると知識ノイズが発生する可能性があります。そこで、エンティティ表現インタラクションモジュールを設計しました。各エンティティ表現とトークンエンベディングの間のインタラクションを計算することで、すべてのエンティティ表現に重みを付けて選択的に知識を注入します。具体的には、各エンティティ表現の現在のトークンエンベディングに対する重要度を内積で計算し、エンティティ表現の重み付き平均値を現在のトークンエンベディングに注入します。計算プロセスは以下の通りです。

知識注入後のトークンエンベディングを取得した後、レイヤー正規化を持つセルフアテンションネットワークを構築することで、Transformer ベースの GPT モデルを構築します。プロセスは以下の通りです。

GPT モデルのトレーニングフェーズでは、テキストシーケンスと画像シーケンスを結合して入力とします。テキストシーケンスを w とすると、生成画像のイメージトークンで表現される離散シーケンスの確率は以下のようになります。

最後に、画像部分の負の対数尤度を最大化することでモデルをトレーニングし、モデルパラメータの値を取得します。

ARTIST モデルの効果

標準データセット評価結果

いくつかの中国語データセットで ARTIST モデルの効果を評価しました。これらのデータセットの統計データは以下の通りです。

ベースラインとして、ゼロショット学習と標準ファインチューニングの 2 つのケースを検討しました。ゼロショット学習では 40 億パラメータを持つ中国語 CogView モデルを使用しました。また、ARTIST モデルと同等規模の DALL-E モデルと OFA モデルも検討しました。実験データは以下の通りです。

上記から、非常に少ないパラメータ(202M)でも、テキストから画像生成のより良い効果を実現できることがわかります。知識注入の有効性を測定するため、知識モジュールを除去した関連評価をさらに実施しました。実験結果は以下の通りです。

上記の結果は、知識注入の役割を明確に示しています。

ケース分析

ARTIST とベースラインモデルが生成する画像の品質を異なるシナリオでより直接的に比較するため、各モデルが生成した画像の効果を E コマース商品シナリオと自然風景シナリオで示します。

E コマースシーンの効果比較

自然風景シーンの効果比較

上記の図は ARTIST の画質の優位性を示しています。さらに、以前に公開したモデル(こちらを参照)と知識強化型 ARTIST モデルの効果を比較しました。最初の例「手作りアンティーク復元髪飾り 漢服アクセサリー 宮廷髪飾り パール髪飾り 髪冠」では、元の生成結果は主にパールの髪冠を強調していました。ARTIST モデルでは、「アンティークスタイル」などの単語の知識注入プロセスにより、モデルの生成結果が中国古代のパール髪飾りに傾いています。

入力:手作りアンティーク復元髪飾り 漢服アクセサリー 宮廷髪飾り パール髪飾り 髪冠

知識注入なしモデル

ARTIST

2 つ目の例は「緑色のカリフラワーが育っている」です。モデルはトレーニング中に「カリフラワー」という対象物のスタイルに関する十分な知識を持たないため、知識注入モジュールを含まない場合、「緑色」と「野菜」という手がかりに基づいて、大きな緑の葉を持つ単一の植物を生成します。ARTIST モデルでは、生成される対象物はカリフラワーのような楕円形の植物に近くなっています。

緑色のカリフラワーが育っている

知識注入なしモデル

MUGE リストでの ARTIST モデルの評価結果

MUGE(Multimodal Understanding and Generation Evaluation、リンク)は、業界初の大規模中国語マルチモーダル評価ベンチマークであり、テキストベースの画像生成タスクを含んでいます。今回紹介した ARTIST モデルを使用して、上記のテキストから画像生成モデルの中国語 MUGE 評価リストでの効果を検証しました。下の図から、ARTIST モデルが生成した画像は FID 指標(Frechet Inception Distance、値が低いほど生成される画像の品質が高い)でリスト上の他の結果を上回っていることがわかります。

ARTIST モデルの実装

EasyNLP フレームワークでは、モデルレベルで ARTIST モデルのバックボーンを構築しました。主に GPT です。入力はそれぞれトークン ID と含まれるエンティティのエンベディングで、出力は画像の各パッチに対応する離散シーケンスです。

ARTIST モデルのアプリケーションチュートリアル

ここでは、EasyNLP フレームワークで ARTIST モデルを使う方法を簡単に紹介します。

EasyNLP のインストール

ユーザーは GitHub( https://github.com/alibaba/EasyNLP )を参照して、指示に従い EasyNLP アルゴリズムフレームワークを直接インストールできます。

データ準備

1. 独自のデータを準備し、画像を base64 フォーマットでエンコードします。特定分野での ARTIST の適用にはファインチューニングが必要で、ユーザーはダウンストリームタスク用のトレーニングデータと検証データを TSV ファイルとして準備する必要があります。このファイルはタブ区切りの 3 列(idx、text、imgbase64)を含みます。第 1 列はテキスト番号、第 2 列はテキスト、第 3 列は対応する画像の base64 エンコーディングです。

2. 入力データを Word Lattice とエンティティ位置情報で結合します。出力フォーマットはタブ文字で区切られたいくつかの列(idx、text、lex_ids、pos_s、pos_e、seq_len、[オプション] imgbase64)です。

Alibaba Cloud 機械学習プラットフォーム PAI で Transformer を使用したテキストから画像生成

PAI-DSW(Data Science Workshop)は、Alibaba Cloud 機械学習プラットフォーム PAI が開発したクラウドベース IDE です。さまざまなレベルの開発者にインタラクティブなプログラミング環境(ドキュメント)を提供します。DSW Gallery では、さまざまな Notebook サンプルが提供されており、ユーザーが DSW を簡単に学習し、さまざまな機械学習アプリケーションを構築できます。DSW Gallery でサンプル Notebook(下の図を参照)も公開しており、Transformer モデルを使用して中国語のテキストから画像を生成します。ぜひ体験してください。

今後の展望

今回の作業では、EasyNLP フレームワークにおける Transformer ベースの中国語テキストから画像生成機能を拡張し、リソースが限られた状況でもオープンソースコミュニティのユーザーが小規模なドメイン固有のファインチューニングとさまざまな芸術的創作を行えるよう、モデルのチェックポイントを公開しました。今後は、EasyNLP フレームワークでさらに関連モデルを公開する予定ですので、ご期待ください。また、EasyNLP フレームワークにさらに多くの SOTA モデル(特に中国語モデル)を統合し、さまざまな NLP およびマルチモーダルタスクをサポートしていきます。さらに、Alibaba Cloud 機械学習 PAI チームは中国語マルチモーダルモデルの自主開発を継続的に推進しています。ユーザーの皆様の継続的なご注目と、オープンソースコミュニティへの参加をお待ちしております。共に中国語 NLP およびマルチモーダルアルゴリズムライブラリを構築しましょう。

Related Articles

Explore More Special Offers

  1. Short Message Service(SMS) & Mail Service

    50,000 email package starts as low as USD 1.99, 120 short messages start at only USD 1.00

phone お問い合わせ
Hi, I'm Alibaba Cloud AI Assistant!
I can help with questions and solutions.