Platform for AI (PAI) ArtLab の Stable Diffusion Web UI を使い、テキストプロンプトから画像を生成・カスタマイズします。
PAI ArtLab コンソールにログオンします。
背景
Stable Diffusion は、Stability AI が開発した大規模モデルで、テキストプロンプトから画像を生成または修正できます。AUTOMATIC1111 が開発した Stable Diffusion Web UI は、このモデル向けのブラウザーベースのインターフェイスで、プログラマーではないユーザーでも直感的に機能を利用できます。
この直感的な Web UI では、さまざまなプラグインやモデルをロードすることで、最終的な画像をより柔軟にカスタマイズし、コントロールできます。
モデル選択
Object Storage Service (OSS) の適切なディレクトリにモデルをアップロードしてから、Web UI を更新します。モデルは Civitai からダウンロードすることを推奨します。
上記のリンクにアクセスできない場合は、プロキシを設定してから再試行してください。
モデルのドロップダウンリストから、3Guofeng3_v32Light、deliberate_v2、sd_xl_base_1.0 などのモデルを選択します。リストを更新するには、右側の更新ボタンをクリックしてください。
Txt2img
一般的なプロンプト構造
一般的なプロンプトは、次の構造で構成されます:プレフィックス(画質、アートスタイル、カメラエフェクト、照明効果) + 被写体(キャラクターまたはオブジェクト、ポーズ、服装、小道具) + シーン(環境、詳細)。
-
半角括弧
()を使用して、単語の重みを増やします。単語を強調するには、括弧で囲み、コロンと重みの値を追加します (例:(beautiful:1.3))。推奨される重みの範囲は 0.4 から 1.6 です。重みが低すぎると無視され、高すぎると過学習によって画像に歪みが生じる可能性があります。括弧()を重ねて重みを増やすこともできます。追加の括弧 () 1 組ごとに重みが 1.1 倍されます (例:(((cute))))。 -
重み計算式:
(PromptA:weight): 単語の重みを増減します。 1 より大きい値は重みを増やし、 1 より小さい値は重みを減らします。(PromptB):(PromptB:1.1)と同等です。{PromptC} :(PromptC:1.05)と同等です。[PromptD]:(PromptD:0.952)と同等で、重みを減らします。((PromptE))は(PromptE:1.1*1.1)と同等です。{{PromptF}}は(PromptF:1.05*1.05)と同等です。[[PromptG]]は(PromptG:0.952*0.952)と同等です。 -
山括弧
<>を使用して、LoRA およびハイパーネットワークモデルを呼び出します。入力形式は<lora:filename:multiplier>または<hypernet:filename:multiplier>です。 -
プロンプトスケジューリング:
構文
[promptA:promptB:factor]において、factorは promptA から promptB に切り替えるステップの割合を表します。factorの値の範囲は 0 から 1 です。たとえば、a girl holding an [apple:peach:0.9]とa girl holding an [apple:peach:0.2]に同じシード値を使用し、factorを調整することで、非常に類似した画像を生成しつつ、画像内の特定の要素を置き換えるための微調整を行うことができます。factor=0.9の場合、生成された画像では少女が赤いリンゴを持っています。peachへの切り替えが生成プロセスの後半で行われるため、appleの特徴が支配的になります。factor=0.2の場合、画像では少女がピンクの桃を持っています。peachへの切り替えが早い段階で行われるため、peachの特徴がより顕著になります。 -
一般的なプロンプト
ポジティブプロンプト
ネガティブプロンプト
プロンプト
説明
ネガティブプロンプト
説明
HDR, UHD, 8K, 4K
画質を向上させます。
mutated hands and fingers
手や指の奇形を防ぎます。
best quality
画像のディテールを豊かにします。
deformed
変形を防ぎます。
masterpiece
傑作レベルの画像を生成します。
bad anatomy
解剖学的に不自然な構造を防ぎます。
highly detailed
画像のディテールを増やします。
disfigured
外観が損なわれるのを防ぎます。
studio lighting
スタジオ照明を追加して質感を高めます。
poorly drawn face
下手な顔の描写を防ぎます。
ultra-fine painting
超精細なペインティングスタイルを作成します。
mutated
変異を防ぎます。
sharp focus
シャープなピントにします。
extra limb
余分な手足を防ぎます。
physically-based rendering
物理ベースレンダリングを適用します。
ugly
見苦しい結果を防ぎます。
extreme detail description
極めて詳細なディテールを描画します。
poorly drawn hands
下手な手の描写を防ぎます。
vivid colors
画像の色を鮮やかにします。
missing limb
手足の欠損を防ぎます。
(EOS R8, 50 mm, F1.2, 8K, RAW photo:1.2)
プロの写真撮影のような効果を加えます。
floating limbs
浮遊する手足を防ぎます。
ボケ
背景をぼかして被写体を強調します。
disconnected limbs
切断された手足を防ぎます。
スケッチ
スケッチ風のスタイルにします。
malformed hands
奇形の手を防ぎます。
ペインティング
絵画調のスタイルにします。
out of focus
ピンボケを防ぎます。
-
-
long neck
長い首を防ぎます。
-
-
long body
長い胴体を防ぎます。
例
-
シンプルなプロンプト:それぞれのフィールドにポジティブプロンプトとネガティブプロンプトを入力します。より詳細なプロンプトを記述すると、意図をより正確に反映した画像を生成できます。
Web UI では、ポジティブプロンプトとネガティブプロンプトの入力ボックスはインターフェイスの上部にあり、その右側に [生成] ボタンがあります。プロンプトが入力されていない場合、両方の入力ボックスは空です。
例えば、シンプルなプロンプト 「cat」 を入力して [生成] をクリックすると、サンプリングメソッド
Euler a、サンプリングステップ 20、画像サイズ 512×512、CFG スケール7 の設定で猫の画像が生成されます。 -
複雑なプロンプト:
-
ポジティブプロンプト: 8k portrait of beautiful cyborg with brown hair, intricate, elegant, highly detailed, majestic, digital photography, art by artgerm and ruan jia and greg rutkowski surreal painting gold butterfly filigree, broken glass, (masterpiece, sidelighting, finely detailed beautiful eyes: 1.2), hdr
-
ネガティブプロンプト: canvas frame, cartoon, 3d, ((disfigured)), ((bad art)), ((deformed)),((extra limbs)),((close up)),((b&w)), wired colors, blurry, (((duplicate))), ((morbid)), ((mutilated)), [out of frame], extra fingers, mutated hands, ((poorly drawn hands)), ((poorly drawn face)), (((mutation))), (((deformed))), ((ugly)), blurry, ((bad anatomy)), (((bad proportions))), ((extra limbs)), cloned face, (((disfigured))), out of frame, ugly, extra limbs, (bad anatomy), gross proportions, (malformed limbs), ((missing arms)), ((missing legs)), (((extra arms))), (((extra legs))), mutated hands, (fused fingers), (too many fingers), (((long neck))), Photoshop, video game, ugly, tiling, poorly drawn hands, poorly drawn feet, poorly drawn face, out of frame, mutation, mutated, extra limbs, extra legs, extra arms, disfigured, deformed, cross-eye, body out of frame, blurry, bad art, bad anatomy, 3d render
-
プロンプトのソース: Civitai をご参照ください。
説明このリンクにアクセスできない場合は、プロキシを設定してから再度お試しください。
-
プロンプトの先頭にあるキーワードほど、重く重み付けされます。必要に応じてキーワードを配置できます。例:被写体、媒体、スタイル、アーティスト、Web サイト、解像度、追加の詳細、色、照明。プロンプトでは、これらすべてのグループのキーワードを使用する必要はありません。必要に応じてキーワードを選択し、順序を決めてください。ベースモデルに加えて、事前学習済みモデルには、状況に応じて特定のスタイルを自動的にトリガーしたり、プロンプトの一部を破棄したりする隠し設定が含まれていることがよくあります。
上記のプロンプトから生成された画像は、茶色の髪と金色の蝶の線条細工を持つ美しいサイボーグの8Kポートレートで、高いディテールとHDR効果が特徴です。
-
パラメーター
-
① サンプリング方法
拡散デノイズアルゴリズムのサンプリングモードです。サンプリング方法が異なると、生成される効果も異なります。サンプラー Euler a(一般的)、DPM++ 2S a、DPM++ 2S a Karras は、類似した全体的な構図を生成します。サンプラー Euler、DPM++ 2m、DPM++ 2M Karras も類似した構図を生成します。DDIM の構図スタイルはかなり異なります。

-
② サンプリングステップ
各サンプリングステップで、AI はプロンプトと現在の画像を比較して調整を行います。ステップ数が多いほど、より多くの時間とコンピューティングリソースを消費しますが、必ずしもより良い結果が得られるとは限りません。
実際には、サンプリングステップ数が増加するにつれて、生成される画像は通常、より詳細になります。これはサンプリングモードと密接に関連しています。例えば、Euler a サンプラーを使用する場合、画像の詳細は約 30 から 40 ステップで安定する傾向があります。サンプリングステップをさらに増やしても、新しい詳細は追加されません。


-
③ Hires. fix
2 段階のプロセスを使用します。最初に低解像度で画像を作成し、次にアップスケールして、構図を変更せずに詳細を改善します。このオプションを選択する場合は、Hires steps やノイズ除去強度などのパラメーターを設定する必要があります。
詳細については、「PAI ArtLab を使用して画像をアップスケールする 3 つの方法」をご参照ください。
-
④ [幅]と高さ: 画像のサイズと解像度です。解像度が高いほど、より多くの GPU メモリを消費し、より多くの詳細が生成されます。これらの値を高く設定しすぎないことを推奨します。デフォルト値の 512x512 は、ほとんどの場合に十分です。
-
⑤ バッチカウント
異なるバッチで生成された画像は、詳細が異なる場合があります。値を大きくすると、計算時間が増加します。
-
⑥ バッチサイズ
各バッチで同時に生成される画像の数です。これは大量の GPU メモリを消費します。
バッチサイズを 1 に設定すると、一度に 1 つの画像が生成されます。
バッチサイズを 4 に設定すると、4 つの画像が同時に生成され、2×2 のグリッドに配置されます。
-
⑦ CFG Scale
値が高いほど、出力はよりプロンプトに忠実になります。値が低いほど、AI の創造的な自由度が高まります。
-
⑧ シード
-1 の値は、各生成がランダムであることを示します。他の数値(負の数や小数を含む)に設定すると、同じシード、パラメーター、モデル、GPU を使用して同じ画像を生成できます。
-
⑨ プロンプトまたは最後に生成された画像から生成パラメーターを読み取ります。
-
⑩ プロンプトの内容をクリアします。
Img2img
img2img 機能は、テキストプロンプトに基づいて画像を別の画像に変換します。たとえば、実写写真をアニメキャラクターに変換したり、線画に色を付けたりできます。また、パラメーター調整とインペインティングにも対応しており、特定の領域を修正または描き直すことも可能です。
生成された画像はイテレーションしたり、一部を編集したりでき、他の機能でも使用できます。2 つの AI モデルが、入力画像からプロンプト用語を自動的に生成できます。CLIP (リアルなスタイル向け) と DeepBooru (アニメスタイル向け) です。
以下の各セクションで、この機能の使用方法を説明します。
Img2img
スケッチ
インペイント
インペイントスケッチ
インペイントアップロード
バッチ
以下のセクションでは、パラメーターについて説明します。
Img2img とスケッチのパラメーター
インペイント のパラメーター
インペイント (スケッチ) のパラメーター
画像情報
Stable Diffusion で生成された画像をアップロードすると、その作成に使用されたプロンプトとパラメーターを確認できます。
[画像情報] ページでは、アップロードした AI 生成画像が左側に、その完全な生成パラメーターが右側に表示されます。これには、ポジティブプロンプト、ネガティブプロンプト、サンプリングメソッド (Euler a)、サンプリングステップ (20)、CFG Scale (7)、シード値、モデル名などの情報が含まれます。下部には、[txt2img に送信] などのショートカットボタンがあります。
生成情報は、スクリーンショットや、他のアプリケーション経由で転送された画像からは読み取れません。
このような画像をアップロードすると、システムは画像から生成パラメーターを解析できないため、右側の [パラメーター] ペインは空になります。
ControlNet プラグイン
PAI-ArtLab では、TheMisto.ai の MistoLine-SDXL-ControlNet プラグインが、Stable Diffusion WebUI および ComfyUI のさまざまなバージョンで利用できます。
パラメーター
|
パラメーター |
説明 |
|
有効 |
このチェックボックスを選択して ControlNet を有効にします。 |
|
低 VRAM |
デバイスの VRAM が 4 GB 未満の場合は、これを選択します。 |
|
プリプロセッサ |
プリプロセッサが異なると、生成される効果も異なります。各プリプロセッサは、対応するモデルと一緒に使用する必要があります。 |
|
モデル |
選択したプリプロセッサに対応するモデルです。モデルを手動でダウンロードし、対応する OSS ディレクトリにアップロードする必要があります。 |
|
制御の重み |
生成画像に対する ControlNet の影響の重みを指定します。img2img プロセスでは、低いノイズ除去強度と高い制御の重みを組み合わせると、フィルターとスタイルを変更しながら画像の詳細が保持されます。逆に、高いノイズ除去強度と低い制御の重みを組み合わせると、画像の詳細が変更されます。 |
|
制御の開始ステップ |
0 から 1 の値で、総サンプリングステップのパーセンテージとして ControlNet ガイダンスの開始を指定します。値が 0 の場合、ガイダンスは最初のステップから開始され、1 の場合は最後のステップで開始されます。値が高いほど、ControlNet が最終画像に与える影響は小さくなります。 例えば、サンプリングステップを 20 に設定し、制御の開始ステップを 0.3 に設定すると、ControlNet はステップ 6 (20 × 0.3) からガイダンスを開始します。 |
|
制御の終了ステップ |
0 から 1 の値で、総サンプリングステップのパーセンテージとして ControlNet ガイダンスの終了を指定します。 |
|
コントロールタイプ |
|


























