トレーニングデータセットには、サイズが小さすぎる (低解像度または破損) または大きすぎる (トレーニングを遅らせる肥大化したファイルサイズ) 画像が含まれていることがよくあります。LVM-Image-Size フィルター (DLC) コンポーネントは、定義したサイズの範囲外にある画像データを除外することで、これらの外れ値を除去し、画像生成モデルのトレーニングデータ品質の維持に役立ちます。
仕組み
このコンポーネントは、各画像のファイルサイズを計算し、設定された最小および最大しきい値と比較します。指定された範囲外の画像は出力から除外され、指定した Object Storage Service (OSS) ディレクトリに書き込まれます。
初回実行時、コンポーネントは画像データパスの親ディレクトリにメタデータファイル (meta.jsonl) を生成します。次回以降の実行では、ディレクトリ全体を再スキャンする代わりに、このファイルを直接指定します。
サポートされるコンピューティングリソース
コンポーネントの設定
Machine Learning Designer のパイプラインに [LVM-Image-Size Filter (DLC)] コンポーネントを追加し、入力ソースを接続して、以下のパラメーターを設定します。
入力ソースの接続
コンポーネントの入力ポートに、以下のいずれかを接続してください。
トレーニングデータが格納されている OSS パスを読み込む[ファイルデータ読み込み]コンポーネント
OSS ディレクトリまたは前回の実行の
meta.jsonlメタデータファイルを指す [画像データ OSS パス]任意のアップストリーム画像前処理コンポーネント
パラメーターの設定
タブ | パラメーター | 必須 | 説明 | デフォルト値 | |
フィールド設定 | Image Data OSS Path | いいえ | 画像データを含む OSS ディレクトリ、または以前の実行で生成された | — | |
出力データ保存用 OSS ディレクトリ | いいえ | フィルタリング結果を保存する OSS ディレクトリ。 | — | ||
出力ファイル名 | いいえ | 出力ファイルのベース名。 |
| ||
パラメーター設定 | 最小サイズ | はい | この値未満の画像はフィルターで除外されます。使用できる単位は KB、MB、GB、TB、PB、EB、ZB、YB です。例: |
| |
最大サイズ | はい | この値より大きい画像はフィルターで除外されます。使用可能な単位: KB、MB、GB、TB、PB、EB、ZB、YB。例: |
| ||
実行チューニング | プロセス数 | いいえ | フィルタリングのための並列プロセス数。 |
| |
シングル/マルチノード | いいえ | シングルノードまたはマルチノードモード。デフォルト値: single-node。マルチノードモードは Ray フレームワークのみをサポートします。 | single-node | ||
リソースグループの選択 | いいえ | パブリックリソースグループまたはリソースクォータを選択してください (分散モードを使用する場合、ヘッドノードとワーカーノードのリソースパラメーターを個別に設定する必要があります):
| — | ||
最大実行時間 (秒) | いいえ | コンポーネント実行の時間制限。この時間を超えるとジョブは停止します。 | — | ||
出力の確認
コンポーネントは、出力データ保存用 OSS ディレクトリ に以下のファイルを書き込みます。
ファイル | 説明 | 使用場面 |
| フィルター処理された画像リスト。ファイル名は [出力ファイル名] で設定されます。 | ダウンストリームのトレーニングまたは前処理ステップの入力として使用します。 |
| 状態ファイル。 | このファイルを確認して、フィルタリングされた画像の数とその理由を把握してください。 |
| 実行中に使用されたパラメーター設定。 | これを使用して、フィルター設定を再現または監査してください。 |