LVM-Image-Caption マッパー (DLC) コンポーネントは、BLIP (Bootstrapping Language-Image Pre-training) モデルを使用して、Object Storage Service (OSS) に保存された画像の自然言語キャプションを生成します。コンピュータービジョンと自然言語処理を組み合わせることで、大規模な画像データセットのキャプション生成を自動化します。
一般的なユースケースには、画像検索のインデックス作成、EC サイトの商品説明生成、ソーシャルメディアのコンテンツ作成、視覚障害者向けアクセシビリティツール、ニュースリリースなどが含まれます。
サポートされるコンピューティングリソース
仕組み
[Read File Data] コンポーネントを使用して OSS ディレクトリから画像データを読み取るか、任意の画像前処理コンポーネントを上流の入力として接続します。
初回実行時、コンポーネントは指定した OSS パスの親ディレクトリにメタデータファイル
meta.jsonlを生成します。後続の実行では、イメージディレクトリの代わりにこのファイルを直接参照できます。コンポーネントは各画像に BLIP ベースのキャプション生成を実行し、結果を JSONL ファイルとして OSS 出力ディレクトリに書き込みます。
コンポーネントの設定
以下のパラメーターを使用して、ビジュアルモデリングで [LVM-Image-Caption マッパー (DLC)] コンポーネントを設定します。
このコンポーネントには GPU インスタンスタイプを選択してください。BLIP モデルは GPU コンピューティングを必要とします。
入力ポート
パラメーター | 必須 | タイプ | 説明 |
[Image Data OSS Path] | いいえ | OSS パス | 画像データを含む OSS ディレクトリ、または前回の実行で生成された |
出力ポート
パラメーター | 必須 | タイプ | デフォルト | 説明 |
[OSS Directory for Saving OutputData] | いいえ | OSS パス | — | 結果の保存先となる OSS ディレクトリです。このディレクトリには、 |
[Output Filename] | いいえ | 文字列 |
| キャプション出力のファイル名。 |
パラメーター設定
パラメーター | 必須 | タイプ | 範囲 | デフォルト | 説明 |
[候補キャプション数] | はい | 整数 | ≥ 1 |
| 画像ごとに生成されるキャプション候補の数。 |
実行チューニング
パラメーター | 必須 | デフォルト | 説明 |
[Number of Processes] | いいえ |
| プロセス数。 |
[Single-node or Multi-node] | いいえ |
| シングルノードモードまたはマルチノードモード。デフォルトは |
[リソースグループを選択] | いいえ | — | パブリックリソースグループまたはリソースクォータを選択します (分散モードを使用する場合は、ヘッドノードとワーカーノードのリソースパラメーターを個別に設定する必要があります):
|
[Maximum Running Duration (seconds)] | いいえ | — | コンポーネントが実行できる最大時間。この制限を超えるとタスクは終了します。 |
次のステップ
キャプション生成前に画像を前処理するには、画像変換コンポーネントを入力ポートに接続します。
生成されたキャプションをトレーニングデータとして使用するには、出力ポートを下流のデータ処理またはモデルトレーニングコンポーネントに接続します。