すべてのプロダクト
Search
ドキュメントセンター

Platform For AI:LVM-Image-Caption マッパー (DLC)

最終更新日:Jul 24, 2026

LVM-Image-Caption マッパー (DLC) コンポーネントは、BLIP (Bootstrapping Language-Image Pre-training) モデルを使用して、Object Storage Service (OSS) に保存された画像の自然言語キャプションを生成します。コンピュータービジョンと自然言語処理を組み合わせることで、大規模な画像データセットのキャプション生成を自動化します。

一般的なユースケースには、画像検索のインデックス作成、EC サイトの商品説明生成、ソーシャルメディアのコンテンツ作成、視覚障害者向けアクセシビリティツール、ニュースリリースなどが含まれます。

サポートされるコンピューティングリソース

Deep Learning Containers (DLC)

仕組み

  1. [Read File Data] コンポーネントを使用して OSS ディレクトリから画像データを読み取るか、任意の画像前処理コンポーネントを上流の入力として接続します。

  2. 初回実行時、コンポーネントは指定した OSS パスの親ディレクトリにメタデータファイル meta.jsonl を生成します。後続の実行では、イメージディレクトリの代わりにこのファイルを直接参照できます。

  3. コンポーネントは各画像に BLIP ベースのキャプション生成を実行し、結果を JSONL ファイルとして OSS 出力ディレクトリに書き込みます。

コンポーネントの設定

以下のパラメーターを使用して、ビジュアルモデリングで [LVM-Image-Caption マッパー (DLC)] コンポーネントを設定します。

重要

このコンポーネントには GPU インスタンスタイプを選択してください。BLIP モデルは GPU コンピューティングを必要とします。

入力ポート

パラメーター

必須

タイプ

説明

[Image Data OSS Path]

いいえ

OSS パス

画像データを含む OSS ディレクトリ、または前回の実行で生成された meta.jsonl メタデータファイルです。初回実行時に上流コンポーネントが接続されていない場合は、このパスを手動で指定する必要があります。コンポーネントは、指定したパスの親ディレクトリに meta.jsonl を生成します。

出力ポート

パラメーター

必須

タイプ

デフォルト

説明

[OSS Directory for Saving OutputData]

いいえ

OSS パス

—

結果の保存先となる OSS ディレクトリです。このディレクトリには、{name}.jsonl (キャプション出力) と dj_run_yaml.yaml (ランタイムパラメーター設定) の 2 つのファイルが含まれます。

[Output Filename]

いいえ

文字列

result.jsonl

キャプション出力のファイル名。

パラメーター設定

パラメーター

必須

タイプ

範囲

デフォルト

説明

[候補キャプション数]

はい

整数

≥ 1

1

画像ごとに生成されるキャプション候補の数。

実行チューニング

パラメーター

必須

デフォルト

説明

[Number of Processes]

いいえ

4

プロセス数。

[Single-node or Multi-node]

いいえ

single-node

シングルノードモードまたはマルチノードモード。デフォルトはsingle-nodeです。マルチノードモードは Ray フレームワークのみをサポートします。

[リソースグループを選択]

いいえ

—

パブリックリソースグループまたはリソースクォータを選択します (分散モードを使用する場合は、ヘッドノードとワーカーノードのリソースパラメーターを個別に設定する必要があります):

  • [パブリックリソースグループ]: アルゴリズムには GPU インスタンスタイプを選択する必要があります。

  • [リソースクォータ]: GPU 数、vCPU 数、メモリ (GB)、共有メモリ (GB) を選択します。

[Maximum Running Duration (seconds)]

いいえ

—

コンポーネントが実行できる最大時間。この制限を超えるとタスクは終了します。

次のステップ

  • キャプション生成前に画像を前処理するには、画像変換コンポーネントを入力ポートに接続します。

  • 生成されたキャプションをトレーニングデータとして使用するには、出力ポートを下流のデータ処理またはモデルトレーニングコンポーネントに接続します。