All Products
Search
Document Center

Platform For AI:LVM-Image-Caption Mapper (DLC)

Last Updated:Jul 24, 2026

Komponen LVM-Image-Caption Mapper (DLC) menghasilkan keterangan berbahasa alami untuk gambar yang disimpan di Object Storage Service (OSS) menggunakan model BLIP (Bootstrapping Language-Image Pre-training). Komponen ini menggabungkan visi komputer dan pemrosesan bahasa alami untuk mengotomatiskan pembuatan keterangan pada set data gambar berskala besar.

Kasus penggunaan umum meliputi pengindeksan image search, pembuatan deskripsi produk e-commerce, pembuatan konten media sosial, alat aksesibilitas bagi pengguna tunanetra, serta rilis berita.

Sumber daya komputasi yang didukung

Deep Learning Containers (DLC)

Cara kerja

  1. Baca data gambar dari direktori OSS menggunakan komponen Read File Data, atau hubungkan komponen preprocessing gambar apa pun sebagai input hulu.

  2. Pada eksekusi pertama, komponen menghasilkan file metadata meta.jsonl di direktori induk dari path OSS yang Anda tentukan. Eksekusi berikutnya dapat langsung mereferensikan file ini alih-alih direktori gambar.

  3. Komponen menjalankan proses captioning berbasis BLIP pada setiap gambar dan menuliskan hasilnya ke direktori output OSS dalam bentuk file JSONL.

Konfigurasi komponen

Konfigurasikan komponen LVM-Image-Caption Mapper (DLC) di Machine Learning Designer menggunakan parameter berikut.

Penting

Pilih tipe instans GPU untuk komponen ini. Model BLIP memerlukan komputasi GPU.

Port input

Parameter

Wajib

Tipe

Deskripsi

Image Data OSS Path

Tidak

OSS path

Direktori OSS yang berisi data gambar, atau file metadata meta.jsonl yang dihasilkan dari eksekusi sebelumnya. Jika tidak ada komponen hulu yang terhubung pada eksekusi pertama, tentukan path ini secara manual. Komponen akan menghasilkan meta.jsonl di direktori induk dari path yang Anda tentukan.

Port output

Parameter

Wajib

Tipe

Bawaan

Deskripsi

OSS Directory for Saving OutputData

Tidak

OSS path

Direktori OSS tempat hasil disimpan. Direktori tersebut berisi dua file: {name}.jsonl (output keterangan) dan dj_run_yaml.yaml (konfigurasi parameter waktu proses).

Output Filename

Tidak

String

result.jsonl

Nama file untuk output keterangan.

Pengaturan parameter

Parameter

Wajib

Tipe

Rentang

Bawaan

Deskripsi

Number of Candidate Captions

Ya

Integer

≥ 1

1

Jumlah kandidat keterangan yang dihasilkan per gambar.

Penyetelan eksekusi

Parameter

Wajib

Bawaan

Deskripsi

Number of Processes

Tidak

4

Jumlah proses.

Single-node or Multi-node

Tidak

single-node

Mode single-node atau multi-node. Nilai bawaan: single-node. Mode multi-node hanya mendukung framework Ray.

Select Resource Group

Tidak

Pilih kelompok sumber daya publik atau kuota sumber daya (jika menggunakan mode terdistribusi, Anda harus mengatur parameter sumber daya untuk node head dan node pekerja secara terpisah):

  • Public resource group: Anda harus memilih tipe instans GPU untuk algoritma.

  • Resource quota: pilih jumlah GPU, jumlah vCPU, memori (GB), dan memori bersama (GB).

Maximum Running Duration (seconds)

Tidak

Durasi maksimum komponen dapat berjalan. Pekerjaan akan dihentikan jika batas ini terlampaui.

Langkah selanjutnya

  • Untuk melakukan preprocessing gambar sebelum pembuatan keterangan, hubungkan komponen transformasi gambar ke port input.

  • Untuk menggunakan keterangan yang dihasilkan sebagai data pelatihan, hubungkan port output ke komponen pemrosesan data atau pelatihan model di hilir.