Komponen LVM-Image-Caption Mapper (DLC) menghasilkan keterangan berbahasa alami untuk gambar yang disimpan di Object Storage Service (OSS) menggunakan model BLIP (Bootstrapping Language-Image Pre-training). Komponen ini menggabungkan visi komputer dan pemrosesan bahasa alami untuk mengotomatiskan pembuatan keterangan pada set data gambar berskala besar.
Kasus penggunaan umum meliputi pengindeksan image search, pembuatan deskripsi produk e-commerce, pembuatan konten media sosial, alat aksesibilitas bagi pengguna tunanetra, serta rilis berita.
Sumber daya komputasi yang didukung
Cara kerja
Baca data gambar dari direktori OSS menggunakan komponen Read File Data, atau hubungkan komponen preprocessing gambar apa pun sebagai input hulu.
Pada eksekusi pertama, komponen menghasilkan file metadata
meta.jsonldi direktori induk dari path OSS yang Anda tentukan. Eksekusi berikutnya dapat langsung mereferensikan file ini alih-alih direktori gambar.Komponen menjalankan proses captioning berbasis BLIP pada setiap gambar dan menuliskan hasilnya ke direktori output OSS dalam bentuk file JSONL.
Konfigurasi komponen
Konfigurasikan komponen LVM-Image-Caption Mapper (DLC) di Machine Learning Designer menggunakan parameter berikut.
Pilih tipe instans GPU untuk komponen ini. Model BLIP memerlukan komputasi GPU.
Port input
Parameter | Wajib | Tipe | Deskripsi |
Image Data OSS Path | Tidak | OSS path | Direktori OSS yang berisi data gambar, atau file metadata |
Port output
Parameter | Wajib | Tipe | Bawaan | Deskripsi |
OSS Directory for Saving OutputData | Tidak | OSS path | — | Direktori OSS tempat hasil disimpan. Direktori tersebut berisi dua file: |
Output Filename | Tidak | String |
| Nama file untuk output keterangan. |
Pengaturan parameter
Parameter | Wajib | Tipe | Rentang | Bawaan | Deskripsi |
Number of Candidate Captions | Ya | Integer | ≥ 1 |
| Jumlah kandidat keterangan yang dihasilkan per gambar. |
Penyetelan eksekusi
Parameter | Wajib | Bawaan | Deskripsi |
Number of Processes | Tidak |
| Jumlah proses. |
Single-node or Multi-node | Tidak |
| Mode single-node atau multi-node. Nilai bawaan: single-node. Mode multi-node hanya mendukung framework Ray. |
Select Resource Group | Tidak | — | Pilih kelompok sumber daya publik atau kuota sumber daya (jika menggunakan mode terdistribusi, Anda harus mengatur parameter sumber daya untuk node head dan node pekerja secara terpisah):
|
Maximum Running Duration (seconds) | Tidak | — | Durasi maksimum komponen dapat berjalan. Pekerjaan akan dihentikan jika batas ini terlampaui. |
Langkah selanjutnya
Untuk melakukan preprocessing gambar sebelum pembuatan keterangan, hubungkan komponen transformasi gambar ke port input.
Untuk menggunakan keterangan yang dihasilkan sebagai data pelatihan, hubungkan port output ke komponen pemrosesan data atau pelatihan model di hilir.