PAI Flow memungkinkan pengembangan alur kerja pembelajaran mesin end-to-end. Fitur ini menyediakan fungsionalitas yang setara dengan Designer pemodelan visual di Platform for AI (PAI) dan mendukung penjadwalan berulang.
Batasan
-
Batasan produk:
-
PAI Flow hanya mendukung DataWorks Workspaces (new version).
-
PAI Flow saat ini hanya mendukung node Source/Target dan RAG Data Processing.
-
PAI Flow hanya mendukung kelompok sumber daya Serverless.
-
-
Batasan wilayah: Wilayah yang didukung meliputi Tiongkok (Hangzhou), Tiongkok (Shanghai), Tiongkok (Beijing), Tiongkok (Ulanqab), Tiongkok (Shenzhen), Tiongkok (Hong Kong), Singapura, Indonesia (Jakarta), Jepang (Tokyo), Jerman (Frankfurt), AS (Silicon Valley), dan AS (Virginia).
Prasyarat
Anda telah membuat ruang kerja DataWorks Data Studio (versi baru) dan ruang kerja Platform for AI (PAI).
-
Saat Anda membuat workspace, pilih Create AI Workspace with Same Name. Sistem secara otomatis membuat dan mengikat workspace Platform for AI (PAI) yang memiliki nama yang sama dengan workspace DataWorks.
-
Untuk workspace yang sudah ada, aktifkan Schedule PAI Nodes di Management Center. Tindakan ini juga membuat workspace Platform for AI (PAI) yang memiliki nama yang sama dengan workspace DataWorks.
Buat PAI Flow
Masuk ke Konsol DataWorks. Di wilayah target, klik di panel navigasi sebelah kiri. Pilih workspace dari daftar drop-down, lalu klik Go to Data Development.
-
Di direktori proyek Data Studio, klik ikon
lalu pilih . Sistem akan membuat node PAI Flow dan mengarahkan Anda ke halaman orkestrasi.
Kembangkan PAI Flow
PAI Flow mendukung berbagai node pemodelan visual untuk merancang alur kerja.
-
Di halaman orkestrasi PAI Flow, seret node dari panel sebelah kiri ke kanvas, lalu hubungkan untuk merancang alur kerja Anda.
-
Setelah menyelesaikan desain alur kerja, klik sebuah node untuk mengonfigurasinya di panel kanan.
Jenis node
Node
Deskripsi node
Source/Target
Membaca data dari tabel MaxCompute. Secara default, membaca data tabel dari proyek saat ini.
Membaca file atau folder dari path
OSS Bucket.Membaca file
CSVdariOSS,HTTP, danHDFS.Menulis data masukan ke
MaxCompute.RAG data processing
RAG Text Parsing and Chunking
Membaca dan mengurai file teks (
HTML,PDF,Markdown,Text, dll.) dari direktori masukan, menghasilkan blok teks kontinu yang tidak lebih besar dari ukuran blok yang ditentukan, lalu menyimpannya dalam formatJSONlineke path output yang ditentukan.RAG Vector Generation
Memuat semua file dokumen yang telah diurai dan dipecah menjadi chunk (
format JSONline) dari direktori yang ditentukan, lalu menggunakan modelEmbeddinguntuk menghasilkan vektor teks.RAG Knowledge Base Index Synchronization
Menyinkronkan data masukan ke indeks basis pengetahuan target.
CatatanSaat mengonfigurasi path file, Anda dapat menyertakan variabel dalam path tersebut, contohnya:
https://examplebucket.oss-cn-hangzhou.aliyuncs.com/${variable}/example.csv. Saat mengonfigurasi variabel, Anda dapat menggunakan parameter penjadwalan sebagai variabel untuk membaca dari atau menulis ke path penyimpanan yang berbeda selama penjadwalan berulang. -
Setelah menyelesaikan pengembangan node, konfigurasikan scheduling settings untuk PAI Flow di bilah alat sebelah kanan agar alur tersebut dijadwalkan secara berkala setelah diterapkan ke lingkungan produksi.
CatatanSaat mengonfigurasi pengaturan penjadwalan, kelompok sumber daya penjadwalan hanya mendukung kelompok sumber daya Serverless.
Publikasikan PAI Flow
Setelah melakukan debugging pada PAI Flow dan mengonfigurasi pengaturan penjadwalan, publikasikan alur kerja PAI Flow. Alur kerja tersebut kemudian akan berjalan secara berkala sesuai jadwal yang telah dikonfigurasi.
-
Klik Save di bilah alat atas untuk menyimpan PAI Flow.
-
Setelah menyimpan perubahan, klik tombol
di bilah alat atas untuk membuka panel penerapan (Deploying a task). Lalu, klik Start Release Production. Tugas tersebut kemudian diterapkan berdasarkan proses pemeriksaan penerapan.
Operasi lainnya
Setelah mempublikasikan PAI Flow, klik Go to operation and maintenance di panel penerbitan untuk menuju ke halaman Recurring tasks, tempat Anda dapat melihat status penjadwalan dan eksekusinya.
Di graf DAG, Anda hanya dapat melihat tugas internal setelah membuka PAI Flow.