Membuat crawler metadata dan mengonfigurasi sumber data, cakupan koleksi, kelompok sumber daya, serta metode penjadwalan.
Deskripsi operasi
Skenario
Membuat crawler metadata untuk sumber data tertentu dan mengonfigurasi cakupan koleksi, kelompok sumber daya, metode penjadwalan, serta konfigurasi tambahan.
Alur Kerja yang Direkomendasikan
Panggil
GetCrawlerTypeCapabilitiesuntuk mengkueri jenis crawler dan kemampuan konfigurasinya yang didukung di wilayah saat ini.Buat crawler dengan menggunakan sumber data yang sesuai dengan nilai
Type. Sebelum membuat crawler, pastikan bahwa sumber data dan kelompok sumber daya yang dipilih lulus uji konektivitas dengan memanggil APITestDataSourceConnectivityuntuk menghindari pembuatan crawler yang tidak valid.Setelah crawler dibuat, panggil
RunCrawleruntuk menjalankannya secara manual, atau konfigurasikan penjadwalan berkala untuk eksekusi otomatis.
Persyaratan Edisi
Memerlukan DataWorks Edisi Dasar atau edisi yang lebih tinggi.
Perhatian
Pembuatan yang berhasil hanya menunjukkan bahwa konfigurasi crawler telah dihasilkan. Koleksi metadata tidak langsung dieksekusi.
Coba sekarang
Test
RAM authorization
|
Action |
Access level |
Resource type |
Condition key |
Dependent action |
|
dataworks:CreateCrawler |
create |
*Semua Sumber daya.
|
None | None |
Sintaks permintaan
POST HTTP/1.1
Parameter permintaan
|
Parameter |
Type |
Required |
Description |
Example |
| Name |
string |
Yes |
Nama crawler metadata. Panjang nama dapat mencapai 128 karakter. |
example_crawler |
| DataSourceId |
integer |
Yes |
ID sumber data yang terkait dengan crawler. Sumber data harus terikat ke ruang kerja DataWorks, dan tipe sumber data harus sesuai dengan nilai Type. |
12345 |
| Type |
string |
Yes |
Tipe crawler. Panggil GetCrawlerTypeCapabilities untuk mengkueri nilai valid yang didukung di wilayah saat ini. |
starrocks |
| ResourceGroupId |
string |
No |
ID kelompok sumber daya Serverless 2.0 yang digunakan untuk menjalankan tugas koleksi. Apakah parameter ini diperlukan bergantung pada nilai RequireResourceGroup yang dikembalikan oleh GetCrawlerTypeCapabilities. |
Serverless_kelompok_1234567890123456_1234567890 |
| Scope |
object |
No |
Konfigurasi cakupan koleksi. Jika parameter ini tidak ditentukan, nilai DefaultScopeUnit yang dikembalikan oleh GetCrawlerTypeCapabilities akan digunakan. |
|
| Unit |
string |
Yes |
Granularitas cakupan koleksi. Nilai valid ditentukan oleh nilai SupportedScopeUnits yang dikembalikan oleh GetCrawlerTypeCapabilities. |
DATABASE |
| Items |
array |
No |
Daftar nama database. Parameter ini hanya didukung ketika Unit diatur ke DATABASE. Maksimal 1000 entri diperbolehkan. Nama tidak boleh kosong atau duplikat. |
|
|
string |
No |
Satu nama database. Panjang nama dapat mencapai 256 karakter. |
example_database |
|
| ExcludeRegex |
string |
No |
Ekspresi reguler yang digunakan untuk mengecualikan objek dari cakupan koleksi. Parameter ini hanya didukung ketika nilai SupportExcludeRegex yang dikembalikan oleh GetCrawlerTypeCapabilities adalah true. |
^tmp_.* |
| ScheduleConfig |
object |
No |
Konfigurasi penjadwalan. Jika parameter ini tidak ditentukan, penjadwalan manual akan digunakan. |
|
| Type |
string |
Yes |
Tipe penjadwalan. MANUAL menunjukkan eksekusi manual, dan NORMAL menunjukkan penjadwalan berkala. Sumber data di lingkungan pengembangan hanya mendukung MANUAL. Ketersediaan NORMAL bergantung pada nilai SupportSchedule yang dikembalikan oleh GetCrawlerTypeCapabilities. |
NORMAL |
| CronExpress |
string |
No |
Ekspresi cron enam bidang untuk penjadwalan berkala. Parameter ini diperlukan ketika Type diatur ke NORMAL. Bidang detik harus 0, dan frekuensi penjadwalan tidak boleh melebihi sekali per jam. |
0 0 2 ? * * |
| EnableAiComment |
boolean |
No |
Apakah akan mengaktifkan deskripsi metadata AI. Parameter ini hanya didukung ketika nilai SupportAiComment yang dikembalikan oleh GetCrawlerTypeCapabilities adalah true. |
|
| Options |
object |
No |
Konfigurasi tambahan untuk tipe crawler. Nama kunci, tipe nilai, bidang yang diperlukan, nilai default, dan nilai valid ditentukan oleh nilai SupportedOptionKeys yang dikembalikan oleh GetCrawlerTypeCapabilities. |
|
|
string |
No |
Nilai dari satu item konfigurasi tambahan untuk crawler. Item konfigurasi yang didukung, tipe nilai, dan rentang nilai ditentukan oleh nilai SupportedOptionKeys yang dikembalikan oleh GetCrawlerTypeCapabilities. |
v1 |
DataSourceId harus sesuai dengan nilai Type. Dukungan untuk ResourceGroupId, Scope, ScheduleConfig, EnableAiComment, dan Options bergantung pada GetCrawlerTypeCapabilities.
Elemen respons
|
Element |
Type |
Description |
Example |
|
object |
Parameter tanggapan. |
||
| RequestId |
string |
ID permintaan. Digunakan untuk mencari log dan memecahkan masalah. |
9252F32F-D855-549E-8898-61CF5A733050 |
| Success |
boolean |
Menunjukkan apakah permintaan berhasil. |
|
| Id |
integer |
ID crawler metadata yang baru dibuat. |
1234 |
Id adalah ID crawler metadata yang baru dibuat. Tanggapan yang berhasil tidak menunjukkan bahwa koleksi metadata telah selesai.
Contoh
Respons sukses
JSONformat
{
"RequestId": "9252F32F-D855-549E-8898-61CF5A733050",
"Success": false,
"Id": 1234
}
Kode kesalahan
Lihat Error Codes untuk daftar lengkap.
Catatan rilis
Lihat Release Notes untuk daftar lengkap.