Anda dapat menggunakan pernyataan SQL untuk mengkueri dan menganalisis data secara cepat dari sumber data seperti MaxCompute, EMR Hive, dan Hologres. Topik ini menjelaskan cara mengkueri sumber data menggunakan pernyataan SQL.
DataWorks merekomendasikan Anda mencoba versi terbaru Analisis Data untuk mengakses fitur-fitur terbaru dan menikmati pengalaman pengguna yang lebih baik.
Sumber data yang didukung
Fitur kueri SQL mendukung sumber data berikut: MaxCompute, Hologres, EMR, CDH, StarRocks, ClickHouse, SelectDB, Doris, AnalyticDB for MySQL 3.0, AnalyticDB for PostgreSQL, Tablestore, MySQL, PostgreSQL, Oracle, dan SQL Server.
Fitur ini hanya mendukung sumber data yang telah ditambahkan ke ruang kerja.
Izin sumber data
Cakupan sumber data
Anda hanya dapat mengkueri data dari sumber data dalam ruang kerja yang memiliki izin akses. Hubungi administrator untuk menambahkan Anda ke ruang kerja sebagai analis data, perancang model, developer, operator, administrator ruang kerja, atau pemilik proyek.
Izin akses sumber data
Akses sumber data mendukung dua mode identitas berikut.
Mode identitas akses | Deskripsi | Sumber data yang didukung | Otorisasi |
Executor Identity | Akun Alibaba Cloud yang saat ini masuk ke DataWorks. | MaxCompute dan Hologres. | Minta administrator proyek MaxCompute atau instans Hologres yang ditentukan untuk memberikan Anda izin akses sebagai anggota. |
Data Source Default Access Identity | Identitas akses yang dikonfigurasi saat sumber data dibuat. | Semua sumber data. | Jika akun logon Anda saat ini bukan identitas akses default sumber data tersebut, mintalah pengguna dengan peran administrator ruang kerja untuk memberikan akses ke akun Alibaba Cloud Anda saat ini. |
Jika proyek MaxCompute telah mengaktifkan kontrol akses berbasis daftar izin (allowlist), tambahkan alamat IP yang diperlukan ke daftar izin IP proyek MaxCompute tersebut.
Mengakses fitur
Masuk ke Analisis Data DataWorks, alihkan ke wilayah target, lalu klik Enter Data Analysis.
Jika Anda melihat Switch to New DataAnalysis di bilah navigasi, berarti Anda telah memasuki halaman Analisis Data versi legacy.
(Tidak direkomendasikan) Jika Anda melihat Return to Legacy DataAnalysis di bilah navigasi, klik tombol tersebut untuk kembali ke halaman Analisis Data versi legacy.
Langkah 1: Tambahkan direktori
Anda dapat menambahkan tabel dari direktori yang direkomendasikan sistem dan sumber data yang telah diotorisasi ke direktori Anda. Setelah menambahkan direktori, Anda dapat dengan cepat melihat tabel dalam direktori tersebut, melihat skema tabel, serta menghasilkan kueri SQL.
Pada halaman analisis SQL, klik tombol
di sebelah kanan kotak pencarian di atas direktori untuk menambahkan direktori.DataMap - Metadata: Metadata tabel yang dikumpulkan di Peta Data. Setiap sumber data atau resource komputasi dapat ditambahkan sebagai dataset.
DataMap - Data Album: Koleksi Data yang menggabungkan tabel berdasarkan topik tertentu di Peta Data. Setiap Koleksi Data dapat ditambahkan sebagai dataset.
My Favorites: Tabel yang telah Anda tandai favorit di Peta Data.
My MaxCompute Tables: Semua tabel MaxCompute yang pemiliknya adalah akun logon saat ini.
Public Data: Dataset publik yang disediakan oleh MaxCompute, yang dapat digunakan untuk dengan cepat menghasilkan data uji.
CatatanAnda dapat menambahkan hingga 12 dataset. Dataset yang tidak lagi diperlukan dapat dihapus.
Langkah 2: Buat kueri SQL
Kueri berdasarkan katalog data
Setelah Anda menambahkan direktori data, dataset yang sesuai akan ditampilkan dalam pohon direktori di sebelah kiri.
Di pohon direktori sebelah kiri, klik untuk membuka dataset yang telah ditambahkan (misalnya, tabel MaxCompute saya).
Klik kanan nama tabel yang ingin Anda analisis, lalu pilih Generate SQL Statement dari menu konteks. Pernyataan SQL yang direkomendasikan berdasarkan tabel tersebut akan secara otomatis dihasilkan sebagai file temporary.
Modifikasi pernyataan SQL sesuai kebutuhan, lalu klik Save untuk menyimpan file temporary ke My Files.
Kueri berdasarkan sumber data
Di pohon direktori sebelah kiri, arahkan kursor ke My Files, lalu klik tombol
di sebelah kanan untuk membuat file.Tulis pernyataan kueri SQL di file baru tersebut, lalu simpan ke My Files.
CatatanSaat Anda mengedit pernyataan SQL, DataWorks secara otomatis menyarankan tabel yang Anda miliki izinnya di MaxCompute.
Kueri berdasarkan SQL yang dibagikan
Di pohon direktori sebelah kiri, klik Shared Files untuk melihat file SQL yang dibagikan oleh pengguna lain. Klik file SQL tersebut, lalu pada halaman detail di sebelah kanan, klik Copy SQL.
Kueri berdasarkan dataset publik
Setelah Anda menambahkan dataset publik ke direktori, klik dataset tersebut. Di bilah atas halaman detail di sebelah kanan, Anda dapat memilih engine berbeda untuk Generate SQL Statement. Anda dapat menggunakan dataset publik untuk pengujian.
Langkah 3: Konfigurasikan mesin kueri dan jalankan kueri
Klik tombol
di pojok kanan atas halaman detail SQL untuk mengonfigurasi engine kueri SQL.Parameter
Deskripsi
Workspace
Ruang kerja tempat mesin eksekusi berada.
PentingPastikan Anda memiliki izin akses ke ruang kerja tersebut. Jika tidak, hubungi administrator ruang kerja untuk menambahkan Anda sebagai anggota ruang kerja.
Datasource Type
Jenis dan nama mesin eksekusi.
PentingJika tidak ada proyek spesifik yang ditentukan dalam pernyataan SQL, mesin eksekusi akan menjadi sumber data default.
Data Source Name
Access Identity Mode
Pilih mode akses untuk kueri SQL:
Executor Identity: Hanya didukung untuk engine MaxCompute dan Hologres. Mode ini direkomendasikan jika Anda adalah anggota proyek MaxCompute atau instans Hologres dan memiliki izin SELECT.
Data Source Default Access Identity: Jika akun Anda saat ini berbeda dari identitas akses default yang dikonfigurasi saat sumber data dibuat, berikan identitas tersebut ke akun Anda saat ini.
Setelah menulis pernyataan SQL, Anda dapat langsung menjalankan seluruh skrip atau memilih bagian tertentu untuk menjalankan sebagian. Klik ikon drop-down
di sebelah tombol run untuk mengganti mode run. Anda dapat memilih mode berbeda untuk skenario berbeda.Sebelum pernyataan SQL MaxCompute dijalankan, perkiraan biaya akan ditampilkan. Anda juga dapat mengklik di bilah alat di atas file SQL untuk memperkirakan biaya.
Run Mode
Skenario
Kondisi pemicu
Engine yang berlaku
Query mode (LIMIT 10000)
Pratinjau data dengan cepat dan verifikasi logika kueri. Mode ini cocok untuk skenario di mana Anda hanya ingin melihat sampel hasil kecil untuk eksplorasi data awal.
Hasil kueri menampilkan ≤ 10.000 baris dan ≤ 10 MB.
Tidak ada batasan
Query mode (full data)
Mendapatkan set hasil lengkap untuk analisis atau ekspor. Alihkan ke mode ini ketika Anda perlu memproses dan melihat semua data.
Hasil kueri menampilkan > 10.000 baris atau > 10 MB.
MaxCompute,Hologres,StarRocks,ClickHouse,MySQLTemporary table mode
Gunakan kembali hasil dalam kueri kompleks multi-langkah. Gunakan output dari satu kueri sebagai input kueri berikutnya untuk meningkatkan efisiensi pengembangan dan debugging.
Hasil kueri menampilkan ≤ 10.000 baris dan ≤ 10 MB, serta secara otomatis ditulis ke tabel temporary.
Hanya
MaxComputeSetelah pernyataan SQL dieksekusi, Anda dapat melihat log waktu proses, hasil, dan pernyataan SQL yang sesuai pada halaman hasil kueri.
Anda dapat mengklik tombol di pojok kanan atas area hasil kueri untuk mengganti tata letak halaman antara tampilan berdampingan dan atas-bawah.
Langkah 4: Visualisasikan hasil kueri
Di bilah alat sebelah kiri hasil kueri, klik tombol untuk secara otomatis menghasilkan grafik visual dari hasil tersebut.
Anda dapat mengklik tombol Copilot di atas grafik untuk mencoba fitur Copilot.
Langkah 5: Ekspor dan bagikan
Jika Anda perlu mengekspor data ke mesin lokal lalu mengimpornya ke sumber data lain, kami merekomendasikan Anda menggunakan Data Integration tugas sinkronisasi batch untuk migrasi dan sinkronisasi data yang lebih efisien dan stabil.
Hasil kueri SQL dapat diekspor dalam bentuk berikut:
File lokal: Unduh hasil kueri ke mesin lokal Anda dalam format CSV, TXT, atau XLS. Informasi penting sebagai berikut:
Item
Deskripsi
Batas unduh
Hanya engine MaxCompute dan EMR yang didukung. Untuk informasi lebih lanjut, lihat Batas jumlah baris unduh.
Jika proyek MaxCompute telah mengaktifkan pembatasan unduh data (unduh data dilarang), proses pengunduhan data melalui Analisis Data akan gagal.
PentingJika opsi ini tidak muncul, lihat FAQ untuk troubleshooting.
Scope
Anda dapat memilih untuk mengunduh Only Data Displayed in Table atau All Data.
Only Data Displayed in Table: Mengunduh hanya data yang ditampilkan pada halaman saat ini, yaitu hingga
10000baris secara default.All Data: Mengekspor semua data hasil kueri dalam batas unduh.
Metode unduh
Dua metode unduh didukung: Download After Approval dan Download Without Approval.
Download after approval: Anda dapat mengonfigurasi aturan identifikasi risiko untuk mengidentifikasi risiko dalam operasi unduh data. Saat mengunduh data, Anda harus mengajukan permintaan persetujuan unduh untuk memastikan kepatuhan dan keamanan data.
CatatanHanya Edisi Enterprise Edition DataWorks yang mendukung konfigurasi dan pengaktifan aturan identifikasi risiko.
Download without approval: Secara default, unduhan tidak memerlukan persetujuan. Tidak diperlukan permintaan izin selama proses unduh.
OSS: Ekspor hasil kueri dalam format tertentu (seperti CSV atau Parquet) ke Alibaba Cloud Object Storage Service (OSS). Metode ini cocok untuk mengarsipkan volume data besar atau mengintegrasikannya dengan layanan cloud lainnya.
Saat pertama kali menggunakan fitur ini, Anda perlu mengotorisasi DataWorks untuk mengakses resource OSS Anda. Di daftar drop-down File Path, klik tautan Authorize dalam prompt dan ikuti petunjuk untuk menyelesaikan otorisasi RAM.
Parameter
Deskripsi
File path
Klik tombol folder di sebelah kanan untuk memilih bucket OSS dan direktori tempat Anda ingin menyimpan file hasil.
File name
Nama file akan dihasilkan secara otomatis. Anda juga dapat mengubahnya secara manual.
File type
Pilih format file ekspor. Format yang didukung meliputi
csv,text,orc, danparquet.Delimiter
Tentukan delimiter antar kolom. Delimiter default adalah koma (
,).Encoding
Pilih format encoding untuk file, seperti
UTF-8atauGBK.CU
Konfigurasi jumlah unit komputasi (CUs) untuk tugas ekspor ini. Nilai default adalah 1 CU.
Resource group
Pilih kelompok sumber daya arsitektur tanpa server untuk menjalankan tugas ekspor ini. Jika tidak ada kelompok sumber daya yang dipilih, kelompok sumber daya Data Integration yang dikonfigurasi di Data Analysis > System Management akan digunakan secara default.
Setelah menyelesaikan konfigurasi, klik OK untuk memulai tugas ekspor. Anda dapat melihat progres ekspor, log waktu proses, dan detail konfigurasi pada halaman eksekusi tugas. Setelah tugas berhasil, buka konsol OSS untuk mengunduh file yang diekspor ke mesin lokal Anda.
Tabel MaxCompute: Anda dapat mengekspor hasil kueri langsung ke tabel MaxCompute tanpa perlu mengunduh data ke mesin lokal terlebih dahulu. Anda dapat mengatur siklus hidup tabel sesuai kebutuhan.
Opsi ini hanya tersedia saat Anda mengkueri konten engine MaxCompute.
Spreadsheet: Anda dapat menyimpan hasil ke spreadsheet untuk analisis data lebih mendalam. Anda juga dapat membagikan hasil analisis terbaru kepada orang lain.
Operasi lainnya
Manajemen versi file SQL
Pada halaman pengeditan file SQL, Anda juga dapat mengklik di bilah alat untuk melihat perbedaan antara kode yang disimpan otomatis dan kode yang disimpan manual, lalu memilih versi yang ingin Anda simpan.
Pencarian kode
Di atas pohon direktori sebelah kiri, klik
untuk mencari kode berdasarkan kata kunci. Fitur ini hanya tersedia untuk DataWorks Edisi Standar ke atas.
Lihat riwayat eksekusi
Di atas pohon direktori sebelah kiri, klik
untuk melihat riwayat eksekusi kueri SQL.
FAQ
Bagaimana cara memberikan akses menggunakan identitas akses default sumber data?
Buka Pusat Keamanan.
Masuk ke Konsol DataWorks. Di wilayah target, klik di panel navigasi kiri. Pada halaman yang muncul, klik Go to Security Center.
Di panel navigasi kiri, klik untuk membuka halaman kontrol akses Analisis Data.
Alihkan ke ruang kerja target, temukan sumber data yang dituju, lalu klik tombol otorisasi di sebelah kanan untuk memberikan akses.
Terjadi error saat eksekusi kueri SQL?
Jika Anda mengalami error terkait This node can only run on exclusive resource groups selama eksekusi, konfigurasikan Resource Group for Scheduling dan Resource Group for Data Integration untuk engine yang sesuai di .
Tampilan atau unduhan hasil kueri dibatasi?
Hasil kueri SQL hanya menampilkan jumlah baris terbatas. Ikuti langkah-langkah berikut untuk menyesuaikan batas tampilan hingga maksimum. Anda juga dapat mengelola kemampuan unduh. Untuk informasi lebih lanjut, lihat Konfigurasi batas tampilan dan unduhan hasil kueri.
Buka Pusat Keamanan.
Masuk ke Konsol DataWorks. Di wilayah target, klik di panel navigasi kiri. Pada halaman yang muncul, klik Go to Security Center.
Di panel navigasi kiri, klik untuk membuka halaman kontrol akses Analisis Data.
Alihkan ke tab Query Result Control, lalu sesuaikan pengaturan Maximum rows per display, Maximum rows per copy, Maximum rows per download, dan Allow download.