Topik ini menjelaskan cara mengunggah dan mengunduh data dari MaxCompute, mencakup koneksi layanan, kit pengembangan perangkat lunak (SDK), alat, serta operasi umum seperti impor dan ekspor data.
Informasi latar belakang
MaxCompute menyediakan beberapa saluran untuk mengunggah dan mengunduh data, memungkinkan Anda memilih solusi teknis yang paling sesuai dengan skenario Anda.
Saluran data Batch: Mendukung unggah dan unduh data secara batch.
Streaming Tunnel: Memungkinkan Anda melakukan streaming data ke MaxCompute.
Real-time data tunnel: DataHub adalah platform pemrosesan data streaming yang memungkinkan Anda memublikasikan, berlangganan, mendistribusikan data streaming, serta mengarsipkannya ke MaxCompute.
Pengenalan fungsi
Unggah data menggunakan saluran data batch
Anda dapat menggunakan saluran data batch untuk mengunggah data ke MaxCompute secara batch. Sumber data yang didukung mencakup file eksternal, database eksternal, Object Storage Service, dan file log. Solusi berikut tersedia untuk unggah data batch:
Tunnel SDK: Anda dapat mengunggah data ke MaxCompute menggunakan Tunnel.
Layanan sinkronisasi data: Anda dapat menggunakan tugas Data Integration (DataWorks) untuk mengekstraksi, mentransformasi, dan memuat (ETL) data ke MaxCompute.
Alat dan plugin open source: Anda dapat mengunggah data ke MaxCompute menggunakan Sqoop, Kettle, Flume, plugin Fluentd, atau OGG.
Alat produk: Klien MaxCompute menyediakan perintah Tunnel bawaan yang didasarkan pada SDK untuk saluran data batch. Anda dapat menggunakan perintah ini untuk mengunggah data. Untuk informasi lebih lanjut tentang cara menggunakan perintah Tunnel, lihat Perintah Tunnel.
CatatanUntuk sinkronisasi data offline, Anda dapat menggunakan Data Integration. Untuk informasi lebih lanjut, lihat Data Integration.
Tulis data menggunakan saluran data streaming
Layanan saluran data streaming MaxCompute memungkinkan Anda menulis data ke MaxCompute secara streaming. Layanan ini menggunakan serangkaian API dan layanan backend baru yang berbeda dari layanan saluran data batch. Solusi berikut tersedia untuk menulis data streaming ke MaxCompute:
Layanan sinkronisasi data: Anda dapat menggunakan tugas sinkronisasi real-time dalam Data Integration untuk menulis data streaming (StreamX).
Pengiriman data: Anda dapat menggunakan mode pengiriman data yang telah mengintegrasikan API penulisan streaming untuk menulis data streaming. Metode ini mendukung SLS dan Message Queue untuk Kafka.
Penulisan real-time dengan Flink: Anda dapat menggunakan platform Flink untuk menulis data streaming secara real-time.
Keandalan solusi
MaxCompute menyediakan Perjanjian Tingkat Layanan (SLA). Namun, saluran data batch dan streaming secara default menggunakan sumber daya yang dibagikan secara gratis. Oleh karena itu, Anda harus mempertimbangkan keandalan solusi spesifik Anda. Layanan Tunnel mengalokasikan sumber daya layanan yang tersedia (slot) berdasarkan urutan permintaan akses yang diterima.
Jika tidak ada sumber daya layanan yang tersedia, permintaan akses baru akan ditolak hingga sumber daya dilepas.
Jika jumlah permintaan valid tidak mencapai 100 dalam waktu 5 menit, layanan tidak dianggap tidak tersedia. Untuk informasi lebih lanjut tentang permintaan valid, lihat Kode status valid untuk Data Transmission Service.
Latensi permintaan dan permintaan yang diberi throttle tidak dicakup oleh SLA. Untuk informasi lebih lanjut tentang batasan layanan, lihat Batasan Data Transmission Service.
Catatan
Kondisi jaringan sangat memengaruhi kecepatan unggah dan unduh Tunnel. Kecepatan biasanya berkisar antara 1 MB/s hingga 10 MB/s. Jika Anda mengunggah data dalam jumlah besar, Anda dapat mengatur Tunnel Endpoint ke endpoint jaringan internal atau VPC. Anda harus terhubung ke jaringan internal atau VPC melalui instance ECS Alibaba Cloud atau jalur sewa. Jika kecepatan unggah terlalu lambat, Anda dapat menggunakan metode unggah multi-threaded.
Untuk informasi lebih lanjut tentang Tunnel Endpoint, lihat Endpoint.