Fluid adalah orchestrator dan akselerator dataset terdistribusi open source yang native untuk Kubernetes. Fluid dirancang untuk aplikasi intensif data dalam skenario cloud-native, seperti aplikasi data besar dan AI. Topik ini menjelaskan fitur inti dan konsep penting dari akselerasi data.
Fitur
Fluid menyediakan fitur melalui sumber daya Dataset dan Runtime, seperti yang ditunjukkan pada gambar berikut.
Dukungan native untuk abstraksi dataset: Menyediakan dukungan dasar yang diperlukan oleh aplikasi intensif data, memungkinkan akses data yang efisien dan mengurangi biaya manajemen multidimensi.
Plugin mesin data yang dapat diperluas: Menyediakan antarmuka akses terpadu untuk koneksi mudah ke penyimpanan pihak ketiga. Fluid menggunakan Runtime yang berbeda untuk menjalankan operasi data.
Operasi data otomatis: Menyediakan beberapa mode operasi yang terintegrasi dengan sistem operasi dan maintenance (O&M) otomatis.
Elastisitas dan penjadwalan data: Meningkatkan kinerja akses data dengan menggabungkan teknologi caching data, skalabilitas elastis, serta penjadwalan afinitas data.
Kemandirian platform Runtime: Mendukung berbagai lingkungan, seperti Kubernetes native, edge, serverless, dan multi-kluster, sehingga cocok untuk skenario Cloud Hibrida.
Konsep penting
Dataset: Sekumpulan data yang secara logis saling terkait dan digunakan oleh mesin komputasi. Misalnya, Spark menggunakan dataset dalam skenario data besar, dan TensorFlow menggunakan dataset dalam skenario AI. Manajemen dataset mencakup berbagai dimensi, seperti keamanan, manajemen versi, dan akselerasi data.
Runtime: Mesin eksekusi yang menyediakan kemampuan seperti keamanan dataset, manajemen versi, dan akselerasi data. Runtime mendefinisikan serangkaian antarmuka siklus hidup yang dapat diimplementasikan untuk mendukung manajemen dan akselerasi dataset.
AlluxioRuntime: Mesin eksekusi dari komunitas Alluxio yang mendukung manajemen dan caching data Dataset. AlluxioRuntime mempercepat akses ke persistent volume claims (PVCs), Ceph, dan Cloud Parallel File System (CPFS), serta secara efektif mendukung skenario Cloud Hibrida.
JuiceFSRuntime: Mesin akselerasi cache terdistribusi berbasis JuiceFS. JuiceFSRuntime mendukung caching dan akselerasi data yang spesifik sesuai skenario. Untuk informasi lebih lanjut tentang JuiceFS, lihat Pengenalan JuiceFS. Untuk informasi lebih lanjut tentang cara menggunakan JuiceFS di Fluid, lihat Gunakan JuiceFS di Fluid.
JindoRuntime: Mesin eksekusi berbasis C++ dari tim Alibaba Cloud E-MapReduce (EMR) JindoFS yang mendukung manajemen dan caching data Dataset. JindoRuntime dapat mempercepat akses data ke Object Storage Service (OSS), OSS-HDFS, dan Hadoop Distributed File System (HDFS).
ThinRuntime: Implementasi yang dapat diperluas untuk sistem penyimpanan umum. ThinRuntime memungkinkan Anda menghubungkan berbagai sistem penyimpanan dengan kode minimal dan menggunakan kembali kemampuan inti yang disediakan Fluid untuk orkestrasi data, manajemen, serta akses platform runtime.
Mesin akselerasi cache terdistribusi AlluxioRuntime dan JuiceFSRuntime dalam ack-fluid merupakan komponen open source gratis yang disediakan oleh komunitas atau perusahaan open source pihak ketiga. Anda dapat memilih untuk menginstal komponen server dan client yang sesuai untuk menggunakan layanan akselerasi cache terdistribusi tersebut.
Namun, Alibaba Cloud tidak bertanggung jawab atas stabilitas, batasan layanan, dan kepatuhan keamanan komponen pihak ketiga. Anda harus memperhatikan situs resmi komunitas atau perusahaan open source pihak ketiga serta pembaruan di platform hosting kode, dan membaca serta mematuhi lisensi open source yang berlaku. Anda bertanggung jawab atas segala risiko potensial terkait pengembangan aplikasi, maintenance, troubleshooting, dan keamanan akibat penggunaan komponen pihak ketiga.
Fitur | Alluxio | JuiceFS | Jindo |
Tipe penyimpanan dasar | PVC, Ceph, HDFS, CPFS, Network File System (NFS), dan OSS | JuiceFS | OSS, OSS-HDFS, dan PVC |
Metode yang didukung | Komunitas open source | Komunitas open source | Produk Alibaba Cloud |