All Products
Search
Document Center

E-MapReduce:FAQ

Last Updated:Aug 21, 2026

Topik ini merangkum masalah umum saat menggunakan Hudi.

Data duplikat saat mengkueri Hudi dengan Spark

  • Penyebab: Masalah ini terjadi karena Hudi tidak mendukung pembacaan data menggunakan Spark DataSource API.

  • Solusi: Saat mengkueri tabel Hudi, atur konfigurasi spark.sql.hive.convertMetastoreParquet=false.

Data duplikat saat mengkueri Hudi dengan Hive

  • Penyebab: Secara default, Hive menggunakan HiveCombineInputFormat, yang tidak memakai input format kustom dari tabel tersebut.

  • Solusi: Saat mengkueri tabel Hudi, jalankan set hive.input.format = org.apache.hudi.hadoop.hive.HoodieCombineHiveInputFormat.

Kegagalan pemangkasan partisi dengan Spark dan Hudi

  • Penyebab: Masalah ini dapat terjadi jika bidang partisi berisi garis miring maju (/). Hal ini menyebabkan ketidaksesuaian antara jumlah bidang partisi dan jumlah level dalam direktori partisi, sehingga mencegah Spark menerapkan pemangkasan partisi.

  • Solusi: Saat menulis ke tabel Hudi menggunakan Spark DataFrame API, atur konfigurasi hoodie.datasource.write.partitionpath.urlencode=true.

Error saat menggunakan ALTER TABLE di Spark: xxx is only supported with v2 tables

  • Penyebab: Masalah ini terjadi karena fitur evolusi skema Hudi untuk Spark memerlukan konfigurasi hoodie.schema.on.read.enable diatur ke true.

  • Solusi: Jalankan perintah set hoodie.schema.on.read.enable=true saat Anda melakukan operasi ALTER TABLE pada tabel Hudi. Untuk informasi lebih lanjut, lihat SparkSQL Schema Evolution and Syntax Description dalam dokumentasi Apache Hudi.