All Products
Search
Document Center

ApsaraDB for ClickHouse:Catatan rilis untuk edisi kompatibel komunitas 26.3

Last Updated:Aug 04, 2026

Topik ini menjelaskan perubahan utama dalam edisi kompatibel komunitas Alibaba Cloud ClickHouse 26.3 LTS, mencakup fitur baru, optimalisasi performa, dan peningkatan lainnya.

Ikhtisar

Alibaba Cloud ClickHouse edisi kompatibel komunitas merilis versi baru dengan dukungan jangka panjang (LTS) 26.3. Sebagai rilis tahunan utama setelah 25.3 LTS, versi 26.3 berfokus pada integrasi data lake batch-streaming, inverted index native, stabilitas penulisan konkurensi tinggi, optimalisasi kueri kompleks, serta ekstensibilitas ekosistem terbuka.

Sorotan utama

Kategori

Penyempurnaan utama

Nilai bisnis

Data lake ecosystem

Dukungan native Apache Paimon dan pemasangan otomatis DataLakeCatalog

Kueri lakehouse yang mulus dengan akses instan untuk skenario ingestion Flink CDC

Native inverted index

Inverted index GA dengan peningkatan performa 7x hingga 10x dalam pencarian log dan teks

Menggantikan mesin pencari eksternal untuk mengurangi biaya penyimpanan dan O&M

Data lake dan akselerasi OSS

Cache SLRU footer Parquet dan pra-ambil metadata Iceberg

Percepatan 2x hingga 5x untuk kueri intensif I/O dan pemindaian tabel eksternal OSS

Optimalisasi kueri kompleks

CTE materialized dan pengurutan JOIN cerdas untuk semua jenis JOIN

Peningkatan signifikan dalam pelaporan kompleks dan analisis multidimensi

Data berdimensi tinggi dan TTL tabel lebar

Sharded Map dengan peningkatan pencarian titik 2x hingga 49x dan merge vertikal TTL

Latensi kueri titik lebih rendah dan overhead memori berkurang untuk pembersihan latar belakang

Ekosistem terbuka

Kompatibilitas dengan 31 dialek SQL

Migrasi beban kerja SQL lintas-engine tanpa perubahan kode

Ekosistem data lake: Apache Paimon dan Catalog terpadu

Dari 25.3 ke 26.3 LTS, kemampuan analitik data lake ClickHouse telah ditingkatkan secara signifikan:

  • Dukungan native Apache Paimon: Versi 26.3 LTS menyediakan fungsi tabel paimon native dan mesin tabel Paimon (termasuk kueri paralel kluster melalui paimonCluster). Anda dapat melakukan analitik read-only yang efisien pada tabel Paimon yang disimpan di OSS, S3, atau HDFS, yang ideal untuk skenario ingestion data lake Flink CDC.

  • Pemasangan otomatis DataLakeCatalog: Metastore eksternal seperti Hive Metastore, AWS Glue, dan Alibaba Cloud DLF dapat dipasang langsung sebagai database ClickHouse. Mesin secara otomatis mendeteksi tabel Iceberg, Paimon, Delta Lake, dan Hudi dalam katalog tanpa perlu membuat tabel secara manual.

  • Akselerasi kueri data lake multidimensi:

    • Cache SLRU footer Parquet: Diaktifkan secara default dengan use_parquet_metadata_cache = 1. Permintaan baca I/O dapat berkurang hingga 50% untuk kueri berulang pada file Parquet yang sama.

    • Pra-ambil metadata Iceberg asinkron: Parameter iceberg_metadata_async_prefetch_period_ms menjaga metadata lokal tetap mutakhir di latar belakang, menghilangkan bottleneck katalog remote.

    • Tarik inkremental S3Queue: Mode terurut kini menggunakan semantik StartAfter untuk mengurangi frekuensi ListObjects, menurunkan biaya dan latensi API OSS.

Pencarian teks penuh: Native inverted index GA

Kemampuan inverted index native dan pencarian teks penuh dalam 26.3 LTS kini siap produksi (GA).

  • Peningkatan performa berlipat ganda: Dalam skenario pencocokan kabur teks dan pencarian kata kunci, performa kueri cold meningkat 7x hingga 10x dengan inverted index diaktifkan. Dalam benchmark kueri log GitHub Events, latensi pencarian kompleks turun dari 193 detik menjadi 0,42 detik.

  • Kompatibilitas SQL yang mulus: Tidak diperlukan Elasticsearch eksternal atau plugin pencarian pihak ketiga. Buat indeks menggunakan INDEX idx_text content TYPE inverted untuk secara otomatis mempercepat kueri HAS(), LIKE / ILIKE, dan ekstraksi bidang JSON.

  • Biaya penyimpanan dan komputasi rendah: Berdasarkan struktur inverted index column-store ClickHouse, ukuran indeks jauh lebih kecil dibanding mesin pencari tradisional, sehingga secara signifikan mengurangi biaya penyimpanan untuk skenario analitik log, jejak, dan teks.

Komputasi dan pengoptimal

Materialized CTE

Versi 26.3 LTS memperkenalkan sintaks materialized CTE. Dengan menggunakan kata kunci MATERIALIZED, ClickHouse menyimpan hasil CTE dalam tabel sementara di memori untuk menghindari komputasi berulang dan meningkatkan efisiensi eksekusi kueri SQL pelaporan kompleks dan analisis multidimensi.

Contoh:

SET enable_materialized_cte = 1;

WITH top_users AS MATERIALIZED (
    SELECT user_id, count() AS cnt
    FROM events
    GROUP BY user_id
    ORDER BY cnt DESC
    LIMIT 1000
)
SELECT *
FROM top_users
INNER JOIN (SELECT user_id FROM top_users WHERE ...) ON ...;

Pengurutan JOIN cerdas untuk semua jenis JOIN

Pengoptimal berbasis biaya (CBO) dalam 26.3 LTS kini mendukung penukaran sisi Build/Probe secara otomatis untuk LEFT ANTI JOIN, SEMI JOIN, dan FULL JOIN, selain INNER JOIN dan LEFT/RIGHT JOIN standar. Pengoptimal secara otomatis membangun tabel hash dari sisi yang lebih kecil berdasarkan statistik tabel, mencegah error kehabisan memori (OOM) akibat pengurutan SQL manual yang tidak tepat.

Mesin penyimpanan dan tipe data

Sharded Map

Untuk skenario di mana tipe Map menyimpan tag profil pengguna dan fitur dinamis, versi 26.3 LTS memperkenalkan tata letak serialisasi fisik berbasis bucket. Pencarian kunci tunggal meningkat 2x hingga 49x karena data dalam Map di-hash ke dalam bucket berdasarkan kunci.

Contoh:

CREATE TABLE user_profiles (
    id UInt64,
    attributes Map(String, UInt64)
) ENGINE = MergeTree
ORDER BY id
SETTINGS map_serialization_version = 'with_buckets', max_buckets_in_map = 32;

Pembersihan TTL tabel lebar: Merge vertikal

Versi 26.3 LTS memperkenalkan algoritma merge vertikal untuk operasi TTL DELETE. Merge memprioritaskan penyaringan kunci primer dan kolom TTL tanpa membaca kolom lebar yang tidak relevan, sehingga secara signifikan mengurangi overhead I/O dan memori selama pembersihan data latar belakang.

Kodek floating-point lossless adaptif (ALP)

Tersedia kodek kompresi floating-point lossless baru CODEC(ALP, ZSTD). ALP (Adaptive Lossless floating-Point) dioptimalkan untuk data Float32 dan Float64 dalam skenario pemantauan industri dan metrik deret waktu, memberikan rasio kompresi dan kecepatan dekompresi lebih baik dibanding encoding Gorilla klasik.

Ekosistem terbuka: Kompatibilitas dialek SQL lintas-engine (Polyglot)

Dengan mengintegrasikan pustaka parser open source Polyglot, versi 26.3 LTS secara native mendukung 31 dialek SQL database eksternal, termasuk Snowflake, BigQuery, PostgreSQL, Spark, Presto, dan DuckDB. Anda hanya perlu mengonfigurasi pengaturan berikut:

SET dialect = 'polyglot', polyglot_dialect = 'snowflake';

Setelah itu, Anda dapat menggunakan kembali beban kerja SQL yang sudah ada.

Optimalisasi performa utama

Eksekusi kueri dan pengoptimal

  • Cache kondisi kueri, kompilasi JIT ekspresi, dan filter runtime JOIN diaktifkan secara default untuk mengurangi pemindaian berulang dan overhead JOIN tabel besar.

  • RIGHT JOIN dan FULL JOIN menggunakan ConcurrentHashJoin, dengan peningkatan performa hingga 2x dalam beberapa skenario. Optimalisasi pengurutan JOIN baru secara otomatis mengatur ulang JOIN multi-tabel berdasarkan statistik.

  • Pemangkasan indeks kunci primer dan kunci partisi diperluas: kunci primer mendukung ekspresi deterministik arbitrer untuk skipping data, dan kunci partisi yang dibungkus dalam rantai fungsi deterministik masih dapat dipangkas.

  • Kueri ORDER BY ... LIMIT N dapat secara signifikan mengurangi baris yang dipindai melalui skip index dan filter ambang batas dinamis.

Mesin penyimpanan dan skipping data

  • Reader Parquet v3 diaktifkan secara default dengan pushdown filter tingkat halaman dan dukungan PREWHERE. Pembacaan data lake secara otomatis menyesuaikan pipeline berdasarkan thread pemrosesan, mencapai peningkatan sekitar 40x pada mesin multi-core.

  • Filtering streaming skip index selama pembacaan diaktifkan secara default. Indeks teks mendukung lebih banyak bentuk predikat dan dapat digunakan dalam PREWHERE.

  • Dalam skenario pemangkasan partisi berat, kueri SELECT pada tabel dengan lebih dari 10.000 partisi menjadi hingga 8x lebih cepat. Tabel Iceberg mendukung optimalisasi PREWHERE dan pra-ambil metadata asinkron.

Eksekusi terdistribusi dan paralel

  • INSERT SELECT terdistribusi paralel diaktifkan secara default dan dieksekusi secara independen pada setiap shard. Subkueri IN terdistribusi secara otomatis menambahkan DISTINCT untuk mengurangi transfer data sementara antar-shard.

  • Analisis indeks terdistribusi mendukung skenario SharedMergeTree dan penyimpanan bersama. Replika paralel mendukung materialisasi malas dengan distribusi beban yang ditingkatkan untuk mengurangi latensi ekor panjang.

Fungsi dan indeks

  • LIKE dan ekspresi reguler secara otomatis ditulis ulang ke implementasi yang lebih efisien dan diaktifkan secara default. StringZilla mempercepat pencarian string case-sensitive, dan SIMD dynamic dispatch mempercepat fungsi logis dan konversi kolom boolean.

Memori, observabilitas, dan jaringan

  • Cache mark, uncompressed, dan page menggunakan arena jemalloc independen untuk mengurangi fragmentasi. Halaman kotor jemalloc dibersihkan dalam thread independen. Tabel log sistem menambahkan indeks minmax dan bloom_filter untuk mempercepat troubleshooting.

  • Serialisasi dan kompresi Blok dalam kueri terdistribusi dapat dialihkan ke thread pipeline untuk meningkatkan efisiensi transfer data volume besar.

Benchmark performa: Perbandingan ClickBench

Berdasarkan benchmark resmi ClickBench versi (perspektif Cold Queries), versi 26.3 LTS mencapai peningkatan performa berkelanjutan dibanding versi LTS sebelumnya 25.3:

Metrik

Peningkatan 26.3 LTS dibanding 25.3 LTS

Latensi keseluruhan kueri cold

Pengurangan waktu total 8% hingga 15%

Pemindaian data lake dan penyimpanan

Percepatan 2x hingga 5x untuk kueri intensif I/O dan pemindaian tabel eksternal OSS

Kompaksi TTL tabel lebar

Penggunaan memori puncak berkurang lebih dari 40%

Pencarian teks dan log

Latensi pencarian kompleks berkurang dari 193 detik menjadi 0,42 detik dengan inverted index

Pencarian titik Map berdimensi tinggi

Peningkatan 2x hingga 49x dalam pencarian kunci tunggal dengan sharded Map

Fitur utilitas

Versi 26.3 LTS juga mencakup serangkaian fitur yang meningkatkan pengalaman pengembangan dan O&M:

  • Sortir natural (naturalSortKey): Mengurutkan string yang berisi angka dalam urutan intuitif manusia. Misalnya, file2.txt diurutkan dengan benar sebelum file10.txt.

  • Output EXPLAIN berbentuk pohon: Jalankan EXPLAIN pretty=1, compact=1 untuk mendapatkan pohon rencana eksekusi visual yang terstruktur dengan baik.

  • Toleransi kesalahan shard tidak tersedia: Parameter max_skip_unavailable_shards_num dan max_skip_unavailable_shards_ratio memberikan kontrol terbatas atas rasio node gagal yang dapat dilewati selama kueri tabel besar dalam kluster.

Rekomendasi peningkatan

Persiapan sebelum peningkatan

  1. Verifikasi lingkungan klon atau pengujian: Deploy versi baru terlebih dahulu di lingkungan klon atau pengujian untuk mengevaluasi dampak perubahan versi terhadap konfigurasi dan kueri yang ada.

  2. Periksa kompatibilitas dependensi: Pastikan kompatibilitas driver client dan alat pihak ketiga dengan versi baru.

Catatan penting

  • Validasi fitur eksperimental: Materialized CTE dan dialek Polyglot ditandai sebagai Eksperimental dalam versi ini. Kami menyarankan Anda memvalidasi fitur-fitur ini di kluster pengujian sebelum menggunakannya di produksi.

  • Pengujian regresi performa: Setelah peningkatan, bandingkan waktu eksekusi kueri utama untuk memastikan optimalisasi seperti cache Parquet, inverted index, dan pengurutan JOIN berjalan efektif.

  • Penyesuaian pemantauan dan peringatan: Sesuaikan ambang batas pemantauan berdasarkan metrik baru dan perubahan yang ada.

Ringkasan

ClickHouse 26.3 LTS adalah rilis yang luas dan mendalam:

  • Pada tingkat data lake dan ekosistem terbuka, dukungan native Paimon dan kompatibilitas dengan 31 dialek SQL menjembatani integrasi lakehouse dan penggunaan ulang lintas-engine.

  • Pada tingkat kueri dan analitik, inverted index GA, CTE materialized, pengurutan JOIN, dan sharded map secara signifikan memperluas kemampuan ClickHouse dalam pencarian log, analisis kompleks, dan pencarian titik berdimensi tinggi.

  • Pada tingkat stabilitas dan biaya, merge vertikal TTL dan Kodek ALP mengurangi kompleksitas operasional dalam pembersihan data dan kompresi penyimpanan.

Tim Alibaba Cloud ClickHouse telah menyelesaikan adaptasi cloud dan verifikasi kompatibilitas penuh untuk rilis komunitas 26.3 LTS. Anda dapat segera membuat instans 26.3 LTS atau meningkatkan instans yang ada ke versi terbaru di Konsol Alibaba Cloud ClickHouse untuk merasakan analitik real-time yang lebih efisien dan stabil.