全部產品
Search
文件中心

E-MapReduce:產品簡介

更新時間:Aug 28, 2026

開源巨量資料開發平台E-MapReduce(簡稱EMR)是運行在阿里雲平台上的一種巨量資料處理系統解決方案。EMR基於開源的Apache Hadoop和Apache Spark,讓您可以方便地使用Hadoop和Spark生態系統中的其他周邊系統分析和處理資料。EMR還可以與阿里雲其他的雲資料存放區系統和資料庫系統(例如,阿里雲OSS和RDS等)進行資料轉送。

產品介紹

阿里雲EMR提供了on ECS、on ACK和Serverless形態,以滿足不同使用者的需求。

形態

描述

EMR on ECS

EMR負責將開源Hadoop生態的組件安裝部署在ECS上,並啟動相應的服務。您可以在EMR控制台完成對叢集ECS及服務的營運操作。

關於EMR on ECS的更多介紹,請參見什麼是EMR on ECS。

EMR on ACK

您需要先完成ACK叢集的安裝部署。當ACK叢集準備就緒後,EMR將基於ACK的資源安裝部署巨量資料服務組件,並在容器內運行。關於EMR on ACK的更多介紹,請參見什麼是EMR on ACK。

EMR Serverless Spark

EMR Serverless Spark是一款面向Data+AI的高效能Lakehouse產品。該產品為企業提供了一站式的資料平台服務,包括任務開發、調試、調度及營運等功能,顯著簡化了資料處理與模型訓練的全流程。同時,它100%相容開源Spark生態,能夠無縫整合到客戶現有的資料平台。通過使用EMR Serverless Spark,企業可以更加專註於資料處理分析及模型訓練的最佳化,從而提升工作效率。

關於EMR Serverless Spark的更多介紹,請參見什麼是EMR Serverless Spark。

重要

EMR 基於 Apache Hadoop、Spark、Flink、StarRocks 等社區開源組件構建,專註於提供穩定高效的叢集管控與營運平台能力。不同形態的營運責任劃分不同:

  • EMR on ECS 和 EMR on ACK 為半託管形態,叢集資源歸屬於您的阿里雲帳號,開源組件的日常營運(例如容量規劃、參數調優和故障處理)由您負責,更依賴您具備專業的巨量資料營運能力,以確保商務持續性。

  • EMR Serverless Spark 和 EMR Serverless StarRocks 為全託管形態,由阿里雲負責底層資源與引擎服務的營運,您只需關注作業開發與資料分析。

詳細的支援邊界,請參見支援人員的範圍和方式。

產品優勢

EMR on ECS

EMR為您提供了相對方便可控的企業級開源巨量資料服務。您可以快速搭建開源巨量資料服務,例如Hadoop、Spark、Flink、Kafka和HBase服務。

  • 100%採用社區開源組件,適配並最佳化開源組件,效能遠高於開源版本。

  • 基於時間的Auto Scaling能力,搶佔式執行個體可進一步降低成本。

  • 解耦了計算與儲存之間的綁定關係,實現了資源的彈性利用。

  • 分鐘層級建立和擴容叢集,無需手動部署和啟動服務。

EMR on ACK

  • 節省成本:無需單獨購買ACK叢集。

  • 簡化營運:一套營運體系,一套叢集管理,全面覆蓋巨量資料和線上等多種業務。

  • 最佳化體驗:支援ECS和ACK兩套IaaS資源模型,您可以無縫切換。

  • 深度整合:完全採用雲原生資料湖架構,計算使用阿里雲ACK,計算資源可以無限擴充。

EMR Serverless Spark

  • 雲原生極速計算引擎

    • 內建Fusion Engine (Spark Native Engine):相對開源版本效能提升300%,顯著加速巨量資料計算任務。通過向量化引擎和批量資料處理技術最佳化計算效率,同時減少記憶體佔用,大幅提升整體效能。

    • 內建Celeborn(Remote Shuffle Service):支援PB級Shuffle資料處理,大幅提高大Shuffle任務的穩定性和效能。計算節點無需配置大規格雲端硬碟,充分利用Spark的動態資源伸縮能力,降低儲存成本,計算資源總成本最高下降30%。

  • 開放化的資料湖架構

    • 按需Auto Scaling:支援計算與儲存分離架構,計算資源可實現秒級Auto Scaling,最小粒度為1核,精細化按任務或隊列層級進行資源計量。儲存採用隨用隨付模式,避免資源浪費,大幅降低企業營運成本。

    • 無縫遷移與相容性:對接OSS-HDFS,完全相容HDFS的雲上儲存,支援使用者業務平滑遷移上雲。通過DLF實現湖倉中繼資料全面打通,確保資料訪問一致性與許可權管理完整性,助力企業輕鬆構建現代化資料湖倉架構。

  • 一站式的開發體驗

    • 全流程開發支援:提供從任務開發、調試、發布到調度的一站式開發體驗,滿足企業級開發與發布的高標準需求。內建版本管理功能,完整記錄每次發布歷史,支援源碼與配置差異對比,確保變更可追溯。

    • 高效協作與穩定性保障:開發與生產環境嚴格隔離,保障業務穩定性,助力團隊高效協作與穩定交付。

  • Serverless的資源平台

    • 開箱即用:無需手動管理和複雜的基礎設施搭建,即可快速啟動任務開發。

    • 秒級彈性:基於Spark任務的資源需求,動態拉取資源啟動Pod,運算完畢後立即釋放資源,計費僅針對實際使用的資源量,進一步降低計算總成本。

    • 成本預估:提供任務層級的資源計量與成本預估,協助企業實現精細化營運。