MaxCompute Spark は、MaxCompute が提供するオープンソース互換の Spark コンピューティングサービスです。統合されたコンピューティングリソースとデータセットの権限システム上に構築され、Spark コンピューティングフレームワークを提供します。ユーザーは使い慣れた開発手法で Spark ジョブを送信および実行でき、より幅広いデータ処理と分析のシナリオに対応します。
主な特徴
-
ネイティブなマルチバージョン Spark ジョブのサポート
ネイティブなコミュニティ版 Spark が MaxCompute 上で動作し、Spark API と完全に互換性があり、複数の Spark バージョンをサポートします。
-
統合コンピューティングリソース
MaxCompute Spark は、MaxCompute SQL や MapReduce などの他のタスクタイプと同様に、MaxCompute プロジェクトで有効化された統合コンピューティングリソース上で動作します。
-
データと権限の統合管理
MaxCompute プロジェクトの権限システムに従い、ユーザーの権限範囲内のデータを安全にクエリします。
-
オープンソースシステムと同等のユーザーエクスペリエンス
ネイティブなオープンソースのリアルタイム Spark UI とクエリ履歴ログ機能を提供します。
サポートされている機能
MaxCompute Spark は現在、以下の機能をサポートしています。
-
オフラインコンピューティング:GraphX、MLlib、RDD、Spark-SQL、PySpark など。
-
MaxCompute テーブルデータの読み取りと書き込み。
-
MaxCompute 内のファイルリソースの参照。
-
Alibaba Cloud VPC 環境内のサービスへのアクセス。
-
Alibaba Cloud OSS 非構造化ストレージへのアクセス。
-
MaxCompute OSS 外部テーブルの読み取り。
-
DataWorks ノートブック
使用制限
MaxCompute Spark は現在、以下のシナリオをサポートしていません。
-
Spark-Shell、Spark-SQL-Shell、PySpark-Shell などのインタラクティブなシナリオはサポートされていません。
-
MaxCompute 組み込み関数およびユーザー定義関数 (MaxCompute UDF) へのアクセスはサポートされていません。
-
OSS 外部テーブル以外の MaxCompute 外部テーブルへのアクセスはサポートされていません。