MaxCompute コンソールには、ローカルファイルや Alibaba Cloud Object Storage Service (OSS) から MaxCompute へ、オフライン (非リアルタイム) でデータをアップロードするための「データアップロード」機能があります。この機能を利用することで、MaxCompute 環境内でデータの分析、処理、管理を行うことができます。
制限事項
データはローカルファイルまたは Alibaba Cloud OSS からのみアップロードできます。
ローカルファイル:CSV または XLSX ファイルからデータをアップロードできます。
CSV 形式:最大ファイルサイズは 5 GB です。
XLSX 形式:最大ファイルサイズは 100 MB です。
Alibaba Cloud OSS:CSV ファイルからのみデータをアップロードできます。最大ファイルサイズは 5 GB です。ソースバケットは、ご利用の MaxCompute プロジェクトと同じリージョンにある必要があります。
カスタムスキーマを持つテーブル (既存および新規の両方) にはデータをアップロードできません。カスタムスキーマの詳細については、「スキーマ操作」をご参照ください。
前提条件
アップロードされたデータを保存するための MaxCompute プロジェクトを作成し、必要な権限を持っていること。例:
既存のテーブルにデータをアップロードするには、そのテーブルに対する書き込み権限が必要です。
新規テーブルにデータをアップロードするには、プロジェクト内でテーブルを作成する権限が必要です。
MaxCompute プロジェクトの作成方法の詳細については、「プロジェクト管理」をご参照ください。権限の付与方法の詳細については、「権限の概要」をご参照ください。
Alibaba Cloud OSS からデータをアップロードする場合、以下の要件が適用されます。
Alibaba Cloud OSS をアクティベートし、バケットを作成し、データをバケットにアップロード済みであること。詳細については、「バケットの作成」および「ファイルのアップロード」をご参照ください。
アップロードに使用する Alibaba Cloud アカウント (root ユーザー) が、宛先バケットにアクセスするために必要な権限を持っていること。詳細については、「権限とアクセス制御の概要」をご参照ください。
操作手順
MaxCompute コンソールにログインし、左上隅でリージョンを選択します。
左側のナビゲーションウィンドウで、[データ転送] > [データアップロード] を選択します。[データアップロード] ページが表示されます。
[データアップロード] ページで、表 1 の説明に従ってパラメーターを設定します。
表 1. データアップロードのパラメーター
セクション
パラメーター
説明
データソース
ローカルファイル
ローカルマシン上のファイルからデータをアップロードします。
一度に 1 つの CSV または XLSX ファイルをアップロードできます。
CSV ファイル:最大ファイルサイズは 5 GB です。データはカンマ (,) で区切る必要があります。
XLSX ファイル:最大ファイルサイズは 100 MB です。デフォルトでは、最初のシートのデータのみがアップロードされます。他のシートのデータは無視されます。
Alibaba Cloud OSS
Alibaba Cloud OSS バケットに保存されている CSV ファイルからデータをアップロードします。
現在のリージョンにあるバケット内の CSV ファイルのみを選択できます。1 回のアップロードの最大ファイルサイズは 5 GB です。アクセス可能なバケットがない場合は、作成する必要があります。詳細については、「バケットの作成」をご参照ください。
説明データが 5 GB を超える場合は、アップロードする前にファイルを分割してください。そうしないと、アップロードは失敗します。
アップロードするデータの指定
バケットの選択
[データソース] を [Alibaba Cloud OSS] に設定した場合、ソースファイルが配置されている OSS バケットのパスを選択します。
ファイルの選択
ソースの CSV または XLSX ファイルを選択します。
ダーティデータの削除
アップロード中にダーティデータをフィルタリングするかどうかを指定します。ダーティデータとは、データの型が宛先の MaxCompute テーブルの対応する列のデータの型と一致しないレコードを指します。
説明例えば、ソース列に文字を含む文字列が含まれているが、対応する宛先テーブルの列が BIGINT 型である場合、そのレコードはダーティデータと見なされます。ダーティデータを削除することを選択した場合、このレコードはアップロードされません。
[はい]:データの型が一致しないレコードを削除します。
[いいえ]:ファイルからすべてのデータをアップロードします。データの型が一致しない場合、アップロードが失敗する可能性があります。
宛先テーブルの設定
MaxCompute プロジェクト名
宛先の MaxCompute プロジェクト。
宛先テーブル
データを既存のテーブルにアップロードするか、新規テーブルにアップロードするかを選択します。
表 2. 既存テーブルのパラメーター
パラメーター
説明
宛先テーブルの選択
ドロップダウンリストから宛先の MaxCompute テーブルを選択するか、キーワードで検索します。
アップロード方法
設定された列マッピングに基づいて、宛先テーブルにデータを追加する方法を指定します。
[テーブルデータを先にクリア]:宛先テーブルから既存のデータをすべてクリアしてから、新しいデータを挿入します。
[追加]:既存のデータを保持したまま、新しいデータを宛先テーブルに追加します。
説明列マッピングの設定方法については、ステップ 4 をご参照ください。
表 3. 新規テーブルのパラメーター
パラメーター
説明
テーブル名
新規テーブルの名前を指定します。
テーブルタイプ
テーブルタイプを選択します。[非パーティションテーブル] または [パーティションテーブル] を選択できます。[パーティションテーブル] を選択した場合は、パーティションキー列とその値を指定する必要があります。
ライフサイクル
テーブルのライフサイクルを日数で指定します。この期間が経過すると、テーブルは自動的に削除されます。詳細については、「ライフサイクル」および「ライフサイクル操作」をご参照ください。
ソースデータをプレビューし、列マッピングを設定します。
ソースファイルと宛先テーブルを選択した後、データをプレビューし、列マッピングを設定します。マッピングが正しく設定されるまで、データはアップロードできません。
説明プレビューできるのは、データの最初の 20 行のみです。
セクション
パラメーター
説明
アップロードファイルデータプレビュー
ファイルエンコーディング
プレビューの文字が文字化けしている場合は、別のファイルエンコーディングを選択してください。サポートされているエンコーディングには、[UTF-8]、[GB18030]、[Big5] があります。
列名でマッピング
一致する列名に基づいて、ソース列を宛先列にマッピングします。
順序でマッピング
ファイル内の順序に基づいて、ソース列を宛先列にマッピングします。
最初の行を無視
通常は列ヘッダーが含まれるソースファイルの最初の行を無視するかどうかを指定します。
選択済み:最初の行はアップロードされません。
クリア:最初の行はデータレコードとしてアップロードされます。
[データをアップロード] をクリックして、アップロードプロセスを開始します。
重要ソース列が宛先列にマッピングされていない場合、そのデータはプレビューでグレー表示され、アップロードされません。
各ソース列は 1 つの宛先列にのみマッピングできます。重複したマッピングは許可されません。
新規テーブルを作成する場合、各列の名前とデータの型を指定する必要があります。
アップロードレコードの表示
アップロードタスクを送信した後、大規模なデータセットの場合は完了までに時間がかかることがあります。タスクの実行中に現在のページを離れても問題ありません。ステータスと詳細を確認するには、[データアップロード] ページの右上隅にある [アップロードレコードの表示] をクリックします。
このページの [アップロードレコードの表示] を通じて取得されるレコード詳細には、DataWorks の データアップロード 操作によって生成されたレコードも含まれます。
次のステップ
データが正常にアップロードされた後、接続ツール を使用して、宛先の MaxCompute テーブル内のデータをクエリできます。