Amazon S3 データソースを作成すると、Dataphin で Amazon S3 からデータを読み取ったり、Amazon S3 にデータを書き込んだりできるようになります。
背景情報
Amazon S3 (Simple Storage Service) は、データを格納および取得するためのクラウドストレージサービスです。Dataphin で Amazon S3 を使用してデータ開発やデータの書き込みを行うには、まず Amazon S3 データソースを作成する必要があります。詳細については、「Amazon S3 とは」をご参照ください。
権限
[Create Data Source] 権限を持つカスタムグローバルロール、およびシステムロールのスーパー管理者、データソース管理者、ビジネスセグメントアーキテクト、プロジェクト管理者のみが、データソースを作成できます。
操作手順
-
Dataphin のホームページの上部メニューで、[Management Center] > [Data Source Management] の順にクリックします。
-
[Data Sources] ページで [+ Create Data Source] をクリックします。
-
[Create Data Source] ページで、[File] セクションの [Amazon S3] を選択します。
最近 Amazon S3 を使用した場合は、[Recently Used] セクションで探して選択することもできます。または、検索ボックスに「Amazon S3」と入力して、すばやく見つけることもできます。
-
[Create Amazon S3 Data Source] ページで、接続パラメーターを設定します。
-
データソースの基本情報を設定します。
パラメーター
説明
[データソース名]
データソースの名前を入力します。名前は次の要件を満たす必要があります。
-
中国語、英字の大文字と小文字、数字、アンダースコア (_)、ハイフン (-) のみ使用できます。
-
長さは 64 文字以内にする必要があります。
[データソースコード]
データソースコードを設定すると、Flink SQL ジョブでこのデータソースのテーブルを
data_source_code.table_nameまたはdata_source_code.schema.table_nameという形式で参照できます。現在の環境に対応するデータソースに自動的にアクセスするには、${data_source_code}.tableまたは${data_source_code}.schema.tableという変数形式を使用します。詳細については、「Dataphinデータソーステーブルを使用した開発」および「」をご参照ください。重要データソースコードは、一度構成すると変更できません。
データソースコードが構成された後でのみ、アセットディレクトリおよびアセットチェックリストのオブジェクト詳細ページでデータをプレビューできます。
Flink SQL では、現在、MySQL、Hologres、MaxCompute、Oracle、StarRocks、Hive、SelectDB、および GaussDB データウェアハウスサービス (DWS) のデータソースのみがサポートされています。
[データソースの説明]
データソースの簡単な説明を入力します。説明は 128 文字以内にする必要があります。
[データソース設定]
設定するデータソースの種類を選択します。
-
[Production and development data source] :ビジネスデータソースが本番環境と開発環境に分かれている場合は、このオプションを選択します。
-
[Production data source] :ビジネスデータソースに個別の環境がない場合は、このオプションを選択します。
[タグ]
タグを追加して、データソースを分類および管理できます。タグの作成方法については、「データソースタグの管理」および「」をご参照ください。
-
-
接続パラメーターを設定します。
[Production and development data source] を選択した場合は、両方の環境の接続情報を設定する必要があります。[Production data source] を選択した場合は、[Production data source] の接続情報のみを設定します。
説明通常、本番データソースと開発データソースは、環境を分離し、開発アクティビティが本番環境に影響を与えないように、個別に設定する必要があります。ただし、Dataphin では、同一のパラメーター値を使用することで、これらを同じデータソースとして設定できます。
パラメーター
説明
[エンドポイント]
Amazon S3 バケットがあるリージョンのエンドポイントです。形式は
http://s3-{Region}.amazonaws.comで、{Region} はバケットのリージョンです。Amazon S3 サービスのエンドポイントはリージョンによって異なります。アクセスしたいリージョンの正しいエンドポイントを入力してください。詳細については、「Amazon S3 エンドポイント」をご参照ください。
[リージョン]
バケットがあるリージョンです。このパラメーターはオプションです。エンドポイントにリージョンが含まれていない場合は、リージョンを指定する必要があります。
[バケット]
指定した Amazon S3 リージョン内のバケットの名前です。バケットはオブジェクトを格納するためのコンテナです。バケット名を確認するには、「Amazon S3 バケットの概要」をご参照ください。
[ディレクトリ]
特定のディレクトリに対する権限しかない場合は、ここにそのパスを入力します。例:
/dataphin/。[ 認証方法 ]
Dataphin が Amazon S3 にアクセスするための認証方法です。デフォルトは [AccessKey-based authentication] です。[IAM role authentication] オプションは、メタデータウェアハウステナントで [IAM role authentication] が有効な場合にのみ表示されます。
-
[AccessKey-based authentication] :指定したアクセスキー ID とシークレットアクセスキーを使用して Amazon S3 にアクセスします。
-
[IAM role authentication] :Dataphin がデプロイされている Amazon EC2 インスタンスにアタッチされた IAM ロールを使用して Amazon S3 にアクセスします。 Dataphin は、現在のインスタンスにアタッチされている IAM ロールを自動的に取得します。 このロールが、ターゲットバケットへのアクセスに必要な権限を持っていることを確認してください。
[アクセスキー ID] と [シークレットアクセスキー]
Amazon S3 データソースが属する AWS アカウントのアクセスキー ID とシークレットアクセスキーです。 これは、[ 認証方法]が [AccessKey-based authentication] に設定されている場合にのみ必要です。
これらの認証情報を取得する方法については、「Amazon アクセスキー」をご参照ください。
説明これらは Alibaba Cloud アカウントではなく、AWS アカウントの認証情報です。
-
-
-
[default resource group] を選択します。このリソースグループは、データベースの SQL クエリ、オフラインでのデータベース全体の移行、データプレビューなど、データソースに関連するタスクを実行するために使用します。
-
[Test Connection] をクリックするか、[OK] をクリックして Amazon S3 データソースを作成します。
[Test Connection] をクリックすると、Dataphin はデータソースへの接続を検証します。[OK] をクリックすると、Dataphin は選択されたすべてのクラスターへの接続を自動的にテストします。これらのテストが失敗した場合でも、データソースを作成できます。