ApsaraDB for SelectDB は、ネイティブインターフェースやエコシステムツールなど、さまざまなデータインポート方法をサポートしています。これらの方法は、リアルタイムデータストリームからオフラインバッチ処理まで、幅広いシナリオに適しています。このトピックでは、SelectDB にデータをインポートするための主要なインターフェースとツールについて説明します。
データインポートの推奨事項
-
Alibaba Cloud エコシステム外のデータソースの場合:
-
インポートインターフェース: Kafka データソースの場合は Routine Load を使用します。その他のデータソースの場合は Stream Load を使用します。
-
インポートツール: Flink。
-
-
大規模データの場合:
-
インポートインターフェース: Kafka データソースの場合は Routine Load を使用します。その他のデータソースの場合は Stream Load を使用します。
-
インポートツール: Alibaba Cloud エコシステム内の MySQL データソースの場合は DTS を使用します。Alibaba Cloud エコシステム外の MySQL データソースおよび MySQL 以外のデータソースの場合は Flink を使用します。
-
インターフェースおよびツールの詳細については、以下の インポートインターフェース および インポートツール をご参照ください。
インポートインターフェース
|
インターフェース |
機能 |
サポートされているデータ形式 |
シナリオ |
操作手順 |
|
Stream Load (推奨) |
|
CSV、JSON、PARQUET、または ORC |
ローカルファイルまたはデータストリームをリアルタイムまたはバッチで SelectDB にインポートできます。 |
|
|
Routine Load |
リアルタイムでデータストリームを処理します。 |
CSV または JSON |
継続的なジョブは、指定されたデータソースからデータを継続的に読み取り、SelectDB にインポートします。 説明
現在、Kafka データソースのみがサポートされています。 |
|
|
Broker Load |
|
CSV、PARQUET、または ORC |
OSS、HDFS、S3 などのリモートストレージシステムからデータを読み取り、SelectDB にインポートします。 |
|
|
OSS Load |
|
CSV、PARQUET、または ORC |
Alibaba Cloud OSS から SelectDB にデータをインポートします。 |
|
|
Insert Into |
|
データベーステーブルからデータを読み取ります。ファイル形式は関与しません。 |
|
インポートツール
|
ツール |
機能 |
サポートされているデータソース |
増分データ |
履歴データ |
シナリオ |
操作手順 |
|
DataWorks |
エンドツーエンド管理: タスクスケジューリング、データ監視、データリネージ分析を統合します。 Alibaba Cloud エコシステムとのシームレスな統合 をサポートします。 |
|
サポートされていません |
サポートされています |
タスクオーケストレーションおよび監視が必要な、エンタープライズレベルのデータ統合および複雑なデータリンクシナリオ。 |
|
|
DTS |
リアルタイム同期: 秒レベルのレイテンシーでデータ移行をサポートします。再開可能なアップロードやデータ検証などの機能を提供し、移行の信頼性を確保します。 |
|
サポートされています |
サポートされています |
クロスクラウドまたはハイブリッドクラウドデータベースのリアルタイム同期。高信頼性の移行が必要なシナリオ。 |
|
|
Flink |
ストリームとバッチの統合処理: Exactly-Once セマンティクスを備えたリアルタイムストリーム処理をサポートします。複雑な抽出、変換、ロード (ETL) シナリオのための計算とインポートを統合します。 |
|
サポートされています |
サポートされています |
リアルタイムデータウェアハウスの構築に適しています。統合されたストリーム処理とデータインポートが必要なシナリオ。 |
|
|
Kafka |
高スループットパイプライン: テラバイトレベルのデータバッファリングをサポートします。永続化およびマルチレプリカメカニズムを提供し、データ損失を防ぎます。 |
|
サポートされています |
サポートされています |
非同期データパイプラインシナリオ。プロデューサーとコンシューマーを分離し、高同時実行データをバッファリングします。 |
|
|
Spark |
分散コンピューティング: Spark エンジンを使用して大規模データを並列処理します。SQL と DataFrame 間の柔軟な変換をサポートします。 |
|
サポートされています |
サポートされています |
大規模な ETL 処理。SQL や DataFrame などの計算ロジックが必要なオフラインインポートシナリオ。 |
|
|
DataX |
プラグインベースのアーキテクチャ: 20 以上のデータソースへの拡張をサポートします。異種データソースからのエンタープライズレベル移行のためのオフラインバッチ同期を提供します。 |
|
サポートされていません |
サポートされています |
異種データソースのオフラインバッチ同期。高い拡張性を持つプラグインが必要なシナリオ。 |
|
|
SeaTunnel |
軽量 ETL: 設定駆動型パターンにより開発を簡素化します。リアルタイムの変更データキャプチャ (CDC) をサポートし、Flink および Spark エンジンと互換性があります。 |
|
サポートされています |
サポートされています |
シンプルな設定駆動型 CDC および軽量リアルタイム同期シナリオ。 |
|
|
BitSail |
マルチエンジン対応: MapReduce や Flink などの複数のコンピューティングフレームワークをサポートします。データシャーディング戦略を提供し、インポート効率を最適化します。 |
|
サポートされています |
サポートされています |
Flink や MapReduce (MR) などのコンピューティングフレームワーク間での柔軟な切り替えが必要なデータ移行シナリオ。 |