すべてのプロダクト
Search
ドキュメントセンター

ApsaraDB for SelectDB:データインポートの概要

最終更新日:Jul 09, 2026

ApsaraDB for SelectDB は、ネイティブインターフェースやエコシステムツールなど、さまざまなデータインポート方法をサポートしています。これらの方法は、リアルタイムデータストリームからオフラインバッチ処理まで、幅広いシナリオに適しています。このトピックでは、SelectDB にデータをインポートするための主要なインターフェースとツールについて説明します。

データインポートの推奨事項

  • Alibaba Cloud エコシステム内のデータソースの場合: DTS および DataWorks

  • Alibaba Cloud エコシステム外のデータソースの場合:

    • インポートインターフェース: Kafka データソースの場合は Routine Load を使用します。その他のデータソースの場合は Stream Load を使用します。

    • インポートツール: Flink

  • 大規模データの場合:

    • インポートインターフェース: Kafka データソースの場合は Routine Load を使用します。その他のデータソースの場合は Stream Load を使用します。

    • インポートツール: Alibaba Cloud エコシステム内の MySQL データソースの場合は DTS を使用します。Alibaba Cloud エコシステム外の MySQL データソースおよび MySQL 以外のデータソースの場合は Flink を使用します。

インターフェースおよびツールの詳細については、以下の インポートインターフェース および インポートツール をご参照ください。

インポートインターフェース

インターフェース

機能

サポートされているデータ形式

シナリオ

操作手順

Stream Load (推奨)

  • HTTP 経由でデータを転送します。

  • 同期的インターフェースで、リクエスト完了後すぐに結果を返します。

CSV、JSON、PARQUET、または ORC

ローカルファイルまたはデータストリームをリアルタイムまたはバッチで SelectDB にインポートできます。

Stream Load

Routine Load

リアルタイムでデータストリームを処理します。

CSV または JSON

継続的なジョブは、指定されたデータソースからデータを継続的に読み取り、SelectDB にインポートします。

説明

現在、Kafka データソースのみがサポートされています。

Routine Load

Broker Load

  • 1 つのジョブで最大数百 GB のデータのインポートが可能です。

  • 非同期インターフェース。

CSV、PARQUET、または ORC

OSS、HDFS、S3 などのリモートストレージシステムからデータを読み取り、SelectDB にインポートします。

Broker Load

OSS Load

  • 内部ネットワーク経由でデータを転送し、パブリック帯域幅の消費を削減します。

  • 1 つのジョブで数百 GB のデータをインポートできます。

CSV、PARQUET、または ORC

Alibaba Cloud OSS から SelectDB にデータをインポートします。

OSS Load

Insert Into

insert into values ステートメントはパフォーマンスが低いため、本番環境では使用しないでください。

データベーステーブルからデータを読み取ります。ファイル形式は関与しません。

  • Insert Into Values は、SelectDB にごく少量のデータをインポートし、リクエスト頻度が 5 分に 1 回以下であるシナリオに適しています。

  • Insert Into Select は、SelectDB 内部または外部データレイクのデータを処理し、その結果を SelectDB の新しいテーブルにインポートする場合に適しています。この方法は非常に効率的です。

Insert Into

インポートツール

ツール

機能

サポートされているデータソース

増分データ

履歴データ

シナリオ

操作手順

DataWorks

エンドツーエンド管理: タスクスケジューリング、データ監視、データリネージ分析を統合します。 Alibaba Cloud エコシステムとのシームレスな統合 をサポートします。

  • MySQL

  • Alibaba Cloud ClickHouse

  • StarRocks

サポートされていません

サポートされています

タスクオーケストレーションおよび監視が必要な、エンタープライズレベルのデータ統合および複雑なデータリンクシナリオ。

DataWorks を使用したデータのインポート

DTS

リアルタイム同期: 秒レベルのレイテンシーでデータ移行をサポートします。再開可能なアップロードやデータ検証などの機能を提供し、移行の信頼性を確保します。

  • MySQL

  • PostgreSQL

サポートされています

サポートされています

クロスクラウドまたはハイブリッドクラウドデータベースのリアルタイム同期。高信頼性の移行が必要なシナリオ。

DTS を使用したデータのインポート

Flink

ストリームとバッチの統合処理: Exactly-Once セマンティクスを備えたリアルタイムストリーム処理をサポートします。複雑な抽出、変換、ロード (ETL) シナリオのための計算とインポートを統合します。

  • MySQL

  • Kafka

  • Oracle

  • PostgreSQL

  • SQL Server

サポートされています

サポートされています

リアルタイムデータウェアハウスの構築に適しています。統合されたストリーム処理とデータインポートが必要なシナリオ。

Flink を使用したデータのインポート

Kafka

高スループットパイプライン: テラバイトレベルのデータバッファリングをサポートします。永続化およびマルチレプリカメカニズムを提供し、データ損失を防ぎます。

  • Kafka

サポートされています

サポートされています

非同期データパイプラインシナリオ。プロデューサーとコンシューマーを分離し、高同時実行データをバッファリングします。

Kafka を使用したデータのインポート

Spark

分散コンピューティング: Spark エンジンを使用して大規模データを並列処理します。SQL と DataFrame 間の柔軟な変換をサポートします。

  • MySQL

  • PostgreSQL

  • HDFS

  • S3

サポートされています

サポートされています

大規模な ETL 処理。SQL や DataFrame などの計算ロジックが必要なオフラインインポートシナリオ。

Spark を使用したデータのインポート

DataX

プラグインベースのアーキテクチャ: 20 以上のデータソースへの拡張をサポートします。異種データソースからのエンタープライズレベル移行のためのオフラインバッチ同期を提供します。

  • MySQL

  • Oracle

  • HDFS

  • Hive

  • ODPS

  • HBase

  • FTP

サポートされていません

サポートされています

異種データソースのオフラインバッチ同期。高い拡張性を持つプラグインが必要なシナリオ。

DataX を使用したデータのインポート

SeaTunnel

軽量 ETL: 設定駆動型パターンにより開発を簡素化します。リアルタイムの変更データキャプチャ (CDC) をサポートし、Flink および Spark エンジンと互換性があります。

  • MySQL

  • Hive

  • Kafka

サポートされています

サポートされています

シンプルな設定駆動型 CDC および軽量リアルタイム同期シナリオ。

SeaTunnel を使用したデータのインポート

BitSail

マルチエンジン対応: MapReduce や Flink などの複数のコンピューティングフレームワークをサポートします。データシャーディング戦略を提供し、インポート効率を最適化します。

  • MySQL

  • Hive

  • Kafka

サポートされています

サポートされています

Flink や MapReduce (MR) などのコンピューティングフレームワーク間での柔軟な切り替えが必要なデータ移行シナリオ。

BitSail を使用したデータのインポート