すべてのプロダクト
Search
ドキュメントセンター

:UploadDocumentAsync

最終更新日:Mar 21, 2026

非同期ドキュメントアップロード

操作説明

サーバーは、ファイル拡張子に基づいてドキュメントをロードし、チャンクに分割します。CreateDocumentCollection 操作を呼び出す際に指定された埋め込みモデルを使用してベクトル化を実行し、指定されたドキュメントコレクションにドキュメントを書き込みます。この操作は、テキストとイメージのさまざまな形式に対応するマルチモーダル埋め込みをサポートしています。

関連操作:

  • GetUploadDocumentJob 操作を呼び出して、ドキュメントアップロードジョブの進捗と結果をクエリできます。

  • CancelUploadDocumentJob 操作を呼び出して、ドキュメントアップロードジョブをキャンセルできます。

説明
  • ドキュメントアップロードリクエストが提出されると、そのリクエストは処理のためにキューに入れられます。Resource Access Management (RAM) ユーザーまたは Alibaba Cloud アカウント内で、Pending および Running 状態のドキュメントは最大 20 個まで処理できます。

  • テキストドキュメントは、最大 100,000 個のチャンクに分割できます。

  • ドキュメントコレクションが OnePeace モデルを使用する場合、各 RAM ユーザーまたは Alibaba Cloud アカウントは、最大 10,000 個のイメージをアップロードおよびクエリできます。

今すぐお試しください

この API を OpenAPI Explorer でお試しください。手作業による署名は必要ありません。呼び出しに成功すると、入力したパラメーターに基づき、資格情報が組み込まれた SDK コードが自動的に生成されます。このコードをダウンロードしてローカルで使用できます。

テスト

RAM 認証

下表に、この API を呼び出すために必要な認証情報を示します。認証情報は、RAM (Resource Access Management) ポリシーを使用して定義できます。以下で各列名について説明します。

  • アクション:特定のリソースに対して実行可能な操作。ポリシー構文ではAction要素として指定します。

  • API:アクションを具体的に実行するための API。

  • アクセスレベル:各 API に対して事前定義されているアクセスの種類。有効な値:create、list、get、update、delete。

  • リソースタイプ:アクションが作用するリソースの種類。リソースレベルでの権限をサポートするかどうかを示すことができます。ポリシーの有効性を確保するため、アクションの対象として適切なリソースを指定してください。

    • リソースレベルの権限を持つ API の場合、必要なリソースタイプはアスタリスク (*) でマークされます。ポリシーのResource要素で対応する ARN を指定してください。

    • リソースレベルの権限を持たない API の場合、「すべてのリソース」と表示され、ポリシーのResource要素でアスタリスク (*) でマークされます。

  • 条件キー:サービスによって定義された条件のキー。このキーにより、きめ細やかなアクセス制御が可能になります。この制御は、アクション単体に適用することも、特定のリソースに対するアクションに適用することもできます。Alibaba Cloud は、サービス固有の条件キーに加えて、すべての RAM 統合サービスに適用可能な一連の共通条件キーを提供しています。

  • 依存アクション:ある特定のアクションを実行するために、前提として実行が必要となる他のアクション。依存アクションの権限も RAM ユーザーまたは RAM ロールに付与する必要があります。

アクション

アクセスレベル

リソースタイプ

条件キー

依存アクション

gpdb:UploadDocumentAsync

create

*Document

acs:gpdb:{#regionId}:{#accountId}:document/{#DBInstanceId}

なし なし

リクエストパラメーター

パラメーター

必須 / 任意

説明

DBInstanceId

string

必須

ベクトルエンジン最適化アクセラレーションが有効になっているインスタンス ID です。DescribeDBInstances API を呼び出すと、ターゲットリージョン内のすべての AnalyticDB PostgreSQL インスタンスの詳細 (インスタンス ID を含む) を表示できます。

gp-bp12ga6v69h86****

Collection

string

必須

ドキュメントライブラリの名前です。

説明

CreateDocumentCollection API によって作成されます。ListDocumentCollections API を呼び出すと、すでに作成されているドキュメントライブラリを表示できます。

document

Namespace

string

任意

名前空間です。デフォルトは public です。CreateNamespace インターフェイスを通じて作成し、ListNamespaces インターフェイスを通じてリストを表示できます。

mynamespace

NamespacePassword

string

必須

名前空間に対応するパスワードです。> この値は CreateNamespace インターフェイスによって指定されます。

testpassword

RegionId

string

必須

インスタンスのリージョン ID です。

cn-hangzhou

FileName

string

必須

アップロードされるファイルの名前です。

説明
  • ファイル名: .json、.md、.pdf。

  • イメージ: .bmp、.jpg、.jpeg、.png、.tiff。

  • 圧縮パッケージ。パッケージファイル名には拡張子が含まれている必要があります: .tar、.gz、.zip。

mydoc.txt

FileUrl

string

必須

公開アクセス可能なドキュメントの URL です。

説明
説明
  • このインターフェイスは SDK を使用して呼び出すことを推奨します。SDK には、ローカルファイルを直接アップロードするための UploadDocumentAsyncAdvance というメソッドが用意されています。> - URL がイメージアーカイブを指している場合、アーカイブ内のイメージ数は 100 を超えてはなりません。

https://xx/mydoc.txt

Metadata

object

任意

メタデータです。このパラメーターの値は、CreateDocumentCollection 操作を呼び出す際に指定する Metadata パラメーターと同じである必要があります。

any

任意

メタデータです。このパラメーターの値は、CreateDocumentCollection 操作を呼び出す際に指定する Metadata パラメーターと同じである必要があります。

{"title":"mytitle","page":1}

ChunkSize

integer

任意

大規模データを処理するための戦略: データがより小さな部分に分割される際の各チャンクのサイズです。最大値は 2048 です。

250

ChunkOverlap

integer

任意

連続するチャンク間で重複するデータのサイズです。このパラメーターの最大値は、ChunkSize パラメーターの値を超えることはできません。

説明

このパラメーターは、データ切り捨てによって発生する可能性のあるコンテキストの欠落を防ぐために使用されます。たとえば、長文テキストをアップロードする際に、連続するチャンク間で特定の重複するテキストコンテンツを保持することで、コンテキストをよりよく理解できます。

50

Separators

array

任意

大量のデータを分割するために使用される区切り文字です。

説明
  • これは、チャンク化効果を決定する重要なパラメーターです。このパラメーターは、TextSplitterName パラメーターで指定されるスプリッターに関連しています。

  • ほとんどの場合、このパラメーターを指定する必要はありません。サーバーは TextSplitterName パラメーターの値に基づいて区切り文字を割り当てます。

string

任意

区切り文字です。

.

DryRun

boolean

任意

ドキュメント理解とチャンク化のみを実行し、ベクトル化とストレージは実行しないかどうかを指定します。デフォルト値: false。

説明

このパラメーターを true に設定して、チャンク化効果を確認し、必要に応じて最適化を実行できます。

false

ZhTitleEnhance

boolean

任意

タイトルエンハンスメントを有効にするかどうかを指定します。

説明

タイトルテキストを決定し、メタデータ内のテキストをマークし、そのテキストを上位レベルのタイトルと組み合わせてテキストエンハンスメントを実装できます。

false

TextSplitterName

string

任意

区切り文字の名前です。有効な値:

  • ChineseRecursiveTextSplitter: RecursiveCharacterTextSplitter を継承し、デフォルトでデリミタ["\n\n","\n", "。 |! |?", "\.\s|\! \s|\?\s", ";|;\s", ",|,\s"] を使用し、正規表現を用いてテキストを照合します。

  • RecursiveCharacterTextSplitter: デフォルトでデリミタ ["\n\n", "\n", " ", ""] を使用します。このスプリッターは、C++、Go、Java、JS、PHP、Proto、Python、RST、Ruby、Rust、Scala、Swift、Markdown、LaTeX、HTML、Sol、C Sharp などの言語のコードの分割をサポートしています。

  • SpacyTextSplitter: デフォルトでデリミタ \n\n を使用し、spaCy en_core_web_sm モデルを活用します。このスプリッターは、より優れたテキスト分割パフォーマンスを実現できます。

  • MarkdownHeaderTextSplitter: [("#", "head1"), ("##", "head2"), ("###", "head3"), ("####", "head4")] 形式でテキストを分割します。このスプリッターは Markdown テキストでうまく機能します。

  • LLMSplitter: LLM を使用してテキストを分割します。デフォルトモデルは qwen3-8b です。現在、このスプリッターは ADBPGLoader が選択されている場合にのみ機能します。

ChineseRecursiveTextSplitter

DocumentLoaderName

string

任意

ファイルを処理するために使用するドキュメントローダーを指定します。このパラメーターが省略された場合、システムはファイルの拡張子に基づいてローダーを自動的に選択します。有効な値:[有効なローダー名のリストがここに表示されます] 有効な値:

  • UnstructuredHTMLLoader: .html

  • UnstructuredMarkdownLoader: .md

  • PyMuPDFLoader: .pdf

  • PyPDFLoader: .pdf

  • RapidOCRPDFLoader: .pdf

  • PDFWithImageRefLoader: .pdf (テキストとイメージの関連付け機能付き)

  • JSONLoader: .json

  • CSVLoader: .csv

  • RapidOCRLoader: .png、.jpg、.jpeg、.bmp

  • UnstructuredFileLoader: .eml、.msg、.rst、.txt、.docx、.epub、.odt、.pptx、.tsv

  • ADBPGLoader (最初の 3,000 ページは無料): .pdf、.doc、.docx、.ppt、.pptx、.xls、.xlsx、.xlsm、.csv、.txt、.jpg、.jpeg、.png、.bmp、.gif、.md、.html、.epub、.mobi、.rtf

PyMuPDFLoader

VlEnhance

boolean

任意

複雑なドキュメントに対して VL拡張コンテンツ認識を有効にするかどうかを指定します。デフォルト値: false。

説明
  • 紛らわしい組版と書式設定を持つ複雑なドキュメントの場合、VL拡張コンテンツ認識を有効にすることを推奨します。

  • VL拡張コンテンツ認識を有効にすると、ドキュメント処理時間が長くなります。

  • VL拡張コンテンツ認識を有効にすると、ドキュメント内のイメージは格納または再現できません。

false

SplitterModel

string

任意

DocumentLoaderName が ADBPGLoader に設定され、TextSplitterName が LLMSplitter に設定されている場合、分割モデルを指定できます。デフォルト値: qwen3-8b。

説明

サポートされている分割モデル: qwq-plus、qwq-plus-latest、qwen-max、qwen-max-latest、qwen-plus、qwen-plus-latest、qwen-turbo、qwen-turbo-latest、qwen3-235b-a22b、qwen3-32b、qwen3-30b-a3b、qwen3-14b、qwen3-8b、qwen3-4b、qwen3-1.7b、qwen3-0.6b、qwq-32b qwen2.5-14b-instruct-1m、qwen2.5-7b-instruct-1m、qwen2.5-72b-Instruct、qwen2.5-32b-Instruct、qwen2.5-14b-Instruct、qwen2.5-7b-Instruct、qwen2.5-3b-instruct、qwen2.5-1.5b-instruct、qwen2.5-0.5b-instruct。

qwen3-8b

レスポンスフィールド

フィールド

説明

object

RequestId

string

リクエスト ID です。

ABB39CC3-4488-4857-905D-2E4A051D0521

Message

string

返されたメッセージです。

success

Status

string

API 実行ステータス。以下の値があります:

  • success: 実行に成功しました。

  • fail: 実行に失敗しました。

success

JobId

string

ジョブ ID です。

231460f8-75dc-405e-a669-0c5204887e91

成功レスポンス

JSONJSON

{
  "RequestId": "ABB39CC3-4488-4857-905D-2E4A051D0521",
  "Message": "success",
  "Status": "success",
  "JobId": "231460f8-75dc-405e-a669-0c5204887e91"
}

エラーコード

完全なリストについては、「エラーコード」をご参照ください。

変更履歴

完全なリストについては、「変更履歴」をご参照ください。