すべてのプロダクト
Search
ドキュメントセンター

OpenSearch:コンテンツ生成サービス

最終更新日:Jun 22, 2026

AI Search Open Platform では、API を介して大規模言語モデル (LLM) サービスを呼び出すことができます。これらのサービスには、Alibaba 独自の基盤モデルに基づいて微調整された、検索拡張生成 (RAG) に特化した大規模言語モデルが含まれます。これらのモデルをドキュメントの処理および検索サービスと組み合わせて RAG シナリオで使用すると、回答の精度を向上させ、ハルシネーション率を低減できます。

サービス

サービス ID

(service_id)

説明

QPS 上限

(Alibaba Cloud アカウントと RAM ユーザーの両方)

Qwen3-235B-A22B

qwen3-235b-a22b

Qwen シリーズの次世代大規模言語モデル (LLM) です。広範なトレーニングに基づき、Qwen3 は推論、指示追従、エージェント機能、多言語サポートにおいてブレークスルーを達成しました。100 以上の言語と方言をサポートし、強力な多言語理解、推論、生成能力を発揮します。

3

説明

より高い API QPS 制限をリクエストするには、テクニカルサポートにチケットを送信してください。

OpenSearch-Qwen-Turbo

ops-qwen-turbo

このモデルは、Qwen-Turbo 大規模言語モデルを基盤としています。教師あり学習を用いて微調整されており、検索能力が向上し、有害コンテンツの生成が低減されています。

Qwen-Turbo

qwen-turbo

Qwen シリーズの中で最も高速でコスト効率の高いモデルです。単純なタスクに適しています。

Qwen-Plus

qwen-plus

Qwen-Max と Qwen-Turbo の間でパフォーマンス、コスト、速度のバランスが取れたモデルです。中程度の複雑さのタスクに適しています。

Qwen-Max

qwen-max

Qwen シリーズの中で最も高性能なモデルです。複雑で多段階のタスクに適しています。

DeepSeek-R1

deepseek-r1

複雑な推論タスクに特化した大規模言語モデルです。複雑な指示の理解、結果の精度の確保、Web 検索機能のサポートに優れています。

DeepSeek-V3

deepseek-v3

DeepSeek-V3 は、混合エキスパート (MoE) モデルで、ロングテキスト、コード、数学、百科事典的な知識の処理に優れ、特に中国語において卓越した能力を発揮します。

DeepSeek-R1-distill-qwen-7b

deepseek-r1-distill-qwen-7b

知識蒸留により、DeepSeek-R1 が生成したトレーニングサンプルで Qwen-7B を微調整したモデルです。

DeepSeek-R1-distill-qwen-14b

deepseek-r1-distill-qwen-14b

知識蒸留により、DeepSeek-R1 が生成したトレーニングサンプルで Qwen-14B を微調整したモデルです。

DeepSeek-V4-Pro

deepseek-v4-pro

総パラメーター数 1.6T、アクティブパラメーター数 49B のフラッグシップ混合エキスパート (MoE) 大規模モデルで、数百万トークンの超ロングコンテキストをネイティブにサポートします。膨大な高品質トレーニングデータに基づいて構築されており、数理論理、複雑な推論、専門的なコーディング、ロングテキストの詳細な分析においてトップクラスの能力を発揮します。高度な科学研究、複雑なオフィス業務、詳細なインテリジェントエージェントなどの高度なシナリオに最適です。

DeepSeek-V4-Flash

deepseek-v4-flash

総パラメーター数 284B、アクティブパラメーター数 13B の効率的で軽量な混合エキスパート (MoE) モデルで、数百万トークンの超ロングコンテキストをネイティブにサポートします。高速な推論、低レイテンシー、低コストが特徴です。バランスの取れた総合能力を持ち、高同時実行性の軽量タスク向けに設計されており、日常会話、コンテンツ作成、基本的な RAG、バッチテキスト処理などの汎用シナリオに適しています。

前提条件

  • 認証情報の取得

    AI Search オープンプラットフォームでは、認証に API キーが必要です。手順については、「API キーの取得」をご参照ください。

  • サービスエンドポイントの取得

    パブリックネットワークまたは VPC 経由でサービスを呼び出せます。詳細については、「サービスエンドポイントの取得」をご参照ください。

リクエスト

一般的な注意事項

  • リクエストボディは 8 MB を超えることはできません。

HTTP メソッド

POST

URL

{host}/v3/openapi/workspaces/{workspace_name}/text-generation/{service_id} 

パスパラメーター

  • host:サービスのエンドポイント。API は、インターネット経由または VPC 内から呼び出すことができます。詳細については、「サービスエンドポイントの取得」をご参照ください。

    [API キー] ページの [アクセスドメイン名] セクションで、[パブリック API ドメイン名][プライベート API ドメイン名 (VPC)] を確認できます。ページ上部のドロップダウンリストから、対象のワークスペースに切り替えることができます。適切なドメイン名をホストとして選択してください。

  • workspace_name:ワークスペースの名前。例:default。

  • service_id:組み込みサービスの ID。例:ops-qwen-turbo。

リクエストパラメーター

ヘッダーパラメーター

API キー認証

パラメーター

必須

説明

Content-Type

String

はい

リクエスト形式。 application/json である必要があります。

application/json

Authorization

String

はい

認証用の API キー。

Bearer OS-d1**2a

ボディパラメーター

パラメーター

必須

説明

messages

List

はい

ユーザーとモデルの対話履歴です。リスト内の各要素は、 rolecontent キーを持つオブジェクトです。利用可能なロールは、 systemuserassistant です。

  • system:システムレベルのメッセージ。このロールは、履歴の最初のメッセージ ( messages[0]) にのみ使用できます。 system ロールの使用は任意ですが、存在する場合はリストの先頭に置く必要があります。

  • userassistant:ユーザーとモデルの対話を表します。これらのロールは、会話をシミュレートするために交互に配置する必要があります。最後のメッセージの roleuser である必要があります。

stream

Boolean

いいえ

ストリーミングレスポンスを返すかどうかを指定します。デフォルトは false です。

true に設定すると、レスポンスはストリーミングされ、各チャンクにはその時点までに生成された累積テキストが含まれます。

false

enable_search

Boolean

いいえ

Web 検索を有効にするかどうかを指定します。デフォルトは false です。

true に設定すると、大規模言語モデルは内部プロンプトを使用して Web 検索が必要かどうかを判断します。

説明

この機能は現在、 deepseek-r1 モデルでのみサポートされています。

false

csi_level

String

いいえ

コンテンツモデレーションのレベルです。デフォルト: strict

有効な値:

  • none:コンテンツモデレーションなし。

  • loose:緩いフィルタリング。

  • strict:厳格なフィルタリング。

  • rigorous:非常に厳格なフィルタリング。

strict

parameters

Map

いいえ

大規模言語モデルの調整可能なパラメーターのマップです。

N/A

parameters.search_return_result

Boolean

いいえ

このパラメーターは、 enable_searchtrue の場合にのみ有効です。

  • true:Web 検索結果を返します。

  • false:Web 検索結果を返しません。

false

parameters.search_top_k

Integer

いいえ

返される Web 検索結果の数です。

説明

このパラメーターは、 enable_searchtrue の場合にのみ有効です。 deepseek-r1 モデルでのみサポートされています。

5

parameters.search_way

String

いいえ

Web 検索戦略です。Web 検索 API の戦略と同じです。

  • normal (デフォルト):モデルはクエリを書き換え、Web 検索を実行し、ベクトル化を使用して結果をフィルタリングします。

  • fast:モデルはクエリを書き換え、Web 検索を実行します。検索結果はフィルタリングされません。

  • full:モデルはクエリを書き換え、Web 検索を実行し、その後モデルを使用して結果を評価およびフィルタリングします。

説明

このパラメーターは、 enable_searchtrue の場合にのみ有効です。 deepseek-r1 モデルでのみサポートされています。

normal

parameters.seed

Integer

いいえ

生成に使用する乱数シードです。モデルの出力のランダム性を制御します。シードは 64 ビットの符号なし整数である必要があります。シードが指定されると、モデルは同じまたは類似の結果を生成しようとしますが、決定論的な出力は保証されません。

"parameters":{"seed":666}

parameters.max_tokens

Integer

いいえ

生成するトークンの最大数です。Qwen-Turbo の場合、最大値とデフォルト値は 1,500 です。Qwen-Max と Qwen-Plus の場合、最大値とデフォルト値は 2,000 です。

"parameters":{"max_tokens":1500}

parameters.top_p

Float

いいえ

核サンプリングにおける確率のしきい値です。たとえば、値が 0.8 の場合、累積確率が 80% 以上になる最小のトークンセットのみがサンプリングの対象となります。値は (0, 1.0) の範囲でなければなりません。値を大きくするとランダム性が増し、小さくするとランダム性が減ります。

"parameters":{"top_p":0.7}

parameters.top_k

Integer

いいえ

サンプリングにおける候補セットのサイズです。たとえば、値が 50 の場合、最も可能性の高い上位 50 トークンのみがランダムサンプリングの候補セットとして使用されます。値を大きくするとランダム性が増し、小さくすると決定論的になります。注: top_k が指定されていないか、その値が 100 より大きい場合、このポリシーは無効になり、 top_p ポリシーのみが有効になります。

"parameters":{"top_k":50}

parameters.repetition_penalty

Float

いいえ

シーケンス内でトークンを繰り返すことに対するペナルティを制御します。値を大きくすると繰り返しが減少します。値が 1.0 の場合はペナルティなしを意味します。値は 0 より大きい必要があります。

"parameters":{"repetition_penalty":1.0}

parameters.presence_penalty

Float

いいえ

出力全体でトークンを繰り返すことに対するペナルティを制御します。値を大きくすると繰り返しが減少します。値は [-2.0, 2.0] の範囲でなければなりません。

"parameters":{"presence_penalty":1.0}

parameters.temperature

Float

いいえ

出力のランダム性と多様性の度合いを制御します。温度を高くすると、候補トークンの確率分布が平滑化され、可能性の低い単語がより出やすくなり、多様性が増します。温度を低くすると、分布のピークが鋭くなり、確率の高い単語がより出やすくなり、決定論的な出力に近づきます。

値は [0, 2) の範囲でなければなりません。値 0 は推奨されません。

"parameters":{"temperature":0.85}

parameters.stop

string/array

いいえ

モデルが指定された文字列またはトークン ID を生成する前に生成を停止することで、出力を正確に制御できます。生成されたコンテンツには停止シーケンスは含まれません。値は文字列または配列にすることができます。

  • 文字列型

    モデルは、指定された停止語を生成しようとすると停止します。

    たとえば、 stop が "Hello" の場合、生成は "Hello" を出力する直前で停止します。

  • 配列型

    要素は、文字列、トークン ID、またはトークン ID の配列にすることができます。次に生成されるトークン (または対応する ID) が停止配列に含まれている場合、生成は停止します。

    たとえば、stop["hello","weather"] または [108386,104307] に設定すると、モデルは "hello" または "weather" を生成しようとすると停止します。stop[[108386, 103924],[35946, 101243]] に設定すると、モデルは "hello there" または "I'm fine" を生成しようとすると停止します。

    stop が配列の場合、同じトップレベルの配列内に文字列とトークン ID を混在させることはできません。例えば、["Hello", 104307] は無効です。

"parameters":{"stop":["Hello","Weather"]}

説明

ops-qwen-turbo の最大トークン数は 4,000 です。

レスポンスパラメーター

パラメーター

説明

result.text

String

モデルによって生成されたテキストです。

鄭州は...

result.search_results

List<SearchResult>

enable_searchtrue で、 parameters.search_return_resulttrue の場合、このフィールドには Web 検索結果が含まれます。

[]

result.search_results[].title

String

検索結果のタイトルです。

今日の鄭州の天気

result.search_results[].url

String

検索結果の URL です。

https://xxxx.com

result.search_results[].snippet

String

検索結果の Web ページのコンテンツからの簡単なスニペットです。

今日の鄭州の天気は晴れです。

usage.output_tokens

Integer

生成されたテキスト内のトークン数です。

100

usage.input_tokens

Integer

入力プロンプト内のトークン数です。

100

usage.total_tokens

Integer

リクエストの合計トークン数 (入力と出力) です。

200

cURL リクエストの例

curl -X POST \
-H "Content-Type: application/json" \
-H "Authorization: Bearer YOUR_API_KEY" \
"http://xxxx-hangzhou.opensearch.aliyuncs.com/v3/openapi/workspaces/default/text-generation/deepseek-r1" \
-d '{
      "messages":[
      {
          "role":"system",
          "content":"あなたは役に立つアシスタントです。"
      },
      {
          "role":"user",
          "content":"河南省の省都はどこですか?"
      },
      {
          "role":"assistant",
          "content":"鄭州です"
      },
      {
          "role":"user",
          "content":"今日の鄭州の天気はどうですか?"
      }
      ],
      "parameters":{
          "search_return_result":true,
          "search_top_k":5,
          "search_way":"normal"
      },
       "stream":false,
       "enable_search":true
}'

レスポンスの例

成功レスポンスの例

{
  "request_id": "450fcb80-f796-****-8d69-e1e86d29aa9f",
  "latency": 564.903929,
  "result": {
    "text":"最新の天気予報によると、今日の鄭州は曇りで、気温は 9°C から 19°C、北東の微風が吹くでしょう...",
     "search_results":[
      {
        "url":"https://xxxxx.com",
        "title":"xxxx",
        "snippet":"今日の鄭州の天気は晴れです。"
      }
    ]
   },
  "usage": {
      "output_tokens": 934,
      "input_tokens": 798,
      "total_tokens": 1732
  }
}

エラーレスポンスの例

エラーが発生した場合、レスポンスにはエラーを説明する codemessage が含まれます。

{
    "request_id": "45C8C9E5-6BCB-****-80D3-E298F788512B",
    "latency": 0,
    "code": "InvalidParameter",
    "message": "JSON parse error: Unexpected character ..."
}

ステータスコード

詳細については、「AI Search Open Platform のステータスコード」をご参照ください。