AI Search Open Platform では、API を介して大規模言語モデル (LLM) サービスを呼び出すことができます。これらのサービスには、Alibaba 独自の基盤モデルに基づいて微調整された、検索拡張生成 (RAG) に特化した大規模言語モデルが含まれます。これらのモデルをドキュメントの処理および検索サービスと組み合わせて RAG シナリオで使用すると、回答の精度を向上させ、ハルシネーション率を低減できます。
|
サービス |
サービス ID (service_id) |
説明 |
QPS 上限 (Alibaba Cloud アカウントと RAM ユーザーの両方) |
|
Qwen3-235B-A22B |
qwen3-235b-a22b |
Qwen シリーズの次世代大規模言語モデル (LLM) です。広範なトレーニングに基づき、Qwen3 は推論、指示追従、エージェント機能、多言語サポートにおいてブレークスルーを達成しました。100 以上の言語と方言をサポートし、強力な多言語理解、推論、生成能力を発揮します。 |
3 説明
より高い API QPS 制限をリクエストするには、テクニカルサポートにチケットを送信してください。 |
|
OpenSearch-Qwen-Turbo |
ops-qwen-turbo |
このモデルは、Qwen-Turbo 大規模言語モデルを基盤としています。教師あり学習を用いて微調整されており、検索能力が向上し、有害コンテンツの生成が低減されています。 |
|
|
Qwen-Turbo |
qwen-turbo |
Qwen シリーズの中で最も高速でコスト効率の高いモデルです。単純なタスクに適しています。 |
|
|
Qwen-Plus |
qwen-plus |
Qwen-Max と Qwen-Turbo の間でパフォーマンス、コスト、速度のバランスが取れたモデルです。中程度の複雑さのタスクに適しています。 |
|
|
Qwen-Max |
qwen-max |
Qwen シリーズの中で最も高性能なモデルです。複雑で多段階のタスクに適しています。 |
|
|
DeepSeek-R1 |
deepseek-r1 |
複雑な推論タスクに特化した大規模言語モデルです。複雑な指示の理解、結果の精度の確保、Web 検索機能のサポートに優れています。 |
|
|
DeepSeek-V3 |
deepseek-v3 |
DeepSeek-V3 は、混合エキスパート (MoE) モデルで、ロングテキスト、コード、数学、百科事典的な知識の処理に優れ、特に中国語において卓越した能力を発揮します。 |
|
|
DeepSeek-R1-distill-qwen-7b |
deepseek-r1-distill-qwen-7b |
知識蒸留により、DeepSeek-R1 が生成したトレーニングサンプルで Qwen-7B を微調整したモデルです。 |
|
|
DeepSeek-R1-distill-qwen-14b |
deepseek-r1-distill-qwen-14b |
知識蒸留により、DeepSeek-R1 が生成したトレーニングサンプルで Qwen-14B を微調整したモデルです。 |
|
|
DeepSeek-V4-Pro |
deepseek-v4-pro |
総パラメーター数 1.6T、アクティブパラメーター数 49B のフラッグシップ混合エキスパート (MoE) 大規模モデルで、数百万トークンの超ロングコンテキストをネイティブにサポートします。膨大な高品質トレーニングデータに基づいて構築されており、数理論理、複雑な推論、専門的なコーディング、ロングテキストの詳細な分析においてトップクラスの能力を発揮します。高度な科学研究、複雑なオフィス業務、詳細なインテリジェントエージェントなどの高度なシナリオに最適です。 |
|
|
DeepSeek-V4-Flash |
deepseek-v4-flash |
総パラメーター数 284B、アクティブパラメーター数 13B の効率的で軽量な混合エキスパート (MoE) モデルで、数百万トークンの超ロングコンテキストをネイティブにサポートします。高速な推論、低レイテンシー、低コストが特徴です。バランスの取れた総合能力を持ち、高同時実行性の軽量タスク向けに設計されており、日常会話、コンテンツ作成、基本的な RAG、バッチテキスト処理などの汎用シナリオに適しています。 |
前提条件
-
認証情報の取得
AI Search オープンプラットフォームでは、認証に API キーが必要です。手順については、「API キーの取得」をご参照ください。
-
サービスエンドポイントの取得
パブリックネットワークまたは VPC 経由でサービスを呼び出せます。詳細については、「サービスエンドポイントの取得」をご参照ください。
リクエスト
一般的な注意事項
-
リクエストボディは 8 MB を超えることはできません。
HTTP メソッド
POST
URL
{host}/v3/openapi/workspaces/{workspace_name}/text-generation/{service_id}
パスパラメーター
-
host:サービスのエンドポイント。API は、インターネット経由または VPC 内から呼び出すことができます。詳細については、「サービスエンドポイントの取得」をご参照ください。
[API キー] ページの [アクセスドメイン名] セクションで、[パブリック API ドメイン名] と [プライベート API ドメイン名 (VPC)] を確認できます。ページ上部のドロップダウンリストから、対象のワークスペースに切り替えることができます。適切なドメイン名をホストとして選択してください。
-
workspace_name:ワークスペースの名前。例:default。
-
service_id:組み込みサービスの ID。例:ops-qwen-turbo。
リクエストパラメーター
ヘッダーパラメーター
API キー認証
|
パラメーター |
型 |
必須 |
説明 |
例 |
|
Content-Type |
String |
はい |
リクエスト形式。 |
application/json |
|
Authorization |
String |
はい |
認証用の API キー。 |
Bearer OS-d1**2a |
ボディパラメーター
|
パラメーター |
型 |
必須 |
説明 |
例 |
|
messages |
List |
はい |
ユーザーとモデルの対話履歴です。リスト内の各要素は、
|
|
|
stream |
Boolean |
いいえ |
ストリーミングレスポンスを返すかどうかを指定します。デフォルトは
|
false |
|
enable_search |
Boolean |
いいえ |
Web 検索を有効にするかどうかを指定します。デフォルトは
説明
この機能は現在、 |
false |
|
csi_level |
String |
いいえ |
コンテンツモデレーションのレベルです。デフォルト: 有効な値:
|
strict |
|
parameters |
Map |
いいえ |
大規模言語モデルの調整可能なパラメーターのマップです。 |
N/A |
|
parameters.search_return_result |
Boolean |
いいえ |
このパラメーターは、
|
false |
|
parameters.search_top_k |
Integer |
いいえ |
返される Web 検索結果の数です。 説明
このパラメーターは、 |
5 |
|
parameters.search_way |
String |
いいえ |
Web 検索戦略です。Web 検索 API の戦略と同じです。
説明
このパラメーターは、 |
normal |
|
parameters.seed |
Integer |
いいえ |
生成に使用する乱数シードです。モデルの出力のランダム性を制御します。シードは 64 ビットの符号なし整数である必要があります。シードが指定されると、モデルは同じまたは類似の結果を生成しようとしますが、決定論的な出力は保証されません。 |
"parameters":{"seed":666} |
|
parameters.max_tokens |
Integer |
いいえ |
生成するトークンの最大数です。Qwen-Turbo の場合、最大値とデフォルト値は 1,500 です。Qwen-Max と Qwen-Plus の場合、最大値とデフォルト値は 2,000 です。 |
"parameters":{"max_tokens":1500} |
|
parameters.top_p |
Float |
いいえ |
核サンプリングにおける確率のしきい値です。たとえば、値が |
"parameters":{"top_p":0.7} |
|
parameters.top_k |
Integer |
いいえ |
サンプリングにおける候補セットのサイズです。たとえば、値が |
"parameters":{"top_k":50} |
|
parameters.repetition_penalty |
Float |
いいえ |
シーケンス内でトークンを繰り返すことに対するペナルティを制御します。値を大きくすると繰り返しが減少します。値が |
"parameters":{"repetition_penalty":1.0} |
|
parameters.presence_penalty |
Float |
いいえ |
出力全体でトークンを繰り返すことに対するペナルティを制御します。値を大きくすると繰り返しが減少します。値は [-2.0, 2.0] の範囲でなければなりません。 |
"parameters":{"presence_penalty":1.0} |
|
parameters.temperature |
Float |
いいえ |
出力のランダム性と多様性の度合いを制御します。温度を高くすると、候補トークンの確率分布が平滑化され、可能性の低い単語がより出やすくなり、多様性が増します。温度を低くすると、分布のピークが鋭くなり、確率の高い単語がより出やすくなり、決定論的な出力に近づきます。 値は [0, 2) の範囲でなければなりません。値 0 は推奨されません。 |
"parameters":{"temperature":0.85} |
|
parameters.stop |
string/array |
いいえ |
モデルが指定された文字列またはトークン ID を生成する前に生成を停止することで、出力を正確に制御できます。生成されたコンテンツには停止シーケンスは含まれません。値は文字列または配列にすることができます。
|
"parameters":{"stop":["Hello","Weather"]} |
ops-qwen-turbo の最大トークン数は 4,000 です。
レスポンスパラメーター
|
パラメーター |
型 |
説明 |
例 |
|
result.text |
String |
モデルによって生成されたテキストです。 |
鄭州は... |
|
result.search_results |
List<SearchResult> |
|
[] |
|
result.search_results[].title |
String |
検索結果のタイトルです。 |
今日の鄭州の天気 |
|
result.search_results[].url |
String |
検索結果の URL です。 |
https://xxxx.com |
|
result.search_results[].snippet |
String |
検索結果の Web ページのコンテンツからの簡単なスニペットです。 |
今日の鄭州の天気は晴れです。 |
|
usage.output_tokens |
Integer |
生成されたテキスト内のトークン数です。 |
100 |
|
usage.input_tokens |
Integer |
入力プロンプト内のトークン数です。 |
100 |
|
usage.total_tokens |
Integer |
リクエストの合計トークン数 (入力と出力) です。 |
200 |
cURL リクエストの例
curl -X POST \
-H "Content-Type: application/json" \
-H "Authorization: Bearer YOUR_API_KEY" \
"http://xxxx-hangzhou.opensearch.aliyuncs.com/v3/openapi/workspaces/default/text-generation/deepseek-r1" \
-d '{
"messages":[
{
"role":"system",
"content":"あなたは役に立つアシスタントです。"
},
{
"role":"user",
"content":"河南省の省都はどこですか?"
},
{
"role":"assistant",
"content":"鄭州です"
},
{
"role":"user",
"content":"今日の鄭州の天気はどうですか?"
}
],
"parameters":{
"search_return_result":true,
"search_top_k":5,
"search_way":"normal"
},
"stream":false,
"enable_search":true
}'
レスポンスの例
成功レスポンスの例
{
"request_id": "450fcb80-f796-****-8d69-e1e86d29aa9f",
"latency": 564.903929,
"result": {
"text":"最新の天気予報によると、今日の鄭州は曇りで、気温は 9°C から 19°C、北東の微風が吹くでしょう...",
"search_results":[
{
"url":"https://xxxxx.com",
"title":"xxxx",
"snippet":"今日の鄭州の天気は晴れです。"
}
]
},
"usage": {
"output_tokens": 934,
"input_tokens": 798,
"total_tokens": 1732
}
}
エラーレスポンスの例
エラーが発生した場合、レスポンスにはエラーを説明する code と message が含まれます。
{
"request_id": "45C8C9E5-6BCB-****-80D3-E298F788512B",
"latency": 0,
"code": "InvalidParameter",
"message": "JSON parse error: Unexpected character ..."
}
ステータスコード
詳細については、「AI Search Open Platform のステータスコード」をご参照ください。