量子化などの技術を用いてモデルを圧縮し、推論コストを削減します。
概要
モデル圧縮 API は、量子化などの技術を通じてカスタムフルパラメータファインチューニングモデルを圧縮し、推論時のメモリ使用量を削減し、スループットを向上させます。現在、圧縮機能は量子化のみをサポートしており、テンプレートのクエリ、ジョブの作成、ステータスのポーリング、ログの取得、ジョブのキャンセル/削除まで、完全なライフサイクルをカバーしています。
典型的なフロー:
- 量子化可能なモデルと設定テンプレートをリストアップ →
template_idと量子化可能なmodelを取得 - 圧縮ジョブを作成 →
job_idを取得 - 圧縮ジョブのクエリ / 圧縮ジョブログの取得をポーリング →
SUCCEEDED/FAILED/CANCELEDになるまで SUCCEEDED後、quantized_outputを使用してデプロイメントを作成。不要になった場合は、圧縮ジョブをキャンセル / 圧縮ジョブを削除
すべての API エンドポイントのドメイン: https://dashscope-intl.aliyuncs.com。認証は一律で Authorization: Bearer ${YOUR_API_KEY} を使用し、POST リクエストには Content-Type: application/json を含める必要があります。
ジョブオブジェクトのフィールドと状態機械の意味については、「圧縮ジョブオブジェクト」をご参照ください。統一されたエラーコードについては、ドキュメントの最後にあるエラーコードをご参照ください。
クイックスタート
モデル圧縮 API は現在、シンガポールリージョンでのみ利用可能です。他のリージョンをご利用の場合は、そのリージョンの Bailian コンソールでモデル圧縮操作を行ってください。
モデル圧縮 API は、テンプレートのクエリ、ジョブの作成、ステータスのポーリング、ログの取得、ジョブのキャンセル/削除をカバーする完全な RESTful インターフェイスセットを提供します。このドキュメントは、開発者が OpenAPI または SDK を介して圧縮機能を統合することを目的としています。コンソールの紹介については、関連ドキュメントをご参照ください。
前提条件
このドキュメントのインターフェイスを呼び出す前に、以下を完了してください:
- Alibaba Cloud Bailian サービスを有効化し、実名認証を完了していること。
- 現在のワークスペースに、
qwen3.5-flash-2026-02-23をベースにしたカスタムフルパラメータファインチューニングモデルが少なくとも 1 つあること (ファインチューニングジョブインターフェイスを介して完了)。現在の圧縮機能はこのモデルのみをサポートしており、LoRA モデルおよび既に量子化されたモデルはサポートされていません。 - API キーを取得していること (詳細については、「API キーの取得」をご参照ください)。
圧縮された出力モデルがサポートするデプロイメントユニットの仕様は、選択された量子化テンプレートによって決定され、デプロイメント数量は Bailian コンソールの「モデルデプロイ」で設定します。現在の圧縮機能は期間限定で無料です。
インターフェイス一覧
すべてのインターフェイスのドメイン: https://dashscope-intl.aliyuncs.com
# | メソッド | パス | 説明 |
|---|---|---|---|
1 | GET |
| 量子化可能なモデルと設定テンプレートの一覧表示 |
2 | POST |
| 圧縮ジョブの作成 |
3 | GET |
| 圧縮ジョブの一覧表示 |
4 | GET |
| 圧縮ジョブの詳細をクエリ |
5 | GET |
| 圧縮ジョブログの取得 |
6 | POST |
| 圧縮ジョブのキャンセル |
7 | DELETE |
| 圧縮ジョブの削除 |
認証
すべてのインターフェイスは、HTTP ヘッダーを介して API キーを渡します:
Authorization: Bearer ${YOUR_API_KEY}
Content-Type: application/json は、POST リクエストボディのシナリオに適用されます。
5分で開始
HTTP
requests ライブラリをインストールします:
pip install requests
ジョブの作成、ポーリング、出力モデルの取得の完全な例:
import requests, time
API_KEY = "YOUR_API_KEY"
BASE = "https://dashscope-intl.aliyuncs.com/api/v1/fine-tunes/compress"
HEADERS = {"Authorization": f"Bearer {API_KEY}", "Content-Type": "application/json"}
# 1. 圧縮ジョブの作成
resp = requests.post(f"{BASE}/jobs", headers=HEADERS, json={
"model": "qwen3.5-flash-2026-02-23-ft-***", # カスタムファインチューニングモデル ID
"template_id": "quant-flash-nvfp4-mlp-nomtp", # GET /templates で取得
"output_model_suffix": "test", # 最大 8 文字、小文字と数字のみ
}).json()
job_id = resp["output"]["job_id"]
print("Job:", job_id)
# 2. 終端状態になるまでポーリング
status = resp["output"]["status"]
while status not in ("SUCCEEDED", "FAILED", "CANCELED"):
time.sleep(30)
resp = requests.get(f"{BASE}/jobs/{job_id}", headers=HEADERS).json()
status = resp["output"]["status"]
print("Status:", status)
# 3. 結果の処理
if status == "SUCCEEDED":
print("Quantized model:", resp["output"]["quantized_output"])
# quantized_output を使用してモデルデプロイインターフェイスを呼び出し、デプロイする
elif status == "FAILED":
print("Error:", resp["output"]["error"])
ジョブの一覧表示とログの取得:
# 正常に圧縮されたすべてのジョブを一覧表示
resp = requests.get(f"{BASE}/jobs", headers=HEADERS, params={"status": "SUCCEEDED", "page_size": 20}).json()
for j in resp["output"]["jobs"]:
print(j["job_id"], j["template_name"], j["quantized_output"])
# ジョブログの取得
resp = requests.get(f"{BASE}/jobs/{job_id}/logs", headers=HEADERS, params={"offset": 0, "line": 100}).json()
for line in resp["output"]["logs"]:
print(line)
出力モデルの命名規則:
quantized_output = {base_model}-{output_model_suffix}-{job_id}
例えば、base_model が qwen3.5-flash-2026-02-23、suffix が test、job_id が quant-202604111200-a1b2 の場合、出力モデル ID は次のようになります:
qwen3.5-flash-2026-02-23-test-quant-202604111200-a1b2
各インターフェイスの cURL の使用法については、各インターフェイスの詳細ページをご参照ください。
圧縮ジョブオブジェクト
モデル圧縮 API は現在、シンガポールリージョンでのみ利用可能です。他のリージョンをご利用の場合は、そのリージョンの Bailian コンソールでモデル圧縮を行ってください。
オブジェクトのプロパティ
レスポンスパラメーターフィールド | タイプ | 説明 |
|---|---|---|
job_id | String | ジョブ ID |
job_name | String | ジョブ名 |
job_description | String | ジョブの説明 |
status | String | ジョブステータス (詳細は「ジョブステータス」を参照) |
model | String | ソースモデル ID |
base_model | String | ベースモデル ID |
template_id | String | 使用中の圧縮テンプレートの ID |
template_name | String | テンプレート名 |
template_description | String | テンプレートの説明 |
training_type | String | ジョブタイプ、 |
compress_type | String | 圧縮タイプ、 |
hyper_parameters | Object | 実際に有効なハイパーパラメーター (ユーザーに表示されるパラメーターのみを返す) |
custom_calibration_file_ids | Array<String> | カスタムキャリブレーションデータセットのファイル ID のリスト |
quantized_output | String | 量子化後に生成されたモデル ID (SUCCEEDED の場合にのみ値を持つ) |
create_time | String | ジョブ作成時刻 |
start_time | String | ジョブ開始実行時刻 (PENDING/QUEUING の場合は null) |
end_time | String | ジョブ完了時刻 (終端状態で値を持つ) |
error | Object | 失敗時のエラー情報。 |
group | String | ジョブグループ、 |
usage | Integer | GPU 時間 (秒)、SUCCEEDED または CANCELED の場合に表示 |
ジョブステータス
ステータス | 説明 |
|---|---|
| ジョブが作成され、スケジューリング待ち |
| スケジューリングキューに入り、GPU リソース待ち |
| ジョブ実行中 |
| キャンセルが開始され、終了待ち |
| ジョブ成功。 |
| ジョブ失敗。 |
| ジョブがキャンセルされた |
状態遷移:
PENDING ─→ QUEUING ─→ RUNNING ─→ SUCCEEDED
│ │
↓ ↓
CANCELING ─→ FAILED / CANCELED
量子化可能なモデルと設定テンプレートの一覧表示
現在のユーザーが持つ、量子化可能なすべてのカスタムファインチューニングモデルと、各モデルにバインドされた圧縮テンプレートを一覧表示します。テンプレートはモデルにバインドされており、モデルアーキテクチャ × 精度 × ターゲット MU 仕様の組み合わせによって、異なるテンプレートが対応します。
エンドポイントベースモデルに基づいて現在のユーザーがフルファインチューニング (SFT/DPO/CPT) したカスタムモデルのみを返します。LoRA ファインチューニングモデルおよび既に量子化されたモデルは結果に表示されません。
GET /api/v1/fine-tunes/compress/templates
リクエストパラメーター
パラメーター | タイプ | 必須 | デフォルト | 説明 |
|---|---|---|---|---|
model | String | いいえ | - | モデル ID でフィルターします。ベースモデル名が渡された場合、そのベースモデルに基づくすべてのカスタムモデルを返します |
lang | String | いいえ | zh-CN | レスポンス言語: |
curl "https://dashscope-intl.aliyuncs.com/api/v1/fine-tunes/compress/templates" \
-H "Authorization: Bearer ${API_KEY}"
レスポンス例 (最小)
{
"request_id": "uuid-string",
"output": {
"base_models": ["qwen3.5-flash-2026-02-23"],
"custom_models": [
{
"model": "qwen3.5-flash-2026-02-23-ft-***",
"model_name": "My SFT fine-tuned model",
"base_model": "qwen3.5-flash-2026-02-23",
"templates": [
{
"template_id": "quant-flash-nvfp4-mlp-nomtp",
"template_name": "W4A4 NVFP4 high-performance compression-MU5/MU8/MU9",
"description": "Balances high precision and high performance under lower-bit compression, further reducing memory usage and improving inference throughput.",
"compress_type": "quantization",
"hyper_parameters": []
}
]
}
]
}
}
レスポンス例 (完全:調整可能なハイパーパラメーター付き)
{
"request_id": "uuid-string",
"output": {
"base_models": ["qwen3.5-flash-2026-02-23"],
"custom_models": [
{
"model": "qwen3.5-flash-2026-02-23-ft-***",
"model_name": "My SFT fine-tuned model",
"base_model": "qwen3.5-flash-2026-02-23",
"templates": [
{
"template_id": "quant-flash-nvfp4-mlp-nomtp",
"template_name": "W4A4 NVFP4 high-performance compression-MU5/MU8/MU9",
"description": "Balances high precision and high performance under lower-bit compression, further reducing memory usage and improving inference throughput.",
"compress_type": "quantization",
"hyper_parameters": [
{
"name": "calib_input",
"type": "string",
"display_name": "Calibration input",
"description": "Whether to enable calibration input",
"support_values": ["true"],
"defaultValue": "true",
"recommend_value": "true",
"required": false
}
]
}
]
}
]
}
}
フィールド | タイプ | 説明 |
|---|---|---|
base_models | Array<String> | 圧縮をサポートするベースモデル名のリスト |
custom_models[].model | String | モデル ID |
custom_models[].model_name | String | モデルの表示名 |
custom_models[].base_model | String | ベースモデル名 |
custom_models[].templates | Array | このモデルでサポートされている圧縮設定テンプレートのリスト。ベースモデルのテンプレートから継承されます |
templates[].template_id | String | テンプレート ID。圧縮ジョブ作成時に template_id パラメーターとして渡されます |
templates[].template_name | String | テンプレート名 (多言語に対応しており、 |
templates[].description | String | テンプレートの説明 (多言語をサポートし、 |
templates[].compress_type | String | 圧縮タイプで、 |
templates[].hyper_parameters | Array | 調整可能なハイパーパラメーター。配列が空の場合、調整可能なハイパーパラメーターはありません。 |
hyper_parameters[].name | String | パラメーター名 (タスク作成時にキーとして使用) |
hyper_parameters[].type | String | タイプ: |
hyper_parameters[].display_name | String | パラメーターの表示名 (多言語に対応しており、 |
hyper_parameters[].description | String | パラメーターの説明(多言語に対応しており、 |
hyper_parameters[].defaultValue | String | 既定値 |
hyper_parameters[].recommend_value | String | 推奨値 |
hyper_parameters[].required | Boolean | 必須かどうか |
hyper_parameters[].support_values | Array<String> | 列挙値のリスト ( |
hyper_parameters[].data_range | Array<String> | 数値範囲 ( |
hyper_parameters[].step | Integer | ステップサイズ( |
圧縮ジョブの作成
エンドポイントPOST /api/v1/fine-tunes/compress/jobs
リクエストパラメーター
パラメーター | タイプ | 必須 | デフォルト | 説明 |
|---|---|---|---|---|
モデル | 文字列 | はい | - | ソースモデル ID。API を介して取得できます。 |
template_id | 文字列 | はい | - | API を介して取得できる圧縮テンプレートID |
ジョブ名 | 文字列 | いいえ | 自動生成 | ジョブ名。同一ユーザー内で重複することはできず、最大 50 文字です。 |
ジョブの説明 | 文字列 | いいえ | - | ジョブの説明、最大 200 文字 |
hyper_parameters | オブジェクト | いいえ | テンプレートのデフォルト値 | ハイパーパラメーターのオーバーライド (キーと値のペア) であり、オーバーライドしたい項目のみを渡します。 |
カスタムキャリブレーションファイル ID | 配列<文字列> | いいえ | - | カスタムキャリブレーションデータセットのファイル ID (データセットグループ ID、 |
output_model_suffix | 文字列 | いいえ | - | 量子化された出力モデル名のサフィックス。8 文字以内の小文字と数字のみ。出力モデル名のフォーマット: |
curl -X POST "https://dashscope-intl.aliyuncs.com/api/v1/fine-tunes/compress/jobs" \
-H "Authorization: Bearer ${API_KEY}" \
-H "Content-Type: application/json" \
-d '{
"job_name": "qwen3.5-flash compression job",
"model": "qwen3.5-flash-2026-02-23-ft-***",
"template_id": "quant-flash-nvfp4-mlp-nomtp",
"custom_calibration_file_ids": ["file-***"],
"output_model_suffix": "test"
}'
レスポンス例
{
"request_id": "uuid-string",
"output": {
"job_id": "quant-202604111200-a1b2",
"job_name": "qwen3.5-flash 圧縮ジョブ",
"status": "PENDING",
"model": "qwen3.5-flash-2026-02-23-ft-***",
"base_model": "qwen3.5-flash-2026-02-23",
"template_id": "quant-flash-nvfp4-mlp-nomtp",
"template_name": "W4A4 NVFP4 パフォーマンス専有型圧縮-MU5/MU8/MU9",
"training_type": "量子化",
"compress_type": "量子化",
"hyper_parameters": {},
"custom_calibration_file_ids": ["file-***"],
"quantized_output": null,
"create_time": "2026-04-11 12:00:00",
"start_time": null,
"end_time": null,
"error": null,
"group": "量子化"
}
}
レスポンスパラメーター:フィールドの意味はリクエストパラメーターと同じです。
圧縮ジョブの一覧表示
ステータス、モデル、テンプレート、量子化仕様、アルゴリズム、時間範囲、ジョブ名/ID によるフィルター、および作成時刻によるソートとページネーションをサポートします。
エンドポイントGET /api/v1/fine-tunes/compress/jobs
リクエストパラメーター
パラメーター | 型 | 必須 | デフォルト | 説明 |
|---|---|---|---|---|
ステータス | 文字列 | いいえ | - | ステータスによるフィルタリング (例: RUNNING, SUCCEEDED) |
モデル | 文字列 | いいえ | - | ソースモデル ID で絞り込みます |
template_id | 文字列 | いいえ | - | テンプレートID でフィルターします |
quant_spec | 文字列 | いいえ | - | 量子化仕様でフィルタリング(例: |
quant_method | 文字列 | いいえ | - | 量子化アルゴリズムによる絞り込み (例: |
開始時間 | 文字列 | いいえ | - | ジョブの開始時刻はこの値以降になります。形式: |
end_time | 文字列 | いいえ | - | ジョブの終了時刻は、この値より後にはならず、フォーマットは |
ジョブ名 | 文字列 | いいえ | - | ジョブ名によるあいまい検索 |
job_id | 文字列 | いいえ | - | ジョブ ID によるあいまい一致 |
search_key | 文字列 | いいえ | - | 検索キーワード。 |
select_key | String | いいえ | - |
|
sort_by | 文字列 | いいえ | create_time | ソートフィールドで、現在は |
ソート順 | 文字列 | いいえ | desc | ソート順、 |
ページ番号 | 整数 | いいえ | 1 | ページ番号 |
page_size | 整数 | いいえ | 10 | ページサイズ、最大 100 |
# 組み合わせ検索:ステータス + アルゴリズム + ページネーション
curl "https://dashscope-intl.aliyuncs.com/api/v1/fine-tunes/compress/jobs?status=SUCCEEDED&quant_method=gptq&page_size=10" \
-H "Authorization: Bearer ${API_KEY}"
# 時間範囲 + ジョブ名で検索 + 作成時刻で昇順ソート
curl "https://dashscope-intl.aliyuncs.com/api/v1/fine-tunes/compress/jobs?start_time=2026-04-01&end_time=2026-04-30&search_key=qwen3&select_key=job_name&sort_by=create_time&sort_order=asc" \
-H "Authorization: Bearer ${API_KEY}"
レスポンス例
{
"request_id": "uuid-string",
"output": {
"total": 42,
"page_no": 1,
"page_size": 10,
"jobs": [
{
"job_id": "quant-202604111200-a1b2",
"job_name": "qwen3.5-flash 圧縮ジョブ",
"status": "SUCCEEDED",
"model": "qwen3.5-flash-2026-02-23-ft-***",
"base_model": "qwen3.5-flash-2026-02-23",
"template_id": "quant-flash-nvfp4-mlp-nomtp",
"template_name": "W4A4 NVFP4 パフォーマンス専有型圧縮-MU5/MU8/MU9",
"training_type": "量子化",
"compress_type": "量子化",
"custom_calibration_file_ids": ["file-***"],
"quantized_output": "qwen3.5-flash-2026-02-23-test-quant-202604111200-a1b2",
"create_time": "2026-04-11 12:00:00",
"start_time": "2026-04-11 12:02:30",
"end_time": "2026-04-11 13:02:30",
"group": "量子化",
"usage": 3600
}
]
}
}
レスポンスパラメーター
フィールド | タイプ | 説明 |
|---|---|---|
合計 | 整数 | 一致するジョブの総数 |
page_no | 整数 | 現在のページ番号 |
page_size | 整数 | ページサイズ |
ジョブ | 配列 | ジョブリスト。フィールドの意味は、圧縮ジョブ作成時のレスポンスパラメーターと同じです。 |
圧縮ジョブのクエリ
エンドポイントGET /api/v1/fine-tunes/compress/jobs/{job_id}
リクエスト例
curl "https://dashscope-intl.aliyuncs.com/api/v1/fine-tunes/compress/jobs/quant-202604111200-a1b2" \
-H "Authorization: Bearer ${API_KEY}"
レスポンス例
{
"request_id": "uuid-string",
"output": {
"job_id": "quant-202604111200-a1b2",
"job_name": "qwen3.5-flash 圧縮ジョブ",
"job_description": "...",
"status": "SUCCEEDED",
"model": "qwen3.5-flash-2026-02-23-ft-***",
"base_model": "qwen3.5-flash-2026-02-23",
"template_id": "quant-flash-nvfp4-mlp-nomtp",
"template_name": "W4A4 NVFP4 パフォーマンス専有型圧縮-MU5/MU8/MU9",
"template_description": "低ビット圧縮において高い精度と高いパフォーマンスを維持し、GPU メモリ使用量をさらに削減して推論スループットを向上させます。",
"training_type": "quantization",
"compress_type": "quantization",
"hyper_parameters": {},
"custom_calibration_file_ids": ["file-***"],
"quantized_output": "qwen3.5-flash-2026-02-23-test-quant-202604111200-a1b2",
"create_time": "2026-04-11 12:00:00",
"start_time": "2026-04-11 12:02:30",
"end_time": "2026-04-11 13:02:30",
"error": null,
"group": "quantization",
"usage": 3600
}
}
レスポンスパラメーター
フィールド | タイプ | 説明 |
|---|---|---|
job_id | 文字列 | ジョブ ID。圧縮ジョブの作成、または一覧表示のインターフェイスから取得できます。 |
ジョブ名 | 文字列 | ジョブ名 |
ジョブの説明 | 文字列 | ジョブの説明 |
ステータス | ストリング | ジョブのステータス (詳細は「ジョブのステータス」を参照) |
モデル | 文字列 | ソースモデル ID |
base_model | 文字列 | ベースモデル ID |
template_id | 文字列 | 使用される圧縮テンプレートの ID |
template_name | 文字列 | テンプレート名 |
テンプレートの説明 | 文字列 | テンプレートの説明 |
training_type | 文字列 | ジョブタイプ、 |
compress_type | 文字列 | 圧縮タイプ。 |
ハイパーパラメーター | オブジェクト | 実際に有効なハイパーパラメーター (ユーザーに表示されるパラメーターのみを返します) |
custom_calibration_file_ids | Array<String> | カスタムキャリブレーションデータセットのファイル ID のリスト |
量子化出力 | 文字列 | 量子化後に生成されるモデル ID。SUCCEEDED の場合にのみ値が設定され、デプロイメントの作成 インターフェイスでモデルデプロイに使用できます。 |
作成日時 | 文字列 | ジョブ作成時間 |
開始時間 | String | ジョブの実行開始時刻 (`PENDING`/`QUEUING` の場合は `null`) |
end_time | 文字列 | ジョブ完了時間 (終端状態でのみ値が設定されます) |
エラー | オブジェクト | 失敗時は |
グループ | 文字列 | ジョブグループは、 |
使用量 | 整数 | SUCCEEDED または CANCELED の場合に存在する GPU の持続時間 (秒) |
圧縮ジョブログの取得
エンドポイントGET /api/v1/fine-tunes/compress/jobs/{job_id}/logs
{job_id} は、圧縮ジョブ作成インターフェイスまたは圧縮ジョブリストインターフェイスから取得できる圧縮ジョブ ID です。
パラメーター | タイプ | 必須 | デフォルト | 説明 |
|---|---|---|---|---|
オフセット | 整数 | いいえ | 0 | 最初の N 行をスキップし、(N+1) 行目から読み取りを開始します。 |
回線 | 整数 | いいえ | 100 | 読み取り行数、最大 1000 |
curl "https://dashscope-intl.aliyuncs.com/api/v1/fine-tunes/compress/jobs/quant-202604111200-a1b2/logs?offset=0&line=50" \
-H "Authorization: Bearer ${API_KEY}"
レスポンス例
{
"request_id": "uuid-string",
"output": {
"total": 15,
"logs": [
"2026-04-11 12:02:35 - INFO - 量子化を開始しています...",
"2026-04-11 12:30:00 - INFO - 量子化の進捗: 100%",
"2026-04-11 12:35:00 - INFO - 量子化に成功しました!"
]
}
}
ログ表示ルール
- ジョブにカスタムキャリブレーションデータセットが提供されると、ログにデータ処理完了マーカー
data process succeeded, start to quantizationが含まれます。 - ログインターフェイスは内部システムマーカーを除外しており、ユーザーが読み取り可能な圧縮進捗情報のみを返します
圧縮ジョブのキャンセル
PENDING、QUEUING、または RUNNING 状態のジョブのみキャンセルできます。キャンセルは非同期操作です。ジョブはまず CANCELING 遷移状態に入り、最終的に CANCELED になります。
POST /api/v1/fine-tunes/compress/jobs/{job_id}/cancel
{job_id} は、Create compression job API または List compression jobs API から取得できる圧縮ジョブ ID です。
curl -X POST "https://dashscope-intl.aliyuncs.com/api/v1/fine-tunes/compress/jobs/quant-202604111200-a1b2/cancel" \
-H "Authorization: Bearer ${API_KEY}"
レスポンス例
{
"request_id": "uuid-string",
"output": { "status": "success" }
}
圧縮ジョブの削除
終端状態 (SUCCEEDED / FAILED / CANCELED) のジョブのみ削除できます。ジョブレコードを削除しても、生成済みの量子化モデル (quantized_output) を削除することはありません。
DELETE /api/v1/fine-tunes/compress/jobs/{job_id}
ここで、{job_id} は、「Create compression job」 API または 「List compression jobs」 API から取得できる圧縮ジョブ ID です。
curl -X DELETE "https://dashscope-intl.aliyuncs.com/api/v1/fine-tunes/compress/jobs/quant-202604111200-a1b2" \
-H "Authorization: Bearer ${API_KEY}"
レスポンス例
{
"request_id": "uuid-string",
"output": { "status": "success" }
}
エラーコード
共通エラーコード
エラーコード | HTTP | 説明 |
|---|---|---|
| 400 | 無効なリクエストパラメーター |
| 400 | 必須パラメーターが不足しています。 |
| 401 | 認証に失敗しました |
| 403 | アクセス権限がありません |
| 404 | リソースが存在しません |
| 400 | リソースの状態が原因で、この操作は実行できません(例:すでに終了状態にあるジョブのキャンセルなど)。 |
| 429 | クォータ超過 |
| 500 | 内部サービスエラー |
ビジネスエラーコード
以下のビジネスエラーコードは、シナリオ別に記載されています。External Code は、インターフェイスから返される実際の code フィールドの値です。
外部コード | HTTP | 説明 |
|---|---|---|
| 400 | 必須パラメーター |
| 400 | 必須パラメーター |
| 400 | ベースモデルの直接量子化はサポートされていません。 |
| 400 | 指定された構成テンプレートは存在しません |
| 400 | 現在のモデルは、この圧縮テンプレートに対応していません。 |
| 400 | このモデルは量子化に対応していません。 |
| 400 | LoRA でファインチューニングされたモデルは、量子化をサポートしていません。 |
| 400 | モデルデータがありません |
| 400 | ジョブ名にはサポートされていない文字が含まれています。 |
| 400 |
|
| 400 | ソースモデルの準備ができていません。 |
| 403 | この圧縮テンプレートを使用する権限がありません。 |
外部コード | HTTP | 説明 |
|---|---|---|
| 400 | 必須のハイパーパラメーターが指定されていません |
| 400 | 不明なハイパーパラメーターが指定されました。 |
| 400 | ハイパーパラメーターの値が列挙リストに含まれていません。 |
| 400 | ハイパーパラメーターの値が範囲外です |
| 400 | ハイパーパラメーターの値は有効な数値ではありません。 |
外部コード | HTTP | 説明 |
|---|---|---|
| 404 | 指定された圧縮ジョブは存在しません。 |
| 400 | 必須パラメーター |
外部コード | HTTP | 説明 |
|---|---|---|
| 400 | ページ番号パラメーターが無効です (1 以上の値を指定してください) |
| 400 | 無効なページサイズ (1~100 の範囲で指定する必要があります) |
| 400 | 無効な時間フォーマット |
エラーレスポンス例
{
"request_id": "uuid-string",
"code": "InvalidParameter",
"message": "The specified model 'xxx-lora-yyy' is a LoRA model and not supported for quantization."
}