すべてのプロダクト
Search
ドキュメントセンター

Alibaba Cloud Model Studio:モデル圧縮

最終更新日:Sep 02, 2026

量子化などの技術を用いてモデルを圧縮し、推論コストを削減します。

概要

モデル圧縮 API は、量子化などの技術を通じてカスタムフルパラメータファインチューニングモデルを圧縮し、推論時のメモリ使用量を削減し、スループットを向上させます。現在、圧縮機能は量子化のみをサポートしており、テンプレートのクエリ、ジョブの作成、ステータスのポーリング、ログの取得、ジョブのキャンセル/削除まで、完全なライフサイクルをカバーしています。

典型的なフロー

  • 量子化可能なモデルと設定テンプレートをリストアップ → template_id と量子化可能な model を取得
  • 圧縮ジョブを作成 → job_id を取得
  • 圧縮ジョブのクエリ / 圧縮ジョブログの取得をポーリング → SUCCEEDED / FAILED / CANCELED になるまで
  • SUCCEEDED 後、quantized_output を使用してデプロイメントを作成。不要になった場合は、圧縮ジョブをキャンセル / 圧縮ジョブを削除

すべての API エンドポイントのドメイン: https://dashscope-intl.aliyuncs.com。認証は一律で Authorization: Bearer ${YOUR_API_KEY} を使用し、POST リクエストには Content-Type: application/json を含める必要があります。

ジョブオブジェクトのフィールドと状態機械の意味については、「圧縮ジョブオブジェクト」をご参照ください。統一されたエラーコードについては、ドキュメントの最後にあるエラーコードをご参照ください。

クイックスタート

モデル圧縮 API は現在、シンガポールリージョンでのみ利用可能です。他のリージョンをご利用の場合は、そのリージョンの Bailian コンソールでモデル圧縮操作を行ってください。

モデル圧縮 API は、テンプレートのクエリ、ジョブの作成、ステータスのポーリング、ログの取得、ジョブのキャンセル/削除をカバーする完全な RESTful インターフェイスセットを提供します。このドキュメントは、開発者が OpenAPI または SDK を介して圧縮機能を統合することを目的としています。コンソールの紹介については、関連ドキュメントをご参照ください。

前提条件

このドキュメントのインターフェイスを呼び出す前に、以下を完了してください:

  1. Alibaba Cloud Bailian サービスを有効化し、実名認証を完了していること。
  2. 現在のワークスペースに、qwen3.5-flash-2026-02-23 をベースにしたカスタムフルパラメータファインチューニングモデルが少なくとも 1 つあること (ファインチューニングジョブインターフェイスを介して完了)。現在の圧縮機能はこのモデルのみをサポートしており、LoRA モデルおよび既に量子化されたモデルはサポートされていません。
  3. API キーを取得していること (詳細については、「API キーの取得」をご参照ください)。

圧縮された出力モデルがサポートするデプロイメントユニットの仕様は、選択された量子化テンプレートによって決定され、デプロイメント数量は Bailian コンソールの「モデルデプロイ」で設定します。現在の圧縮機能は期間限定で無料です。

インターフェイス一覧

すべてのインターフェイスのドメイン: https://dashscope-intl.aliyuncs.com

#

メソッド

パス

説明

1

GET

/api/v1/fine-tunes/compress/templates

量子化可能なモデルと設定テンプレートの一覧表示

2

POST

/api/v1/fine-tunes/compress/jobs

圧縮ジョブの作成

3

GET

/api/v1/fine-tunes/compress/jobs

圧縮ジョブの一覧表示

4

GET

/api/v1/fine-tunes/compress/jobs/{job_id}

圧縮ジョブの詳細をクエリ

5

GET

/api/v1/fine-tunes/compress/jobs/{job_id}/logs

圧縮ジョブログの取得

6

POST

/api/v1/fine-tunes/compress/jobs/{job_id}/cancel

圧縮ジョブのキャンセル

7

DELETE

/api/v1/fine-tunes/compress/jobs/{job_id}

圧縮ジョブの削除

認証

すべてのインターフェイスは、HTTP ヘッダーを介して API キーを渡します:

Authorization: Bearer ${YOUR_API_KEY}

Content-Type: application/json は、POST リクエストボディのシナリオに適用されます。

5分で開始

HTTP

requests ライブラリをインストールします:

pip install requests

ジョブの作成、ポーリング、出力モデルの取得の完全な例:

import requests, time

API_KEY = "YOUR_API_KEY"
BASE = "https://dashscope-intl.aliyuncs.com/api/v1/fine-tunes/compress"
HEADERS = {"Authorization": f"Bearer {API_KEY}", "Content-Type": "application/json"}

# 1. 圧縮ジョブの作成
resp = requests.post(f"{BASE}/jobs", headers=HEADERS, json={
    "model": "qwen3.5-flash-2026-02-23-ft-***",  # カスタムファインチューニングモデル ID
    "template_id": "quant-flash-nvfp4-mlp-nomtp",          # GET /templates で取得
    "output_model_suffix": "test",                          # 最大 8 文字、小文字と数字のみ
}).json()
job_id = resp["output"]["job_id"]
print("Job:", job_id)

# 2. 終端状態になるまでポーリング
status = resp["output"]["status"]
while status not in ("SUCCEEDED", "FAILED", "CANCELED"):
    time.sleep(30)
    resp = requests.get(f"{BASE}/jobs/{job_id}", headers=HEADERS).json()
    status = resp["output"]["status"]
    print("Status:", status)

# 3. 結果の処理
if status == "SUCCEEDED":
    print("Quantized model:", resp["output"]["quantized_output"])
    # quantized_output を使用してモデルデプロイインターフェイスを呼び出し、デプロイする
elif status == "FAILED":
    print("Error:", resp["output"]["error"])

ジョブの一覧表示とログの取得:

# 正常に圧縮されたすべてのジョブを一覧表示
resp = requests.get(f"{BASE}/jobs", headers=HEADERS, params={"status": "SUCCEEDED", "page_size": 20}).json()
for j in resp["output"]["jobs"]:
    print(j["job_id"], j["template_name"], j["quantized_output"])

# ジョブログの取得
resp = requests.get(f"{BASE}/jobs/{job_id}/logs", headers=HEADERS, params={"offset": 0, "line": 100}).json()
for line in resp["output"]["logs"]:
    print(line)

出力モデルの命名規則

quantized_output = {base_model}-{output_model_suffix}-{job_id}

例えば、base_modelqwen3.5-flash-2026-02-23suffixtestjob_idquant-202604111200-a1b2 の場合、出力モデル ID は次のようになります:

qwen3.5-flash-2026-02-23-test-quant-202604111200-a1b2

各インターフェイスの cURL の使用法については、各インターフェイスの詳細ページをご参照ください。

圧縮ジョブオブジェクト

モデル圧縮 API は現在、シンガポールリージョンでのみ利用可能です。他のリージョンをご利用の場合は、そのリージョンの Bailian コンソールでモデル圧縮を行ってください。

オブジェクトのプロパティ

レスポンスパラメーター

フィールド

タイプ

説明

job_id

String

ジョブ ID

job_name

String

ジョブ名

job_description

String

ジョブの説明

status

String

ジョブステータス (詳細は「ジョブステータス」を参照)

model

String

ソースモデル ID

base_model

String

ベースモデル ID

template_id

String

使用中の圧縮テンプレートの ID

template_name

String

テンプレート名

template_description

String

テンプレートの説明

training_type

String

ジョブタイプ、quantization に固定

compress_type

String

圧縮タイプ、training_type と同じ、quantization に固定

hyper_parameters

Object

実際に有効なハイパーパラメーター (ユーザーに表示されるパラメーターのみを返す)

custom_calibration_file_ids

Array<String>

カスタムキャリブレーションデータセットのファイル ID のリスト

quantized_output

String

量子化後に生成されたモデル ID (SUCCEEDED の場合にのみ値を持つ)

create_time

String

ジョブ作成時刻

start_time

String

ジョブ開始実行時刻 (PENDING/QUEUING の場合は null)

end_time

String

ジョブ完了時刻 (終端状態で値を持つ)

error

Object

失敗時のエラー情報。codemessage を含む。成功時は null

group

String

ジョブグループ、quantization に固定

usage

Integer

GPU 時間 (秒)、SUCCEEDED または CANCELED の場合に表示

ジョブステータス

ステータス

説明

PENDING

ジョブが作成され、スケジューリング待ち

QUEUING

スケジューリングキューに入り、GPU リソース待ち

RUNNING

ジョブ実行中

CANCELING

キャンセルが開始され、終了待ち

SUCCEEDED

ジョブ成功。quantized_output フィールドが生成されたモデル ID を返す

FAILED

ジョブ失敗。error.code / error.message フィールドが理由を返す

CANCELED

ジョブがキャンセルされた

状態遷移

PENDING ─→ QUEUING ─→ RUNNING ─→ SUCCEEDED
                  │           │
                  ↓           ↓
                CANCELING ─→ FAILED / CANCELED

量子化可能なモデルと設定テンプレートの一覧表示

現在のユーザーが持つ、量子化可能なすべてのカスタムファインチューニングモデルと、各モデルにバインドされた圧縮テンプレートを一覧表示します。テンプレートはモデルにバインドされており、モデルアーキテクチャ × 精度 × ターゲット MU 仕様の組み合わせによって、異なるテンプレートが対応します。

ベースモデルに基づいて現在のユーザーがフルファインチューニング (SFT/DPO/CPT) したカスタムモデルのみを返します。LoRA ファインチューニングモデルおよび既に量子化されたモデルは結果に表示されません。

エンドポイント
GET /api/v1/fine-tunes/compress/templates
リクエストパラメーター

パラメーター

タイプ

必須

デフォルト

説明

model

String

いいえ

-

モデル ID でフィルターします。ベースモデル名が渡された場合、そのベースモデルに基づくすべてのカスタムモデルを返します

lang

String

いいえ

zh-CN

レスポンス言語: zh-CN / en-US (詳細は「多言語サポート」を参照)

リクエスト例
curl "https://dashscope-intl.aliyuncs.com/api/v1/fine-tunes/compress/templates" \
  -H "Authorization: Bearer ${API_KEY}"
レスポンス例 (最小)
{
  "request_id": "uuid-string",
  "output": {
    "base_models": ["qwen3.5-flash-2026-02-23"],
    "custom_models": [
      {
        "model": "qwen3.5-flash-2026-02-23-ft-***",
        "model_name": "My SFT fine-tuned model",
        "base_model": "qwen3.5-flash-2026-02-23",
        "templates": [
          {
            "template_id": "quant-flash-nvfp4-mlp-nomtp",
            "template_name": "W4A4 NVFP4 high-performance compression-MU5/MU8/MU9",
            "description": "Balances high precision and high performance under lower-bit compression, further reducing memory usage and improving inference throughput.",
            "compress_type": "quantization",
            "hyper_parameters": []
          }
        ]
      }
    ]
  }
}

レスポンス例 (完全:調整可能なハイパーパラメーター付き)

{
  "request_id": "uuid-string",
  "output": {
    "base_models": ["qwen3.5-flash-2026-02-23"],
    "custom_models": [
      {
        "model": "qwen3.5-flash-2026-02-23-ft-***",
        "model_name": "My SFT fine-tuned model",
        "base_model": "qwen3.5-flash-2026-02-23",
        "templates": [
          {
            "template_id": "quant-flash-nvfp4-mlp-nomtp",
            "template_name": "W4A4 NVFP4 high-performance compression-MU5/MU8/MU9",
            "description": "Balances high precision and high performance under lower-bit compression, further reducing memory usage and improving inference throughput.",
            "compress_type": "quantization",
            "hyper_parameters": [
              {
                "name": "calib_input",
                "type": "string",
                "display_name": "Calibration input",
                "description": "Whether to enable calibration input",
                "support_values": ["true"],
                "defaultValue": "true",
                "recommend_value": "true",
                "required": false
              }
            ]
          }
        ]
      }
    ]
  }
}
レスポンスパラメーター

フィールド

タイプ

説明

base_models

Array<String>

圧縮をサポートするベースモデル名のリスト

custom_models[].model

String

モデル ID

custom_models[].model_name

String

モデルの表示名

custom_models[].base_model

String

ベースモデル名

custom_models[].templates

Array

このモデルでサポートされている圧縮設定テンプレートのリスト。ベースモデルのテンプレートから継承されます

templates[].template_id

String

テンプレート ID。圧縮ジョブ作成時に template_id パラメーターとして渡されます

templates[].template_name

String

テンプレート名 (多言語に対応しており、lang パラメーターに基づいて対応する言語バージョンが返されます)

templates[].description

String

テンプレートの説明 (多言語をサポートし、lang パラメーターに基づいて対応する言語バージョンを返します)

templates[].compress_type

String

圧縮タイプで、quantization に固定されます。

templates[].hyper_parameters

Array

調整可能なハイパーパラメーター。配列が空の場合、調整可能なハイパーパラメーターはありません。

hyper_parameters[].name

String

パラメーター名 (タスク作成時にキーとして使用)

hyper_parameters[].type

String

タイプ: number (数値、data_range/step で使用) / string (列挙、support_values で使用)

hyper_parameters[].display_name

String

パラメーターの表示名 (多言語に対応しており、lang パラメーターに基づいて対応する言語バージョンを返します)

hyper_parameters[].description

String

パラメーターの説明(多言語に対応しており、lang パラメーターに基づいて対応する言語バージョンを返します)

hyper_parameters[].defaultValue

String

既定値

hyper_parameters[].recommend_value

String

推奨値

hyper_parameters[].required

Boolean

必須かどうか

hyper_parameters[].support_values

Array<String>

列挙値のリスト (type=string の場合のみ)、例: ["instruct", "think", "hybrid"]

hyper_parameters[].data_range

Array<String>

数値範囲 (type=number の場合にのみ有効)。例えば、 ["64","256"] は 64~256 の範囲を示します。

hyper_parameters[].step

Integer

ステップサイズ(type=number の場合にのみ存在します)

圧縮ジョブの作成

エンドポイント
POST /api/v1/fine-tunes/compress/jobs
リクエストパラメーター

パラメーター

タイプ

必須

デフォルト

説明

モデル

文字列

はい

-

ソースモデル ID。API を介して取得できます。

template_id

文字列

はい

-

API を介して取得できる圧縮テンプレートID

ジョブ名

文字列

いいえ

自動生成

ジョブ名。同一ユーザー内で重複することはできず、最大 50 文字です。

ジョブの説明

文字列

いいえ

-

ジョブの説明、最大 200 文字

hyper_parameters

オブジェクト

いいえ

テンプレートのデフォルト値

ハイパーパラメーターのオーバーライド (キーと値のペア) であり、オーバーライドしたい項目のみを渡します。

カスタムキャリブレーションファイル ID

配列<文字列>

いいえ

-

カスタムキャリブレーションデータセットのファイル ID (データセットグループ ID、file-{32hex} フォーマット) のリストで、calib_input=true の場合にのみ有効になります。データセットは、まず Data Management で作成および公開されている必要があります。

output_model_suffix

文字列

いいえ

-

量子化された出力モデル名のサフィックス。8 文字以内の小文字と数字のみ。出力モデル名のフォーマット: {base_model}-{suffix}-{job_id}

リクエスト例
curl -X POST "https://dashscope-intl.aliyuncs.com/api/v1/fine-tunes/compress/jobs" \
  -H "Authorization: Bearer ${API_KEY}" \
  -H "Content-Type: application/json" \
  -d '{
    "job_name": "qwen3.5-flash compression job",
    "model": "qwen3.5-flash-2026-02-23-ft-***",
    "template_id": "quant-flash-nvfp4-mlp-nomtp",
    "custom_calibration_file_ids": ["file-***"],
    "output_model_suffix": "test"
  }'
レスポンス例
{
  "request_id": "uuid-string",
  "output": {
    "job_id": "quant-202604111200-a1b2",
    "job_name": "qwen3.5-flash 圧縮ジョブ",
    "status": "PENDING",
    "model": "qwen3.5-flash-2026-02-23-ft-***",
    "base_model": "qwen3.5-flash-2026-02-23",
    "template_id": "quant-flash-nvfp4-mlp-nomtp",
    "template_name": "W4A4 NVFP4 パフォーマンス専有型圧縮-MU5/MU8/MU9",
    "training_type": "量子化",
    "compress_type": "量子化",
    "hyper_parameters": {},
    "custom_calibration_file_ids": ["file-***"],
    "quantized_output": null,
    "create_time": "2026-04-11 12:00:00",
    "start_time": null,
    "end_time": null,
    "error": null,
    "group": "量子化"
  }
}

レスポンスパラメーター:フィールドの意味はリクエストパラメーターと同じです。

圧縮ジョブの一覧表示

ステータス、モデル、テンプレート、量子化仕様、アルゴリズム、時間範囲、ジョブ名/ID によるフィルター、および作成時刻によるソートとページネーションをサポートします。

エンドポイント
GET /api/v1/fine-tunes/compress/jobs
リクエストパラメーター

パラメーター

必須

デフォルト

説明

ステータス

文字列

いいえ

-

ステータスによるフィルタリング (例: RUNNING, SUCCEEDED)

モデル

文字列

いいえ

-

ソースモデル ID で絞り込みます

template_id

文字列

いいえ

-

テンプレートID でフィルターします

quant_spec

文字列

いいえ

-

量子化仕様でフィルタリング(例: w4a16w8a8

quant_method

文字列

いいえ

-

量子化アルゴリズムによる絞り込み (例: gptqawqfp8)

開始時間

文字列

いいえ

-

ジョブの開始時刻はこの値以降になります。形式: yyyy-MM-dd HH:mm:ss / ISO-8601 / yyyy-MM-dd

end_time

文字列

いいえ

-

ジョブの終了時刻は、この値より後にはならず、フォーマットは start_time と同じです。

ジョブ名

文字列

いいえ

-

ジョブ名によるあいまい検索

job_id

文字列

いいえ

-

ジョブ ID によるあいまい一致

search_key

文字列

いいえ

-

検索キーワード。select_key が指定されていない場合は job_idjob_name の両方にあいまい一致し、select_key と組み合わせた場合は指定されたフィールドのみに一致します。

select_key

String

いいえ

-

search_keyの検索フィールド、オプション: job_id / job_name

sort_by

文字列

いいえ

create_time

ソートフィールドで、現在は create_time のみをサポートします。

ソート順

文字列

いいえ

desc

ソート順、 asc (昇順) / desc (降順)

ページ番号

整数

いいえ

1

ページ番号

page_size

整数

いいえ

10

ページサイズ、最大 100

リクエスト例
# 組み合わせ検索:ステータス + アルゴリズム + ページネーション
curl "https://dashscope-intl.aliyuncs.com/api/v1/fine-tunes/compress/jobs?status=SUCCEEDED&quant_method=gptq&page_size=10" \
  -H "Authorization: Bearer ${API_KEY}"

# 時間範囲 + ジョブ名で検索 + 作成時刻で昇順ソート
curl "https://dashscope-intl.aliyuncs.com/api/v1/fine-tunes/compress/jobs?start_time=2026-04-01&end_time=2026-04-30&search_key=qwen3&select_key=job_name&sort_by=create_time&sort_order=asc" \
  -H "Authorization: Bearer ${API_KEY}"
レスポンス例
{
  "request_id": "uuid-string",
  "output": {
    "total": 42,
    "page_no": 1,
    "page_size": 10,
    "jobs": [
      {
        "job_id": "quant-202604111200-a1b2",
        "job_name": "qwen3.5-flash 圧縮ジョブ",
        "status": "SUCCEEDED",
        "model": "qwen3.5-flash-2026-02-23-ft-***",
        "base_model": "qwen3.5-flash-2026-02-23",
        "template_id": "quant-flash-nvfp4-mlp-nomtp",
        "template_name": "W4A4 NVFP4 パフォーマンス専有型圧縮-MU5/MU8/MU9",
        "training_type": "量子化",
        "compress_type": "量子化",
        "custom_calibration_file_ids": ["file-***"],
        "quantized_output": "qwen3.5-flash-2026-02-23-test-quant-202604111200-a1b2",
        "create_time": "2026-04-11 12:00:00",
        "start_time": "2026-04-11 12:02:30",
        "end_time": "2026-04-11 13:02:30",
        "group": "量子化",
        "usage": 3600
      }
    ]
  }
}
レスポンスパラメーター

フィールド

タイプ

説明

合計

整数

一致するジョブの総数

page_no

整数

現在のページ番号

page_size

整数

ページサイズ

ジョブ

配列

ジョブリスト。フィールドの意味は、圧縮ジョブ作成時のレスポンスパラメーターと同じです。

圧縮ジョブのクエリ

エンドポイント
GET /api/v1/fine-tunes/compress/jobs/{job_id}
リクエスト例
curl "https://dashscope-intl.aliyuncs.com/api/v1/fine-tunes/compress/jobs/quant-202604111200-a1b2" \
  -H "Authorization: Bearer ${API_KEY}"
レスポンス例
{
  "request_id": "uuid-string",
  "output": {
    "job_id": "quant-202604111200-a1b2",
    "job_name": "qwen3.5-flash 圧縮ジョブ",
    "job_description": "...",
    "status": "SUCCEEDED",
    "model": "qwen3.5-flash-2026-02-23-ft-***",
    "base_model": "qwen3.5-flash-2026-02-23",
    "template_id": "quant-flash-nvfp4-mlp-nomtp",
    "template_name": "W4A4 NVFP4 パフォーマンス専有型圧縮-MU5/MU8/MU9",
    "template_description": "低ビット圧縮において高い精度と高いパフォーマンスを維持し、GPU メモリ使用量をさらに削減して推論スループットを向上させます。",
    "training_type": "quantization",
    "compress_type": "quantization",
    "hyper_parameters": {},
    "custom_calibration_file_ids": ["file-***"],
    "quantized_output": "qwen3.5-flash-2026-02-23-test-quant-202604111200-a1b2",
    "create_time": "2026-04-11 12:00:00",
    "start_time": "2026-04-11 12:02:30",
    "end_time": "2026-04-11 13:02:30",
    "error": null,
    "group": "quantization",
    "usage": 3600
  }
}
レスポンスパラメーター

フィールド

タイプ

説明

job_id

文字列

ジョブ ID。圧縮ジョブの作成、または一覧表示のインターフェイスから取得できます。

ジョブ名

文字列

ジョブ名

ジョブの説明

文字列

ジョブの説明

ステータス

ストリング

ジョブのステータス (詳細は「ジョブのステータス」を参照)

モデル

文字列

ソースモデル ID

base_model

文字列

ベースモデル ID

template_id

文字列

使用される圧縮テンプレートの ID

template_name

文字列

テンプレート名

テンプレートの説明

文字列

テンプレートの説明

training_type

文字列

ジョブタイプ、 quantization に固定

compress_type

文字列

圧縮タイプ。training_type と同じ。quantization に固定。

ハイパーパラメーター

オブジェクト

実際に有効なハイパーパラメーター (ユーザーに表示されるパラメーターのみを返します)

custom_calibration_file_ids

Array<String>

カスタムキャリブレーションデータセットのファイル ID のリスト

量子化出力

文字列

量子化後に生成されるモデル ID。SUCCEEDED の場合にのみ値が設定され、デプロイメントの作成 インターフェイスでモデルデプロイに使用できます。

作成日時

文字列

ジョブ作成時間

開始時間

String

ジョブの実行開始時刻 (`PENDING`/`QUEUING` の場合は `null`)

end_time

文字列

ジョブ完了時間 (終端状態でのみ値が設定されます)

エラー

オブジェクト

失敗時は codemessage を含むエラー情報となり、成功時は null となります。

グループ

文字列

ジョブグループは、quantization に固定されています。

使用量

整数

SUCCEEDED または CANCELED の場合に存在する GPU の持続時間 (秒)

圧縮ジョブログの取得

エンドポイント
GET /api/v1/fine-tunes/compress/jobs/{job_id}/logs

{job_id} は、圧縮ジョブ作成インターフェイスまたは圧縮ジョブリストインターフェイスから取得できる圧縮ジョブ ID です。

リクエストパラメーター

パラメーター

タイプ

必須

デフォルト

説明

オフセット

整数

いいえ

0

最初の N 行をスキップし、(N+1) 行目から読み取りを開始します。

回線

整数

いいえ

100

読み取り行数、最大 1000

リクエスト例
curl "https://dashscope-intl.aliyuncs.com/api/v1/fine-tunes/compress/jobs/quant-202604111200-a1b2/logs?offset=0&line=50" \
	-H "Authorization: Bearer ${API_KEY}"
レスポンス例
{
  "request_id": "uuid-string",
  "output": {
    "total": 15,
    "logs": [
      "2026-04-11 12:02:35 - INFO - 量子化を開始しています...",
      "2026-04-11 12:30:00 - INFO - 量子化の進捗: 100%",
      "2026-04-11 12:35:00 - INFO - 量子化に成功しました!"
    ]
  }
}
ログ表示ルール
  • ジョブにカスタムキャリブレーションデータセットが提供されると、ログにデータ処理完了マーカー data process succeeded, start to quantization が含まれます。
  • ログインターフェイスは内部システムマーカーを除外しており、ユーザーが読み取り可能な圧縮進捗情報のみを返します

圧縮ジョブのキャンセル

PENDINGQUEUING、または RUNNING 状態のジョブのみキャンセルできます。キャンセルは非同期操作です。ジョブはまず CANCELING 遷移状態に入り、最終的に CANCELED になります。

エンドポイント
POST /api/v1/fine-tunes/compress/jobs/{job_id}/cancel

{job_id} は、Create compression job API または List compression jobs API から取得できる圧縮ジョブ ID です。

リクエスト例
curl -X POST "https://dashscope-intl.aliyuncs.com/api/v1/fine-tunes/compress/jobs/quant-202604111200-a1b2/cancel" \
  -H "Authorization: Bearer ${API_KEY}"
レスポンス例
{
  "request_id": "uuid-string",
  "output": { "status": "success" }
}

圧縮ジョブの削除

終端状態 (SUCCEEDED / FAILED / CANCELED) のジョブのみ削除できます。ジョブレコードを削除しても、生成済みの量子化モデル (quantized_output) を削除することはありません

エンドポイント
DELETE /api/v1/fine-tunes/compress/jobs/{job_id}

ここで、{job_id} は、「Create compression job」 API または 「List compression jobs」 API から取得できる圧縮ジョブ ID です。

リクエスト例
curl -X DELETE "https://dashscope-intl.aliyuncs.com/api/v1/fine-tunes/compress/jobs/quant-202604111200-a1b2" \
  -H "Authorization: Bearer ${API_KEY}"
レスポンス例
{
  "request_id": "uuid-string",
  "output": { "status": "success" }
}

エラーコード

共通エラーコード

エラーコード

HTTP

説明

InvalidParameter

400

無効なリクエストパラメーター

MissingParameter

400

必須パラメーターが不足しています。

Unauthorized

401

認証に失敗しました

Forbidden

403

アクセス権限がありません

ResourceNotFound

404

リソースが存在しません

UnsupportedOperation

400

リソースの状態が原因で、この操作は実行できません(例:すでに終了状態にあるジョブのキャンセルなど)。

QuotaExceeded

429

クォータ超過

InternalError

500

内部サービスエラー

ビジネスエラーコード

以下のビジネスエラーコードは、シナリオ別に記載されています。External Code は、インターフェイスから返される実際の code フィールドの値です。

パラメーター検証

外部コード

HTTP

説明

InvalidParameter

400

必須パラメーター model がありません

InvalidParameter

400

必須パラメーター template_id が欠落しています

InvalidParameter

400

ベースモデルの直接量子化はサポートされていません。

InvalidParameter

400

指定された構成テンプレートは存在しません

InvalidParameter

400

現在のモデルは、この圧縮テンプレートに対応していません。

InvalidParameter

400

このモデルは量子化に対応していません。

InvalidParameter

400

LoRA でファインチューニングされたモデルは、量子化をサポートしていません。

InvalidParameter

400

モデルデータがありません

InvalidParameter

400

ジョブ名にはサポートされていない文字が含まれています。

InvalidParameter

400

output_model_suffix が 8 文字を超えています。

InvalidParameter

400

ソースモデルの準備ができていません。

AccessDenied

403

この圧縮テンプレートを使用する権限がありません。

ハイパーパラメーター検証

外部コード

HTTP

説明

InvalidParameter

400

必須のハイパーパラメーターが指定されていません

InvalidParameter

400

不明なハイパーパラメーターが指定されました。

InvalidParameter

400

ハイパーパラメーターの値が列挙リストに含まれていません。

InvalidParameter

400

ハイパーパラメーターの値が範囲外です

InvalidParameter

400

ハイパーパラメーターの値は有効な数値ではありません。

ジョブクエリ

外部コード

HTTP

説明

NotFound

404

指定された圧縮ジョブは存在しません。

InvalidParameter

400

必須パラメーター job_id がありません

ページネーションと時間パラメーター

外部コード

HTTP

説明

InvalidParameter

400

ページ番号パラメーターが無効です (1 以上の値を指定してください)

InvalidParameter

400

無効なページサイズ (1~100 の範囲で指定する必要があります)

InvalidParameter

400

無効な時間フォーマット

エラーレスポンス例

{
  "request_id": "uuid-string",
  "code": "InvalidParameter",
  "message": "The specified model 'xxx-lora-yyy' is a LoRA model and not supported for quantization."
}