すべてのプロダクト
Search
ドキュメントセンター

Alibaba Cloud Model Studio:音声クローニング HTTP API リファレンス

最終更新日:Jul 03, 2026

HTTP API を使用して、クローン音声の作成、一覧表示、照会、更新、および削除を行います。

ユーザーガイド: 音声クローニング

サービスエンドポイント

シンガポール

POST https://{WorkspaceId}.ap-southeast-1.maas.aliyuncs.com/api/v1/services/audio/tts/customization

{WorkspaceId} は、実際のワークスペース IDに置き換えてください。

中国 (北京)

POST https://{WorkspaceId}.cn-beijing.maas.aliyuncs.com/api/v1/services/audio/tts/customization

{WorkspaceId} は、実際のワークスペース IDに置き換えてください。

重要

Alibaba Cloud Model Studio は、中国 (北京) リージョンおよびシンガポールリージョン向けにワークスペース専用ドメインをリリースしました。新しい専用ドメインは、推論リクエストに対して優れたパフォーマンスと高い安定性を提供します。以下の新しいドメインへの移行を推奨します。

  • 中国 (北京):従来の dashscope.aliyuncs.com から {WorkspaceId}.cn-beijing.maas.aliyuncs.com

  • シンガポール:従来の dashscope-intl.aliyuncs.com から {WorkspaceId}.ap-southeast-1.maas.aliyuncs.com

{WorkspaceId} は、実際のワークスペース IDに置き換えてください。既存のドメインは引き続き完全に機能します。

リクエストヘッダー

パラメーター

タイプ

必須

説明

Authorization

string

はい

Bearer <your_api_key> 形式の認証トークンです。<your_api_key> は、実際の API キーに置き換えてください。

Content-Type

string

はい

リクエストボディのメディアタイプです。CosyVoice/Qwen-TTS の場合は application/json、MiniMax の場合は application/json; charset=utf-8 に設定してください。

音声の作成

リクエストボディ

この例ではシンガポールリージョンのエンドポイントを使用しています。中国 (北京) リージョンの場合は、次の URL を使用してください:https://{WorkspaceId}.ap-southeast-1.maas.aliyuncs.com/api/v1/services/audio/tts/customization

{WorkspaceId} は、実際のワークスペース IDに置き換えてください。

CosyVoice 音声クローニング

curl -X POST https://{WorkspaceId}.ap-southeast-1.maas.aliyuncs.com/api/v1/services/audio/tts/customization \
-H "Authorization: Bearer $DASHSCOPE_API_KEY" \
-H "Content-Type: application/json" \
-d '{
    "model": "voice-enrollment",
    "input": {
        "action": "create_voice",
        "target_model": "cosyvoice-v3-plus",
        "prefix": "myvoice",
        "url": "https://your-audio-url.wav",
        "language_hints": ["en"]
    }
}'

Qwen 音声クローニング

curl -X POST https://{WorkspaceId}.ap-southeast-1.maas.aliyuncs.com/api/v1/services/audio/tts/customization \
-H "Authorization: Bearer $DASHSCOPE_API_KEY" \
-H "Content-Type: application/json" \
-d '{
    "model": "qwen-voice-enrollment",
    "input": {
        "action": "create",
        "target_model": "qwen3-tts-vc-realtime-2026-01-15",
        "preferred_name": "myvoice",
        "audio": {"data": "data:audio/mpeg;base64,{base64_encoded_audio}"}
    }
}'

model string (必須)

音声クローニングモデルです。有効な値は以下のとおりです。

  • voice-enrollment:CosyVoice 音声クローニング。

  • qwen-voice-enrollment:Qwen 音声クローニング。

input object (必須)

入力パラメーターです。

プロパティ

action string (必須)

アクションタイプです。

  • CosyVoice (voice-enrollment): create_voice に設定します。

  • Qwen (qwen-voice-enrollment): create に設定します。

target_model string (必須)

クローン音声を駆動する音声合成 (TTS) モデルです。TTS API 呼び出し時に指定するモデルと一致させる必要があります。一致しない場合、合成は失敗します。

url string (条件付き必須)

重要

CosyVoice 音声クローニング (モデルが voice-enrollment の場合) のみに適用されます。

音声クローニング用の音声ファイルの URL です。URL はパブリックにアクセス可能である必要があります。

audio object (条件付き必須)

重要

Qwen 音声クローニング (モデルが qwen-voice-enrollment の場合) のみに適用されます。

音声データです。以下の 2 種類の送信方法がサポートされています。

  • Data URL (Base64 エンコード):形式は {"data": "data:{mime_type};base64,{base64_encoded_data}"} です。サポートされる MIME タイプ:audio/wavaudio/mpeg、および audio/mp4

  • 音声 URL:形式は {"data": "https://your-audio-url.wav"} です。URL は認証なしでパブリックにアクセス可能である必要があります。

text string (オプション)

重要

Qwen 音声クローニング (モデルが qwen-voice-enrollment の場合) のみに適用されます。

音声のトランスクリプトです。クローニング品質を向上させるために使用されます。

prefix string (条件付き必須)

重要

CosyVoice (モデルが voice-enrollment の場合) のみに適用されます。

音声名のプレフィックスです。英数字のみが許可され、最大長は 10 文字です。生成される音声名は次の形式になります:{target_model}-{prefix}-{unique_id}

preferred_name string (条件付き必須)

重要

Qwen 音声クローニング (モデルが qwen-voice-enrollment の場合) のみに適用されます。

音声名のプレフィックスです。英数字およびアンダースコア (_) のみが許可され、最大長は 16 文字です。

language_hints array[string] (オプション)

重要

CosyVoice 音声クローニング (モデルが voice-enrollment の場合) のみに適用されます。cosyvoice-v3.5-plus、v3.5-flash、v3-plus、および v3-flash のみがサポートしています。

サンプル音声の言語をモデルが識別し、音声特徴をより正確に抽出してクローニング品質を向上させるのに役立ちます。指定された言語が実際の音声言語と一致しない場合 (たとえば、中国語の音声に対して en を設定した場合)、システムはこの値を無視して自動的に言語を検出します。

このパラメーターは配列ですが、現行バージョンでは最初の要素のみが処理されます。

モデルごとの有効な値は以下のとおりです。

  • cosyvoice-v3-plus:

    • zh:中国語

    • en:英語

    • fr:フランス語

    • de:ドイツ語

    • ja:日本語

    • ko:韓国語

    • ru:ロシア語

  • cosyvoice-v3.5-plus、cosyvoice-v3.5-flash、cosyvoice-v3-flash:

    • zh:中国語

    • en:英語

    • fr:フランス語

    • de:ドイツ語

    • ja:日本語

    • ko:韓国語

    • ru:ロシア語

    • pt:ポルトガル語

    • th:タイ語

    • id:インドネシア語

    • vi:ベトナム語

デフォルト:["zh"]。

language string (オプション)

重要

Qwen 音声クローニング (モデルが qwen-voice-enrollment の場合) のみに適用されます。

audio.data で提供された音声の言語です。このパラメーターを使用する場合は、指定された言語がクローニングに使用する音声の実際の言語と一致していることを確認してください。

有効な値:

  • zh:中国語

  • en:英語

  • de:ドイツ語

  • it:イタリア語

  • pt:ポルトガル語

  • es:スペイン語

  • ja:日本語

  • ko:韓国語

  • fr:フランス語

  • ru:ロシア語

デフォルト:zh。

max_prompt_audio_length float (オプション)

重要

CosyVoice 音声クローニング (モデルが voice-enrollment の場合) のみに適用されます。cosyvoice-v3.5-plus、v3.5-flash、および v3-flash のみがサポートしています。

前処理後の参照音声の最大持続時間 (秒単位) です。有効な値:[3.0, 30.0]。持続時間が長いほど、結果が良くなります。

デフォルト:10.0。

enable_preprocess boolean (オプション)

重要

CosyVoice 音声クローニング (モデルが voice-enrollment の場合) のみに適用されます。cosyvoice-v3.5-plus、v3.5-flash、および v3-flash のみがサポートしています。

音声の前処理 (ノイズリダクション、音声強調、ボリューム正規化) を有効にするかどうかを指定します。バックグラウンドノイズのある録音にはこれを有効にしてください。静かな環境での録音の場合は、元の音声特性を維持するために無効にしてください。

デフォルト:false。

レスポンスボディ

CosyVoice 音声クローニング

{
    "output": {
        "voice_id": "cosyvoice-v3.5-plus-myvoice-xxxxxx"
    },
    "usage": {
        "count": 1
    },
    "request_id": "xxxx-xxxx-xxxx"
}

Qwen 音声クローニング

{
    "output": {
        "voice": "yourVoice",
        "target_model": "qwen3-tts-vc-realtime-2026-01-15"
    },
    "usage": {
        "count": 1
    },
    "request_id": "xxxx-xxxx-xxxx"
}
重要

CosyVoice は voice_id フィールドを返し、Qwen は voice フィールドを返します。Qwen 音声クローニングでは、fallback_mode および fallback_reason フィールドも返される場合があります。

request_id string

このリクエストの一意な識別子です。

output object

モデルから返されるデータです。

プロパティ

voice_id / voice string

音声 ID です。CosyVoice は voice_id を返し、Qwen は voice を返します。この値を TTS API の voice パラメーターで直接使用してください。

target_model string

重要

Qwen のみが返します。

クローン音声を駆動する TTS モデルです。

fallback_mode boolean

重要

Qwen 音声クローニング (モデルが qwen-voice-enrollment の場合) のみに適用されます。

フォールバックモードで音声が作成されたかどうかを示します。true の場合、音声品質が低いか、または提供されたテキストと一致していないため、クローニング品質が低下している可能性があります。

fallback_reason string

重要

fallback_modetrue の場合にのみ返されます。

フォールバックの理由です。考えられる値には、no_merged_segments (音声セグメントをマージできない) および no_valid_asr_segments (音声とテキストの間に重大な不一致がある) が含まれます。

usage object

このリクエストの使用量情報です。

プロパティ

count integer

作成された音声の数です。常に 1 です。

音声一覧の照会

リクエストボディ

この例ではシンガポールリージョンのエンドポイントを使用しています。中国 (北京) リージョンの場合は、次の URL を使用してください:https://{WorkspaceId}.ap-southeast-1.maas.aliyuncs.com/api/v1/services/audio/tts/customization

{WorkspaceId} は、実際のワークスペース IDに置き換えてください。

CosyVoice

curl -X POST https://{WorkspaceId}.ap-southeast-1.maas.aliyuncs.com/api/v1/services/audio/tts/customization \
-H "Authorization: Bearer $DASHSCOPE_API_KEY" \
-H "Content-Type: application/json" \
-d '{
    "model": "voice-enrollment",
    "input": {
        "action": "list_voice",
        "prefix": "myvoice",
        "page_size": 10,
        "page_index": 0
    }
}'

Qwen 音声クローニング

curl -X POST https://{WorkspaceId}.ap-southeast-1.maas.aliyuncs.com/api/v1/services/audio/tts/customization \
-H "Authorization: Bearer $DASHSCOPE_API_KEY" \
-H "Content-Type: application/json" \
-d '{
    "model": "qwen-voice-enrollment",
    "input": {
        "action": "list",
        "page_size": 10,
        "page_index": 0
    }
}'

model string (必須)

音声クローニングモデルです。有効な値は以下のとおりです。

  • voice-enrollment:CosyVoice 音声クローニング。

  • qwen-voice-enrollment:Qwen 音声クローニング。

input object (必須)

入力パラメーターです。

プロパティ

action string (必須)

アクションタイプです。CosyVoice:list_voice。Qwen:list

prefix string (オプション)

重要

CosyVoice のみに適用されます。

音声名のプレフィックスでフィルタリングします。

page_index integer (オプション)

ページインデックスです。

page_size integer (オプション)

1 ページあたりのエントリ数です。

レスポンスボディ

CosyVoice

{
    "output": {
        "voice_list": [
            {
                "voice_id": "cosyvoice-v3.5-plus-myvoice-xxxxxx",
                "gmt_create": "2024-12-11 13:38:02",
                "gmt_modified": "2024-12-11 13:38:02",
                "status": "OK"
            }
        ]
    },
    "usage": {
        "count": 1
    },
    "request_id": "xxxx-xxxx-xxxx"
}

Qwen

{
    "output": {
        "page_index": 0,
        "page_size": 10,
        "total_count": 2,
        "voice_list": [
            {
                "voice": "yourVoice1",
                "gmt_create": "2025-08-11 17:59:32",
                "gmt_modified": "2025-08-11 17:59:32",
                "language": "en",
                "target_model": "qwen3-tts-vc-realtime-2026-01-15"
            }
        ]
    },
    "usage": {
        "count": 0
    },
    "request_id": "xxxx-xxxx-xxxx"
}
重要

CosyVoice は各エントリに voice_id フィールドを含む voice_list 配列を返します。Qwen も voice_list 配列を返しますが、各エントリには代わりに voice フィールドが含まれます。Qwen の出力には、さらに page_indexpage_size、および total_count のページネーションフィールドが含まれます。

request_id string

このリクエストの一意な識別子です。

output object

モデルから返されるデータです。

プロパティ

page_index integer

重要

Qwen のみが返します。

現在のページインデックスです。

page_size integer

重要

Qwen のみが返します。

1 ページあたりのエントリ数です。

total_count integer

重要

Qwen のみが返します。

音声の総数です。

voice_list array[object]

照会された音声の一覧です。CosyVoice と Qwen の両方で voice_list フィールド名を使用します。

プロパティ

voice_id / voice string

音声 ID です。CosyVoice は voice_id を使用し、Qwen は voice を使用します。

gmt_create string

作成時刻です。

gmt_modified string

最終変更時刻です。

status string

重要

CosyVoice のみが返します。

音声のステータスです。有効な値については、「音声ステータスの説明」をご参照ください。

target_model string

重要

Qwen のみが返します。

クローン音声を駆動する TTS モデルです。

usage object

このリクエストの使用量情報です。

プロパティ

count integer

CosyVoice の場合は常に 1 です。Qwen の場合は常に 0 です。

音声詳細の照会

重要

CosyVoice (モデルが voice-enrollment の場合) のみに適用されます。Qwen モデルは、音声詳細照会操作をサポートしていません。

リクエストボディ

この例ではシンガポールリージョンのエンドポイントを使用しています。中国 (北京) リージョンの場合は、次の URL を使用してください:https://{WorkspaceId}.ap-southeast-1.maas.aliyuncs.com/api/v1/services/audio/tts/customization

{WorkspaceId} は、実際のワークスペース IDに置き換えてください。

CosyVoice

curl -X POST https://{WorkspaceId}.ap-southeast-1.maas.aliyuncs.com/api/v1/services/audio/tts/customization \
-H "Authorization: Bearer $DASHSCOPE_API_KEY" \
-H "Content-Type: application/json" \
-d '{
    "model": "voice-enrollment",
    "input": {
        "action": "query_voice",
        "voice_id": "yourVoiceId"
    }
}'

model string (必須)

voice-enrollment (CosyVoice) に設定します。

input object (必須)

入力パラメーターです。

プロパティ

action string (必須)

query_voice に設定します。

voice_id string (必須)

照会する音声 ID です。

レスポンスボディ

{
    "output": {
        "gmt_create": "2024-12-11 13:38:02",
        "resource_link": "https://yourAudioFileUrl",
        "target_model": "cosyvoice-v3.5-plus",
        "gmt_modified": "2024-12-11 13:38:02",
        "status": "OK"
    },
    "usage": {
        "count": 1
    },
    "request_id": "xxxx-xxxx-xxxx"
}

request_id string

このリクエストの一意な識別子です。

output object

モデルから返されるデータです。

プロパティ

resource_link string

音声ファイルの URL です。

gmt_create string

作成時刻です。

gmt_modified string

最終変更時刻です。

status string

音声のステータスです。有効な値については、「音声ステータスの説明」をご参照ください。

target_model string

クローン音声を駆動する TTS モデルです。

usage object

このリクエストの使用量情報です。

プロパティ

count integer

常に 1 です。

音声の更新

重要

CosyVoice 音声クローニング (モデルが voice-enrollment の場合) のみに適用されます。Qwen モデルは、更新操作をサポートしていません。

リクエストボディ

この例ではシンガポールリージョンのエンドポイントを使用しています。中国 (北京) リージョンの場合は、次の URL を使用してください:https://{WorkspaceId}.ap-southeast-1.maas.aliyuncs.com/api/v1/services/audio/tts/customization

{WorkspaceId} を実際のワークスペース IDに置き換えます。curl -X POST https://{WorkspaceId}.ap-southeast-1.maas.aliyuncs.com/api/v1/services/audio/tts/customization \
                    <p><code data-tag="code" id="6495058-en-wsn111-c">{WorkspaceId}

model string (必須)

voice-enrollment に設定します。

input object (必須)

入力パラメーターです。

プロパティ

action string (必須)

update_voice に設定します。

voice_id string (必須)

更新する音声 ID です。

url string (必須)

新しい音声ファイルの URL です。URL はパブリックにアクセス可能である必要があります。

レスポンスボディ

{
    "output": {},
    "usage": {
        "count": 1
    },
    "request_id": "xxxx-xxxx-xxxx"
}

request_id string

このリクエストの一意な識別子です。

output object

モデルから返されるデータです。更新操作では空のオブジェクトが返されます。

usage object

このリクエストの使用量情報です。

プロパティ

count integer

常に 1 です。

音声の削除

リクエストボディ

この例ではシンガポールリージョンのエンドポイントを使用しています。中国 (北京) リージョンの場合は、次の URL を使用してください:https://{WorkspaceId}.ap-southeast-1.maas.aliyuncs.com/api/v1/services/audio/tts/customization

{WorkspaceId} は、実際のワークスペース IDに置き換えてください。

CosyVoice

curl -X POST https://{WorkspaceId}.ap-southeast-1.maas.aliyuncs.com/api/v1/services/audio/tts/customization \
-H "Authorization: Bearer $DASHSCOPE_API_KEY" \
-H "Content-Type: application/json" \
-d '{
    "model": "voice-enrollment",
    "input": {
        "action": "delete_voice",
        "voice_id": "yourVoiceId"
    }
}'

Qwen 音声クローニング

curl -X POST https://{WorkspaceId}.ap-southeast-1.maas.aliyuncs.com/api/v1/services/audio/tts/customization \
-H "Authorization: Bearer $DASHSCOPE_API_KEY" \
-H "Content-Type: application/json" \
-d '{
    "model": "qwen-voice-enrollment",
    "input": {
        "action": "delete",
        "voice": "yourVoice"
    }
}'

model string (必須)

音声クローニングモデルです。有効な値は以下のとおりです。

  • voice-enrollment:CosyVoice 音声クローニング。

  • qwen-voice-enrollment:Qwen 音声クローニング。

input object (必須)

入力パラメーターです。

プロパティ

action string (必須)

アクションタイプです。CosyVoice:delete_voice。Qwen:delete

voice_id string (条件付き必須)

重要

CosyVoice のみに適用されます。

削除する音声 ID です。

voice string (条件付き必須)

重要

Qwen のみに適用されます。

削除する音声名です。

レスポンスボディ

CosyVoice

{
    "output": {},
    "usage": {
        "count": 1
    },
    "request_id": "xxxx-xxxx-xxxx"
}

Qwen

{
    "output": {
        "voice": "yourVoice"
    },
    "usage": {
        "count": 0
    },
    "request_id": "xxxx-xxxx-xxxx"
}
重要

CosyVoice は空の output オブジェクトを返し、Qwen は削除された音声名を含む voice フィールドを返します。

request_id string

このリクエストの一意な識別子です。

output object

モデルから返されるデータです。CosyVoice は空のオブジェクトを返し、Qwen は削除された音声の名前を返します。

プロパティ

voice string

重要

Qwen のみが返します。

削除された音声の名前です。

usage object

このリクエストの使用量情報です。

プロパティ

count integer

CosyVoice の場合は常に 1 です。Qwen の場合は常に 0 です。

音声ステータスの説明

音声が作成された後、レビュー処理を経ます。以下のステータスは CosyVoice (モデルが voice-enrollment の場合) のみに適用されます。Qwen の照会および一覧レスポンスにはステータスフィールドが含まれません。

ステータス

説明

DEPLOYING

レビュー中または処理中です。

OK

レビューに合格しました。音声は使用可能です。

UNDEPLOYED

レビューが拒否されました。音声は使用できません。