すべてのプロダクト
Search
ドキュメントセンター

Alibaba Cloud Model Studio:音声クローニング HTTP API リファレンス

最終更新日:Jul 16, 2026

HTTP API を使用して、クローンされた音声の作成、一覧表示、クエリ、更新、削除を行います。

ユーザーガイド: 音声クローニング

サービスエンドポイント

シンガポール

POST https://{WorkspaceId}.ap-southeast-1.maas.aliyuncs.com/api/v1/services/audio/tts/customization

{WorkspaceId} を実際の ワークスペース ID に置き換えてください。

中国 (北京)

POST https://{WorkspaceId}.cn-beijing.maas.aliyuncs.com/api/v1/services/audio/tts/customization

{WorkspaceId} を実際の ワークスペース ID に置き換えてください。

重要

Alibaba Cloud Model Studio は、中国 (北京) およびシンガポールリージョン向けにワークスペース固有のドメインをリリースしました。新しい専用ドメインは、推論リクエストに対してより優れたパフォーマンスと高い安定性を提供します。新しいドメインへの移行を推奨します:

  • 中国 (北京): dashscope.aliyuncs.com から {WorkspaceId}.cn-beijing.maas.aliyuncs.com

  • シンガポール: dashscope-intl.aliyuncs.com から {WorkspaceId}.ap-southeast-1.maas.aliyuncs.com

{WorkspaceId} を実際の ワークスペース ID に置き換えてください。既存のドメインも引き続き完全に機能します。

リクエストヘッダー

パラメーター

タイプ

必須

説明

Authorization

string

はい

認証トークン。フォーマットは Bearer <your_api_key> です。<your_api_key> を実際の API キーに置き換えてください。

Content-Type

string

はい

リクエストボディのメディアタイプ。Qwen-Audio-TTS/CosyVoice/Qwen-TTS の場合は application/json に、MiniMax の場合は application/json; charset=utf-8 に設定します。

音声の作成

リクエストボディ

この例では、シンガポールリージョンのエンドポイントを使用します。北京リージョンの場合は、https://{WorkspaceId}.cn-beijing.maas.aliyuncs.com/api/v1/services/audio/tts/customization を使用してください。

{WorkspaceId} を実際の ワークスペース ID に置き換えてください。

Qwen-Audio-TTS/CosyVoice 音声クローニング

curl -X POST https://{WorkspaceId}.ap-southeast-1.maas.aliyuncs.com/api/v1/services/audio/tts/customization \
-H "Authorization: Bearer $DASHSCOPE_API_KEY" \
-H "Content-Type: application/json" \
-d '{
    "model": "voice-enrollment",
    "input": {
        "action": "create_voice",
        "target_model": "qwen-audio-3.0-tts-flash",
        "prefix": "myvoice",
        "url": "https://your-audio-url.wav",
        "language_hints": ["en"]
    }
}'

Qwen-TTS 音声クローニング

curl -X POST https://{WorkspaceId}.ap-southeast-1.maas.aliyuncs.com/api/v1/services/audio/tts/customization \
-H "Authorization: Bearer $DASHSCOPE_API_KEY" \
-H "Content-Type: application/json" \
-d '{
    "model": "qwen-voice-enrollment",
    "input": {
        "action": "create",
        "target_model": "qwen3-tts-vc-realtime-2026-01-15",
        "preferred_name": "myvoice",
        "audio": {"data": "data:audio/mpeg;base64,{base64_encoded_audio}"}
    }
}'

model string (必須)

音声クローニングモデル。有効な値:

  • voice-enrollment: Qwen-Audio-TTS/CosyVoice 音声クローニング。

  • qwen-voice-enrollment: Qwen-TTS 音声クローニング。

input object (必須)

入力パラメーター。

プロパティ

action string (必須)

アクションタイプ。

  • Qwen-Audio-TTS/CosyVoice (voice-enrollment): create_voice に設定します。

  • Qwen (qwen-voice-enrollment): create に設定します。

target_model string (必須)

クローンされた音声を駆動する音声合成 (TTS) モデル。TTS API を呼び出す際に指定するモデルと一致させる必要があります。一致しない場合、合成は失敗します。

url string (条件付きで必須)

重要

Qwen-Audio-TTS/CosyVoice 音声クローニング (model が voice-enrollment の場合) にのみ適用されます。

音声クローニング用の音声ファイルの URL。URL はパブリックにアクセスできる必要があります。

audio object (条件付きで必須)

重要

Qwen-TTS 音声クローニング (model が qwen-voice-enrollment の場合) にのみ適用されます。

音声データ。2つの送信方法がサポートされています:

  • データ URL (Base64 エンコード):フォーマットは {"data": "data:{mime_type};base64,{base64_encoded_data}"} です。サポートされている MIME タイプ: audio/wavaudio/mpegaudio/mp4

  • 音声 URL:フォーマットは {"data": "https://your-audio-url.wav"} です。URL は認証なしでパブリックにアクセスできる必要があります。

text string (任意)

重要

Qwen-TTS 音声クローニング (model が qwen-voice-enrollment の場合) にのみ適用されます。

音声のトランスクリプト。クローニングの品質を向上させるために使用されます。

prefix string (条件付きで必須)

重要

Qwen-Audio-TTS/CosyVoice (model が voice-enrollment の場合) にのみ適用されます。

音声名のプレフィックス。英数字のみ使用可能で、最大長は 10 文字です。生成される音声名は次のフォーマットに従います: {target_model}-{prefix}-{unique_id}

preferred_name string (条件付きで必須)

重要

Qwen-TTS 音声クローニング (model が qwen-voice-enrollment の場合) にのみ適用されます。

音声名のプレフィックス。英数字とアンダースコアのみ使用可能で、最大長は 16 文字です。

language_hints array[string] (任意)

重要

Qwen-Audio-TTS/CosyVoice 音声クローニング (model が voice-enrollment の場合) にのみ適用されます。qwen-audio-3.0-tts-flash, cosyvoice-v3.5-plus, v3.5-flash, v3-plus, and v3-flash でのみサポートされています。

モデルがサンプル音声の言語を識別し、音声特徴をより正確に抽出してクローニングの品質を向上させるのに役立ちます。指定された言語が実際の音声言語と一致しない場合 (例:音声が中国語なのに en を設定した場合)、システムはこの値を無視し、言語を自動的に検出します。

このパラメーターは配列ですが、現在のバージョンでは最初の要素のみが処理されます。

有効な値はモデルによって異なります:

  • qwen-audio-3.0-tts-flash:

    • zh: 中国語

    • en: 英語

    • fr: フランス語

    • de: ドイツ語

    • ja: 日本語

    • ko: 韓国語

    • ru: ロシア語

    • pt: ポルトガル語

    • th: タイ語

    • id: インドネシア語

    • vi: ベトナム語

    • it: イタリア語

    • ms: マレー語

  • cosyvoice-v3-plus:

    • zh: 中国語

    • en: 英語

    • fr: フランス語

    • de: ドイツ語

    • ja: 日本語

    • ko: 韓国語

    • ru: ロシア語

  • cosyvoice-v3.5-plus, cosyvoice-v3.5-flash, cosyvoice-v3-flash:

    • zh: 中国語

    • en: 英語

    • fr: フランス語

    • de: ドイツ語

    • ja: 日本語

    • ko: 韓国語

    • ru: ロシア語

    • pt: ポルトガル語

    • th: タイ語

    • id: インドネシア語

    • vi: ベトナム語

デフォルト: ["zh"]。

language string (任意)

重要

Qwen-TTS 音声クローニング (model が qwen-voice-enrollment の場合) にのみ適用されます。

audio.data で提供される音声の言語。このパラメーターを使用する場合、指定された言語がクローニングに使用される実際の音声の言語と一致することを確認してください。

有効な値:

  • zh: 中国語

  • en: 英語

  • de: ドイツ語

  • it: イタリア語

  • pt: ポルトガル語

  • es: スペイン語

  • ja: 日本語

  • ko: 韓国語

  • fr: フランス語

  • ru: ロシア語

デフォルト: zh。

max_prompt_audio_length float (任意)

重要

Qwen-Audio-TTS/CosyVoice 音声クローニング (model が voice-enrollment の場合) にのみ適用されます。qwen-audio-3.0-tts-flash, cosyvoice-v3.5-plus, v3.5-flash, and v3-flash でのみサポートされています。

前処理後の参照音声の最大持続時間 (秒)。有効な値: [3.0, 30.0]。持続時間が長いほど、より良い結果が得られます。

デフォルト: 10.0。

enable_preprocess boolean (任意)

重要

Qwen-Audio-TTS/CosyVoice 音声クローニング (model が voice-enrollment の場合) にのみ適用されます。qwen-audio-3.0-tts-flash, cosyvoice-v3.5-plus, v3.5-flash, and v3-flash でのみサポートされています。

音声の前処理 (ノイズリダクション、音声強調、音量正規化) を有効にするかどうか。バックグラウンドノイズのある録音に対してはこれを有効にしてください。静かな環境での録音の場合は、元の音声特性を保持するために無効にしてください。

デフォルト: false。

レスポンスボディ

Qwen-Audio-TTS/CosyVoice 音声クローニング

{
    "output": {
        "voice_id": "qwen-audio-3.0-tts-flash-myvoice-xxxxxx"
    },
    "usage": {
        "count": 1
    },
    "request_id": "xxxx-xxxx-xxxx"
}

Qwen-TTS 音声クローニング

{
    "output": {
        "voice": "yourVoice",
        "target_model": "qwen3-tts-vc-realtime-2026-01-15"
    },
    "usage": {
        "count": 1
    },
    "request_id": "xxxx-xxxx-xxxx"
}
重要

Qwen-Audio-TTS/CosyVoice は voice_id フィールドを返しますが、Qwen は voice フィールドを返します。Qwen-TTS 音声クローニングは、fallback_mode および fallback_reason フィールドを返すこともあります。

request_id string

このリクエストの一意の識別子。

output object

モデルによって返されるデータ。

プロパティ

voice_id / voice string

音声 ID。Qwen-Audio-TTS/CosyVoice は voice_id を返し、Qwen は voice を返します。この値を TTS API の voice パラメーターで直接使用します。

target_model string

重要

Qwen によってのみ返されます。

クローンされた音声を駆動する TTS モデル。

fallback_mode boolean

重要

Qwen-TTS 音声クローニング (model が qwen-voice-enrollment の場合) にのみ適用されます。

音声がフォールバックモードで作成されたかどうか。値が true の場合、音声の品質が低いか、提供されたテキストと一致しないため、クローニングの品質が低下する可能性があることを示します。

fallback_reason string

重要

fallback_modetrue の場合にのみ返されます。

フォールバックの理由。考えられる値には、no_merged_segments (音声セグメントをマージできない) や no_valid_asr_segments (音声とテキストの間に深刻な不一致がある) などがあります。

usage object

このリクエストの使用状況情報。

プロパティ

count integer

作成された音声の数。常に 1 です。

音声リストのクエリ

リクエストボディ

この例では、シンガポールリージョンのエンドポイントを使用します。北京リージョンの場合は、https://{WorkspaceId}.cn-beijing.maas.aliyuncs.com/api/v1/services/audio/tts/customization を使用してください。

{WorkspaceId} を実際の ワークスペース ID に置き換えてください。

Qwen-Audio-TTS/CosyVoice

curl -X POST https://{WorkspaceId}.ap-southeast-1.maas.aliyuncs.com/api/v1/services/audio/tts/customization \
-H "Authorization: Bearer $DASHSCOPE_API_KEY" \
-H "Content-Type: application/json" \
-d '{
    "model": "voice-enrollment",
    "input": {
        "action": "list_voice",
        "prefix": "myvoice",
        "page_size": 10,
        "page_index": 0
    }
}'

Qwen-TTS 音声クローニング

curl -X POST https://{WorkspaceId}.ap-southeast-1.maas.aliyuncs.com/api/v1/services/audio/tts/customization \
-H "Authorization: Bearer $DASHSCOPE_API_KEY" \
-H "Content-Type: application/json" \
-d '{
    "model": "qwen-voice-enrollment",
    "input": {
        "action": "list",
        "page_size": 10,
        "page_index": 0
    }
}'

model string (必須)

音声クローニングモデル。有効な値:

  • voice-enrollment: Qwen-Audio-TTS/CosyVoice 音声クローニング。

  • qwen-voice-enrollment: Qwen-TTS 音声クローニング。

input object (必須)

入力パラメーター。

プロパティ

action string (必須)

アクションタイプ。Qwen-Audio-TTS/CosyVoice: list_voice。Qwen: list

prefix string (任意)

重要

Qwen-Audio-TTS/CosyVoice にのみ適用されます。

名前のプレフィックスで音声をフィルタリングします。

page_index integer (任意)

ページインデックス。

page_size integer (任意)

1ページあたりのエントリ数。

レスポンスボディ

Qwen-Audio-TTS/CosyVoice

{
    "output": {
        "voice_list": [
            {
                "voice_id": "qwen-audio-3.0-tts-flash-myvoice-xxxxxx",
                "gmt_create": "2024-12-11 13:38:02",
                "gmt_modified": "2024-12-11 13:38:02",
                "status": "OK"
            }
        ]
    },
    "usage": {
        "count": 1
    },
    "request_id": "xxxx-xxxx-xxxx"
}

Qwen

{
    "output": {
        "page_index": 0,
        "page_size": 10,
        "total_count": 2,
        "voice_list": [
            {
                "voice": "yourVoice1",
                "gmt_create": "2025-08-11 17:59:32",
                "gmt_modified": "2025-08-11 17:59:32",
                "language": "en",
                "target_model": "qwen3-tts-vc-realtime-2026-01-15"
            }
        ]
    },
    "usage": {
        "count": 0
    },
    "request_id": "xxxx-xxxx-xxxx"
}
重要

Qwen-Audio-TTS/CosyVoice は、各エントリに voice_id フィールドを含む voice_list 配列を返します。Qwen も voice_list 配列を返しますが、各エントリには代わりに voice フィールドが含まれます。Qwen の出力には、さらに page_indexpage_sizetotal_count のページネーションフィールドが含まれます。

request_id string

このリクエストの一意の識別子。

output object

モデルによって返されるデータ。

プロパティ

page_index integer

重要

Qwen によってのみ返されます。

現在のページインデックス。

page_size integer

重要

Qwen によってのみ返されます。

1ページあたりのエントリ数。

total_count integer

重要

Qwen によってのみ返されます。

音声の総数。

voice_list array[object]

クエリされた音声のリスト。Qwen-Audio-TTS/CosyVoice と Qwen の両方が voice_list フィールド名を使用します。

プロパティ

voice_id / voice string

音声 ID。Qwen-Audio-TTS/CosyVoice は voice_id を使用し、Qwen は voice を使用します。

gmt_create string

作成時刻。

gmt_modified string

最終変更時刻。

status string

重要

Qwen-Audio-TTS/CosyVoice によってのみ返されます。

音声ステータス。有効な値については、「音声ステータスの説明」をご参照ください。

target_model string

重要

Qwen によってのみ返されます。

クローンされた音声を駆動する TTS モデル。

usage object

このリクエストの使用状況情報。

プロパティ

count integer

Qwen-Audio-TTS/CosyVoice の場合は常に 1。Qwen の場合は常に 0。

音声詳細のクエリ

重要

Qwen-Audio-TTS/CosyVoice (model が voice-enrollment の場合) にのみ適用されます。Qwen モデルは、音声詳細のクエリ操作をサポートしていません。

リクエストボディ

この例では、シンガポールリージョンのエンドポイントを使用します。北京リージョンの場合は、https://{WorkspaceId}.cn-beijing.maas.aliyuncs.com/api/v1/services/audio/tts/customization を使用してください。

{WorkspaceId} を実際の ワークスペース ID に置き換えてください。

Qwen-Audio-TTS/CosyVoice

curl -X POST https://{WorkspaceId}.ap-southeast-1.maas.aliyuncs.com/api/v1/services/audio/tts/customization \
-H "Authorization: Bearer $DASHSCOPE_API_KEY" \
-H "Content-Type: application/json" \
-d '{
    "model": "voice-enrollment",
    "input": {
        "action": "query_voice",
        "voice_id": "yourVoiceId"
    }
}'

model string (必須)

voice-enrollment (Qwen-Audio-TTS/CosyVoice) に設定します。

input object (必須)

入力パラメーター。

プロパティ

action string (必須)

query_voice に設定します。

voice_id string (必須)

クエリする音声 ID。

レスポンスボディ

{
    "output": {
        "gmt_create": "2024-12-11 13:38:02",
        "resource_link": "https://yourAudioFileUrl",
        "target_model": "qwen-audio-3.0-tts-flash",
        "gmt_modified": "2024-12-11 13:38:02",
        "status": "OK"
    },
    "usage": {
        "count": 1
    },
    "request_id": "xxxx-xxxx-xxxx"
}

request_id string

このリクエストの一意の識別子。

output object

モデルによって返されるデータ。

プロパティ

resource_link string

音声ファイルの URL。

gmt_create string

作成時刻。

gmt_modified string

最終変更時刻。

status string

音声ステータス。有効な値については、「音声ステータスの説明」をご参照ください。

target_model string

クローンされた音声を駆動する TTS モデル。

usage object

このリクエストの使用状況情報。

プロパティ

count integer

常に 1 です。

音声の更新

重要

Qwen-Audio-TTS/CosyVoice 音声クローニング (model が voice-enrollment の場合) にのみ適用されます。Qwen モデルは更新操作をサポートしていません。

リクエストボディ

この例では、シンガポールリージョンのエンドポイントを使用します。北京リージョンの場合は、https://{WorkspaceId}.cn-beijing.maas.aliyuncs.com/api/v1/services/audio/tts/customization を使用してください。

{WorkspaceId} を実際の ワークスペース ID に置き換えます。curl -X POST https://{WorkspaceId}.ap-southeast-1.maas.aliyuncs.com/api/v1/services/audio/tts/customization \
                    <p><code data-tag="code" id="6495058-en-wsn111-c">{WorkspaceId}

model string (必須)

voice-enrollment に設定します。

input object (必須)

入力パラメーター。

プロパティ

action string (必須)

update_voice に設定します。

voice_id string (必須)

更新する音声 ID。

url string (必須)

新しい音声ファイルの URL。URL はパブリックにアクセスできる必要があります。

レスポンスボディ

{
    "output": {},
    "usage": {
        "count": 1
    },
    "request_id": "xxxx-xxxx-xxxx"
}

request_id string

このリクエストの一意の識別子。

output object

モデルによって返されるデータ。更新操作は空のオブジェクトを返します。

usage object

このリクエストの使用状況情報。

プロパティ

count integer

常に 1 です。

音声の削除

リクエストボディ

この例では、シンガポールリージョンのエンドポイントを使用します。北京リージョンの場合は、https://{WorkspaceId}.cn-beijing.maas.aliyuncs.com/api/v1/services/audio/tts/customization を使用してください。

{WorkspaceId} を実際の ワークスペース ID に置き換えてください。

Qwen-Audio-TTS/CosyVoice

curl -X POST https://{WorkspaceId}.ap-southeast-1.maas.aliyuncs.com/api/v1/services/audio/tts/customization \
-H "Authorization: Bearer $DASHSCOPE_API_KEY" \
-H "Content-Type: application/json" \
-d '{
    "model": "voice-enrollment",
    "input": {
        "action": "delete_voice",
        "voice_id": "yourVoiceId"
    }
}'

Qwen-TTS 音声クローニング

curl -X POST https://{WorkspaceId}.ap-southeast-1.maas.aliyuncs.com/api/v1/services/audio/tts/customization \
-H "Authorization: Bearer $DASHSCOPE_API_KEY" \
-H "Content-Type: application/json" \
-d '{
    "model": "qwen-voice-enrollment",
    "input": {
        "action": "delete",
        "voice": "yourVoice"
    }
}'

model string (必須)

音声クローニングモデル。有効な値:

  • voice-enrollment: Qwen-Audio-TTS/CosyVoice 音声クローニング。

  • qwen-voice-enrollment: Qwen-TTS 音声クローニング。

input object (必須)

入力パラメーター。

プロパティ

action string (必須)

アクションタイプ。Qwen-Audio-TTS/CosyVoice: delete_voice。Qwen: delete

voice_id string (条件付きで必須)

重要

Qwen-Audio-TTS/CosyVoice にのみ適用されます。

削除する音声 ID。

voice string (条件付きで必須)

重要

Qwen にのみ適用されます。

削除する音声名。

レスポンスボディ

Qwen-Audio-TTS/CosyVoice

{
    "output": {},
    "usage": {
        "count": 1
    },
    "request_id": "xxxx-xxxx-xxxx"
}

Qwen

{
    "output": {
        "voice": "yourVoice"
    },
    "usage": {
        "count": 0
    },
    "request_id": "xxxx-xxxx-xxxx"
}
重要

Qwen-Audio-TTS/CosyVoice は空の出力オブジェクトを返しますが、Qwen は削除された音声名を持つ voice フィールドを返します。

request_id string

このリクエストの一意の識別子。

output object

モデルによって返されるデータ。Qwen-Audio-TTS/CosyVoice は空のオブジェクトを返し、Qwen は削除された音声の名前を返します。

プロパティ

voice string

重要

Qwen によってのみ返されます。

削除された音声の名前。

usage object

このリクエストの使用状況情報。

プロパティ

count integer

Qwen-Audio-TTS/CosyVoice の場合は常に 1。Qwen の場合は常に 0。

音声ステータスの説明

音声が作成されると、レビュープロセスを経ます。以下のステータスは、Qwen-Audio-TTS/CosyVoice (model が voice-enrollment の場合) にのみ適用されます。Qwen のクエリおよびリストのレスポンスにはステータスフィールドは含まれません。

ステータス

説明

DEPLOYING

レビュー中または処理中です。

OK

レビューに合格しました。音声は使用可能な状態です。

UNDEPLOYED

レビューが拒否されました。音声は使用できません。