すべてのプロダクト
Search
ドキュメントセンター

Alibaba Cloud Model Studio:Python SDK

最終更新日:Jul 08, 2026

このトピックでは、 DashScope Python SDK を使用してリアルタイム音声合成 (Qwen) を呼び出す際の、主要なインターフェースとリクエストパラメーターを説明します。

ユーザーガイド:モデルの紹介と選択の推奨事項については、「リアルタイム音声合成 – Qwen」または「音声合成 – Qwen」をご参照ください。

前提条件

DashScope Python SDK 1.25.11 以降が必要です。

開始方法

サーバーコミットモード

import os
import base64
import threading
import time
import dashscope
from dashscope.audio.qwen_tts_realtime import *


qwen_tts_realtime: QwenTtsRealtime = None
text_to_synthesize = [
    'Right? I love supermarkets like this.',
    'Especially during Chinese New Year,',
    'I go shopping at supermarkets.',
    'And I feel',
    'absolutely thrilled!',
    'I want to buy so many things!'
]

DO_VIDEO_TEST = False

def init_dashscope_api_key():
    """
        DashScope API キーを設定します。詳細:
        https://github.com/aliyun/alibabacloud-bailian-speech-demo/blob/master/PREREQUISITES.md
    """

    # API キーは Singapore リージョンと Beijing リージョンで異なります。API キーの取得: https://www.alibabacloud.com/help/model-studio/get-api-key
    if 'DASHSCOPE_API_KEY' in os.environ:
        dashscope.api_key = os.environ[
            'DASHSCOPE_API_KEY']  # 環境変数 DASHSCOPE_API_KEY から API キーを読み込みます
    else:
        dashscope.api_key = 'your-dashscope-api-key'  # API キーを手動で設定します



class MyCallback(QwenTtsRealtimeCallback):
    def __init__(self):
        self.complete_event = threading.Event()
        self.file = open('result_24k.pcm', 'wb')

    def on_open(self) -> None:
        print('connection opened, init player')

    def on_close(self, close_status_code, close_msg) -> None:
        self.file.close()
        print('connection closed with code: {}, msg: {}, destroy player'.format(close_status_code, close_msg))

    def on_event(self, response: str) -> None:
        try:
            global qwen_tts_realtime
            type = response['type']
            if 'session.created' == type:
                print('start session: {}'.format(response['session']['id']))
            if 'response.audio.delta' == type:
                recv_audio_b64 = response['delta']
                self.file.write(base64.b64decode(recv_audio_b64))
            if 'response.done' == type:
                print(f'response {qwen_tts_realtime.get_last_response_id()} done')
            if 'session.finished' == type:
                print('session finished')
                self.complete_event.set()
        except Exception as e:
            print('[Error] {}'.format(e))
            return

    def wait_for_finished(self):
        self.complete_event.wait()


if __name__  == '__main__':
    init_dashscope_api_key()

    print('Initializing ...')

    callback = MyCallback()

    qwen_tts_realtime = QwenTtsRealtime(
        # 指示コントロールを使用するには、モデルを qwen3-tts-instruct-flash-realtime に置き換えます
        model='qwen3-tts-flash-realtime',
        callback=callback,
        # Singapore リージョン
        url='wss://dashscope-intl.aliyuncs.com/api-ws/v1/realtime'
        )

    qwen_tts_realtime.connect()
    qwen_tts_realtime.update_session(
        voice = 'Cherry',
        response_format = AudioFormat.PCM_24000HZ_MONO_16BIT,
        # 指示コントロールを使用するには、次の行のコメントを解除し、モデルを qwen3-tts-instruct-flash-realtime に置き換えます
        # instructions='Speak quickly with a rising intonation, suitable for introducing fashion products.',
        # optimize_instructions=True,
        mode = 'server_commit'        
    )
    for text_chunk in text_to_synthesize:
        print(f'send text: {text_chunk}')
        qwen_tts_realtime.append_text(text_chunk)
        time.sleep(0.1)
    qwen_tts_realtime.finish()
    callback.wait_for_finished()
    print('[Metric] session: {}, first audio delay: {}'.format(
                    qwen_tts_realtime.get_session_id(), 
                    qwen_tts_realtime.get_first_audio_delay(),
                    ))

コミットモード

import base64
import os
import threading
import dashscope
from dashscope.audio.qwen_tts_realtime import *


qwen_tts_realtime: QwenTtsRealtime = None
text_to_synthesize = [
    'This is the first sentence.',
    'This is the second sentence.',
    'This is the third sentence.',
]

DO_VIDEO_TEST = False

def init_dashscope_api_key():
    """
        DashScope API キーを設定します。詳細:
        https://github.com/aliyun/alibabacloud-bailian-speech-demo/blob/master/PREREQUISITES.md
    """

    # API キーは Singapore リージョンと Beijing リージョンで異なります。API キーの取得: https://www.alibabacloud.com/help/model-studio/get-api-key
    if 'DASHSCOPE_API_KEY' in os.environ:
        dashscope.api_key = os.environ[
            'DASHSCOPE_API_KEY']  # 環境変数 DASHSCOPE_API_KEY から API キーを読み込みます
    else:
        dashscope.api_key = 'your-dashscope-api-key'  # API キーを手動で設定します



class MyCallback(QwenTtsRealtimeCallback):
    def __init__(self):
        super().__init__()
        self.response_counter = 0
        self.complete_event = threading.Event()
        self.file = open(f'result_{self.response_counter}_24k.pcm', 'wb')

    def reset_event(self):
        self.response_counter += 1
        self.file = open(f'result_{self.response_counter}_24k.pcm', 'wb')
        self.complete_event = threading.Event()

    def on_open(self) -> None:
        print('connection opened, init player')

    def on_close(self, close_status_code, close_msg) -> None:
        print('connection closed with code: {}, msg: {}, destroy player'.format(close_status_code, close_msg))

    def on_event(self, response: str) -> None:
        try:
            global qwen_tts_realtime
            type = response['type']
            if 'session.created' == type:
                print('start session: {}'.format(response['session']['id']))
            if 'response.audio.delta' == type:
                recv_audio_b64 = response['delta']
                self.file.write(base64.b64decode(recv_audio_b64))
            if 'response.done' == type:
                print(f'response {qwen_tts_realtime.get_last_response_id()} done')
                self.complete_event.set()
                self.file.close()
            if 'session.finished' == type:
                print('session finished')
                self.complete_event.set()
        except Exception as e:
            print('[Error] {}'.format(e))
            return

    def wait_for_response_done(self):
        self.complete_event.wait()


if __name__  == '__main__':
    init_dashscope_api_key()

    print('Initializing ...')

    callback = MyCallback()

    qwen_tts_realtime = QwenTtsRealtime(
        # 指示コントロールを使用するには、モデルを qwen3-tts-instruct-flash-realtime に置き換えます
        model='qwen3-tts-flash-realtime',
        callback=callback, 
        # Singapore リージョン
        url='wss://dashscope-intl.aliyuncs.com/api-ws/v1/realtime'
        )

    qwen_tts_realtime.connect()
    qwen_tts_realtime.update_session(
        voice = 'Cherry',
        response_format = AudioFormat.PCM_24000HZ_MONO_16BIT,
        # 指示コントロールを使用するには、次の行のコメントを解除し、モデルを qwen3-tts-instruct-flash-realtime に置き換えます
        # instructions='Speak quickly with a rising intonation, suitable for introducing fashion products.',
        # optimize_instructions=True,
        mode = 'commit'        
    )
    print(f'send text: {text_to_synthesize[0]}')
    qwen_tts_realtime.append_text(text_to_synthesize[0])
    qwen_tts_realtime.commit()
    callback.wait_for_response_done()
    callback.reset_event()
    
    print(f'send text: {text_to_synthesize[1]}')
    qwen_tts_realtime.append_text(text_to_synthesize[1])
    qwen_tts_realtime.commit()
    callback.wait_for_response_done()
    callback.reset_event()

    print(f'send text: {text_to_synthesize[2]}')
    qwen_tts_realtime.append_text(text_to_synthesize[2])
    qwen_tts_realtime.commit()
    callback.wait_for_response_done()
    
    qwen_tts_realtime.finish()
    print('[Metric] session: {}, first audio delay: {}'.format(
                    qwen_tts_realtime.get_session_id(), 
                    qwen_tts_realtime.get_first_audio_delay(),
                    ))

詳細については、GitHub にアクセスして、追加のサンプルコードをダウンロードしてください。

リクエストパラメータ

QwenTtsRealtime コンストラクターでは、以下のパラメーターを設定します。

パラメーター

タイプ

必須

説明

model

str

はい

モデル名 (「サポートされているモデル」をご参照ください)。

url

str

はい

China (Beijing): wss://dashscope.aliyuncs.com/api-ws/v1/realtime

Singapore: wss://dashscope-intl.aliyuncs.com/api-ws/v1/realtime

update_session を使用して、以下のパラメーターを設定します。

パラメーター

タイプ

必須

説明

voice

str

はい

音声合成に使用する音声です。詳細については、「サポートされる音声」をご参照ください。

システム音声とカスタム音声がサポートされています。

  • システム音声:Qwen3-TTS-Instruct-Flash-Realtime、Qwen3-TTS-Flash-Realtime、および Qwen-TTS-Realtime モデルシリーズでのみ利用可能です。音声サンプルについては、「サポートされる音声」をご参照ください。

  • カスタム音声

    • 音声クローン (Qwen) を使用してカスタマイズされた音声:Qwen3-TTS-VC-Realtime シリーズでのみ利用可能です。

    • 音声デザイン (Qwen) を使用してカスタマイズされた音声:Qwen3-TTS-VD-Realtime シリーズでのみ利用可能です。

language_type

str

いいえ

合成オーディオの言語です。デフォルト値は Auto です。

  • Auto:テキストの言語が不明な場合や、複数の言語が混在している場合に使用します。モデルはテキスト内の異なる言語セグメントに対して自動的に発音をマッチングしますが、完全な精度は保証できません。

  • 特定の言語:単一言語のテキストに使用します。言語を指定することで合成品質が大幅に向上し、通常は Auto よりも優れた結果が得られます。有効な値は以下のとおりです。

    • Chinese

    • English

    • German

    • Italian

    • Portuguese

    • Spanish

    • Japanese

    • Korean

    • French

    • Russian

mode

str

いいえ

インタラクションパターンです。有効な値は以下のとおりです。

  • server_commit (デフォルト):サーバーが自動的に合成タイミングを判断し、レイテンシと品質のバランスを取ります。ほとんどのシナリオでこのパターンを推奨します。

  • commit:クライアントが手動で合成をトリガーします。このパターンは最低のレイテンシを実現しますが、文の整合性を管理する必要があります。

format

str

いいえ

モデルからのオーディオ出力フォーマットです。

サポートされるフォーマット:

  • pcm (デフォルト)

  • wav

  • mp3

  • opus

Qwen-TTS-Realtime (「サポートされるモデル」をご参照ください)pcm のみをサポートします。

sample_rate

int

いいえ

モデルからのオーディオ出力のサンプルレート (Hz) です。

サポートされるサンプルレート:

  • 8000

  • 16000

  • 24000 (デフォルト)

  • 48000

Qwen-TTS-Realtime (「サポートされるモデル」をご参照ください) は 24000 のみをサポートします。

speech_rate

float

いいえ

オーディオの話速です。1.0 が通常速度です。1.0 未満は低速、1.0 より大きい値は高速になります。

デフォルト値:1.0

有効範囲:[0.5, 2.0]

Qwen-TTS-Realtime (「サポートされるモデル」をご参照ください) はこのパラメーターをサポートしません。

volume

int

いいえ

オーディオのボリュームです。

デフォルト値:50

有効範囲:[0, 100]

Qwen-TTS-Realtime (「サポートされるモデル」をご参照ください) はこのパラメーターをサポートしません。

pitch_rate

float

いいえ

合成オーディオのピッチです。

デフォルト値:1.0

有効範囲:[0.5, 2.0]

Qwen-TTS-Realtime (「サポートされるモデル」をご参照ください) はこのパラメーターをサポートしません。

bit_rate

int

いいえ

ビットレート (kbps) です。ビットレートが高いほどオーディオ品質が向上し、ファイルサイズも大きくなります。このパラメーターは、オーディオフォーマット (response_format) が opus に設定されている場合にのみ使用できます。

デフォルト値:128

有効範囲:[6, 510]

Qwen-TTS-Realtime (「サポートされるモデル」をご参照ください) はこのパラメーターをサポートしません。

instructions

str

いいえ

命令を設定します。「リアルタイム音声合成 - Qwen」をご参照ください。

デフォルト値:なし。設定されていない場合、このパラメーターは効果を持ちません。

長さ制限:長さは 1600 トークンを超えてはなりません。

サポート言語:中国語と英語のみサポートされます。

適用範囲:この機能は Qwen3-TTS-Instruct-Flash-Realtime モデルシリーズでのみ利用可能です。

optimize_instructions

bool

いいえ

instructions を最適化して、音声合成の自然さと表現力を向上させるかどうかを指定します。

デフォルト値: False

動作: True に設定すると、システムは instructions を意味的に拡張および書き換えて、音声合成に最適化された内部指示を生成します。

適用シナリオ:高品質かつ詳細な音声表現が求められるシナリオでこの機能を有効にしてください。

依存関係:このパラメーターは instructions パラメーターが設定されていることを前提としています。instructions が空の場合、このパラメーターは効果を持ちません。

適用範囲:この機能は Qwen3-TTS-Instruct-Flash-Realtime モデルシリーズでのみ利用可能です。

主要なインターフェイス

QwenTtsRealtime クラス

インポート: from dashscope.audio.qwen_tts_realtime import QwenTtsRealtime

メソッドシグネチャ

サーバー応答イベント (コールバック経由で配信)

説明

def connect(self) -> None

session.created

Session created

session.updated

Session configuration updated

サーバーに接続します。

    def update_session(self,
                       voice: str,
                       response_format: AudioFormat = AudioFormat.
                       PCM_24000HZ_MONO_16BIT,
                       mode: str = 'server_commit',
                       language_type : str = "Chinese",
                       **kwargs) -> None

session.updated

Session configuration updated

デフォルトのセッション構成を更新します。パラメーターの詳細については、「Request parameters」をご参照ください。

接続後、サーバーはデフォルトの入力構成と出力構成を返します。接続直後にこのメソッドを呼び出し、これらのデフォルト設定を更新します。

サーバーは session.update イベントを受信した時点でパラメーターを検証します。検証に失敗した場合はエラーを返し、成功した場合はセッション構成を更新します。

def append_text(self, text: str) -> None

None

テキストチャンクをクラウド入力バッファー (コミット前のテキストを一時的に格納する領域) に追加します。

  • server_commit モードでは、サーバーがバッファー内のテキストをいつコミットして音声合成するかを決定します。

  • commit モードでは、クライアントが commit を呼び出して音声合成をトリガーする必要があります。

def clear_appended_text(self, ) -> None

input_text_buffer.cleared

Clear text received by the server

クラウドバッファー内のテキストをすべてクリアします。

def commit(self, ) -> None

input_text_buffer.committed

Submit text and trigger speech synthesis

response.output_item.added

New output content added

response.content_part.added

New content added to assistant message

response.audio.delta

Incremental audio generated by the model

response.audio.done

Audio generation completed

response.content_part.done

Streaming of audio content for assistant message completed

response.output_item.done

Streaming of entire output item for assistant message completed

response.done

Synthesis response completed

クラウドバッファー内のテキストをすべてコミットし、直ちに音声合成します。バッファーが空の場合はエラーを返します。

  • server_commit モードでは、クライアントがこのイベントを送信する必要はありません。サーバーがバッファーを自動でコミットします。

  • commit モードでは、クライアントが commit を呼び出して音声合成をトリガーする必要があります。

def finish(self, ) -> None

session.finished

Session completed

タスクを終了します。

def close(self, ) -> None

None

接続を閉じます。

def get_session_id(self) -> str

None

現在のタスクのセッション ID を取得します。

def get_last_response_id(self) -> str

None

直近の応答の応答 ID を取得します。

def get_first_audio_delay(self)

None

最初のオーディオパケットが到着するまでの遅延を取得します。

コールバックインターフェイス (QwenTtsRealtimeCallback)

サーバーは、コールバックを通じて応答とデータを送信します。これらを処理するには、コールバックメソッドを実装します。

インポート: from dashscope.audio.qwen_tts_realtime import QwenTtsRealtimeCallback

メソッド

パラメーター

戻り値

説明

def on_open(self) -> None

None

None

サーバーへの接続が確立されたときに呼び出されます。

def on_event(self, message: str) -> None

message:サーバー応答イベント。

None

API 呼び出しの応答、モデルが生成したテキスト、オーディオが含まれます。詳細については、「Server events」をご参照ください。

def on_close(self, close_status_code, close_msg) -> None

close_status_code:WebSocket のクローズステータスコード。

close_msg:WebSocket のクローズメッセージ。

None

サーバーが接続を閉じた後に呼び出されます。