このトピックでは、Qwen-Audio-3.0-ASR-Flash/Fun-ASR-Flash 非リアルタイム音声認識 HTTP API のパラメーターとインターフェイスの詳細について説明します。
ユーザーガイド: 非リアルタイム音声認識。サポートされている音声フォーマット、ファイルサイズの制限、時間の制限などの入力要件については、音声仕様をご参照ください。
サービスエンドポイント
シンガポール
POST https://{WorkspaceId}.ap-southeast-1.maas.aliyuncs.com/api/v1/services/aigc/multimodal-generation/generation
{WorkspaceId} を実際の ワークスペース ID に置き換えます。
中国 (北京)
POST https://{WorkspaceId}.cn-beijing.maas.aliyuncs.com/api/v1/services/aigc/multimodal-generation/generation
{WorkspaceId} を実際の ワークスペース ID に置き換えます。
重要Alibaba Cloud Model Studio は、中国 (北京) およびシンガポールリージョン向けにワークスペース固有のドメインをリリースしました。新しい専用ドメインは、推論リクエストに対して優れたパフォーマンスと高い安定性を提供します。新しいドメインへの移行を推奨します:
- 中国 (北京):
dashscope.aliyuncs.comから{WorkspaceId}.cn-beijing.maas.aliyuncs.comへ - シンガポール:
dashscope-intl.aliyuncs.comから{WorkspaceId}.ap-southeast-1.maas.aliyuncs.comに
{WorkspaceId} を実際のワークスペース ID に置き換えます。既存のドメインは引き続き完全に機能します。
リクエストヘッダー
パラメーター | タイプ | 必須 | 説明 |
|---|---|---|---|
Authorization | string | はい | 認証トークン。 |
Content-Type | string | はい | リクエストボディのメディアタイプ。 |
X-DashScope-SSE | string | はい | 結果が SSE ストリームとして返されるかどうかを制御します。 |
リクエストボディmodel モデル名。Qwen-Audio-3.0-ASR-Flash および Fun-ASR-Flash モデルシリーズがサポートされています。詳細については、サポートされているモデルとリージョンをご参照ください。 input 入力情報。 parameters モデルパラメーター。 | 以下の例では、シンガポールリージョンの構成を使用しています。 非ストリーミングストリーミングコンテキスト付き - 非ストリーミングコンテキスト付き - ストリーミングBase64Base64 エンコードされたデータ (データ URL) を
インラインホットワード |
レスポンスボディrequest_id このリクエストの一意の識別子。 output 出力結果。 usage 使用量情報です。 プロパティ duration 処理された音声の長さ (秒)。 | 非ストリーミングストリーミング
応答の例: |
SSE ストリーミング結果の処理ロジック
ストリーミングモードでは、クライアントは以下を処理する必要があります:
- 受信した SSE イベントごとに、
dataフィールドの JSON を解析します。 output.sentence.sentence_endを使用して、現在の文が終了したかどうかを判断します。 この値がtrueの場合、文の認識が完了し、単語レベルのタイムスタンプが安定し、結果を最終版として使用できます。 この値がfalseの場合、認識はまだ進行中であり、後続のイベントでテキストとタイムスタンプが更新される可能性があります。usage情報は文末イベントでのみ返され、この情報を使用して処理済み音声の持続時間を計測できます。