すべてのプロダクト
Search
ドキュメントセンター

Alibaba Cloud Model Studio:音声テキスト変換の概要

最終更新日:Sep 03, 2026

リアルタイムまたはファイルベースの音声認識に適したモデルを選択します。

クローズドソースモデルからの移行

現在ご利用の Whisper、Deepgram、または Google ASR サービスを、同等の Bailian サービスにマッピングします。

ユースケース

クローズドソースの例

Bailian の推奨

リアルタイム認識

Deepgram Nova-3, Google Chirp 3

qwen-audio-3.0-asr-flash-streaming

オフライン / ファイル文字起こし

OpenAI gpt-4o-transcribe, Whisper

qwen-audio-3.0-asr-flash-filetrans, qwen-audio-3.0-asr-flash

選択基準」 (リアルタイム vs オフライン、ドメイン専門用語、話者分離、感情認識) の 4 つの基準を使用して、適切なモデルを特定します。次に、「推奨モデル」でシナリオごとのおすすめモデルを、「すべてのモデル」でモデルファミリーごとの完全なバージョンリストを、「音声仕様」で入力制約を確認します。サポートされている言語 (方言を含む) は、「すべてのモデル」の各モデルファミリーの下にリストされています。

選択基準

4 つのディメンションを評価して、適切なモデルを見つけます。

リアルタイムまたはオフライン

リアルタイム認識は、ユーザーが話している間に結果を返します。オフライン認識は、録音が終了した後に、事前に録音されたファイルを文字起こしします。

  • リアルタイム (ストリーミング認識): WebSocket 接続を使用して、音声を入力し、テキストを出力します。ライブキャプション、音声アシスタント、会議の文字起こしに最適です。推奨モデル: qwen-audio-3.0-asr-flash-streaming (ホットワード、プロンプトコンテキスト、多言語 (方言対応))。
  • オフライン (ファイル文字起こし): HTTP API を使用して音声ファイルを送信し、文字起こし結果を取得します。コールセンターの録音、ポッドキャスト、インタビューに適しています。推奨モデル: qwen-audio-3.0-asr-flash-filetrans (ホットワード、プロンプトコンテキスト、話者分離)。

Qwen-Audio-3.0-ASR-Flash-Streaming および Fun-ASR-Realtime シリーズのモデルは、AOQ プロトコルもサポートしています。プロトコルの比較については、「リアルタイム API の概要」をご参照ください。

Qwen-Audio-3.0-ASR-Flash-Streaming、Qwen-Audio-3.0-ASR-Flash-Filetrans、および Fun-ASR と Qwen-ASR のリアルタイムモデルは、DashScope SDK (Java、Python) をサポートしています。 その他のすべてのモデルでは、直接的な WebSocket または HTTP API 呼び出しが必要です。

リアルタイム統合については、「リアルタイム音声認識」をご参照ください。オフライン統合については、「非リアルタイム音声認識」をご参照ください。

ドメイン専門用語

柔軟性の高い順に 2 つのアプローチがあります:

  1. プロンプトコンテキストインジェクション: システムプロンプトでドメインを記述します。セットアップは不要で、モデルはリクエストごとに適応します。推奨: Qwen-Audio-3.0-ASR-Flash-Streaming、Qwen-Audio-3.0-ASR-Flash-Filetrans、および Qwen-Audio-3.0-ASR-Flash シリーズ。
  2. ホットワード: 重み付けされた語彙リストを提供します。推奨: Qwen-Audio-3.0-ASR-Flash-Streaming、Qwen-Audio-3.0-ASR-Flash-Filetrans、および Qwen-Audio-3.0-ASR-Flash シリーズ。

話者分離

Qwen-Audio-3.0-ASR-Flash-Filetrans シリーズ (qwen-audio-3.0-asr-flash-filetrans) および Fun-ASR オフラインモデル (fun-asr および fun-asr-mtl) は話者分離をサポートしています。誰が何を言ったかを特定するには、qwen-audio-3.0-asr-flash-filetrans を使用します。

感情認識

Qwen-ASR モデルは、文字起こしと同時に感情を検出します。推奨モデル: qwen3-asr-flash-realtime (リアルタイム) または qwen3-asr-flash-filetrans (オフライン)。

推奨モデル

一般的なシナリオ向けの推奨モデルです。

モデル ID

モード

API

精度向上

感情認識

話者分離

言語

最大音声時間/サイズ

qwen-audio-3.0-asr-flash-streaming

リアルタイム

WebSocket

ホットワード、プロンプトコンテキスト

非対応

非対応

多言語 (方言対応)

無制限

qwen-audio-3.0-asr-flash-filetrans

オフライン

HTTP

ホットワード、プロンプトコンテキスト

非対応

対応

多言語 (方言対応)

12 時間 / 2 GB

すべてのモデル

Qwen-Audio-3.0-ASR-Flash-Streaming

モデル ID

モード

API

精度向上

感情認識

話者分離

言語

最大音声時間/サイズ

qwen-audio-3.0-asr-flash-streaming

リアルタイム

WebSocket

ホットワード、プロンプトコンテキスト

非対応

非対応

多言語 (方言対応)

無制限

サポート言語 (バージョン別)

  • qwen-audio-3.0-asr-flash-streaming: 中国語 (標準語、広東語、呉語、閩南語、客家語、贛語、湘語、晋語、および中原、西南、冀魯、江淮、蘭銀、膠遼、東北、北京、香港/台湾などの地域アクセントを含む — 河南、陝西、湖北、四川、重慶、雲南、貴州、広東、広西、河北、天津、山東、安徽、南京、江蘇、杭州、甘粛、寧夏のアクセントをカバー)、英語、日本語、韓国語、ベトナム語、タイ語、インドネシア語、マレー語、フィリピン語、ヒンディー語、アラビア語、フランス語、ドイツ語、スペイン語、ポルトガル語、ロシア語、イタリア語、オランダ語、スウェーデン語、デンマーク語、フィンランド語、ノルウェー語、ギリシャ語、ポーランド語、チェコ語、ハンガリー語、ルーマニア語、ブルガリア語、クロアチア語、スロバキア語

Qwen-Audio-3.0-ASR-Flash-Filetrans

モデル ID

モード

API

精度向上

感情認識

話者分離

言語

最大音声時間/サイズ

qwen-audio-3.0-asr-flash-filetrans

オフライン

HTTP

ホットワード、プロンプトコンテキスト

非対応

対応

多言語 (方言対応)

12 時間 / 2 GB

サポート言語 (バージョン別)

  • qwen-audio-3.0-asr-flash-filetrans: 中国語 (標準語、広東語、呉語、閩南語、客家語、贛語、湘語、晋語、および中原、西南、冀魯、江淮、蘭銀、膠遼、東北、北京、香港/台湾などの地域アクセントを含む — 河南、陝西、湖北、四川、重慶、雲南、貴州、広東、広西、河北、天津、山東、安徽、南京、江蘇、杭州、甘粛、寧夏のアクセントをカバー)、英語、日本語、韓国語、ベトナム語、タイ語、インドネシア語、マレー語、フィリピン語、ヒンディー語、アラビア語、フランス語、ドイツ語、スペイン語、ポルトガル語、ロシア語、イタリア語、オランダ語、スウェーデン語、デンマーク語、フィンランド語、ノルウェー語、ギリシャ語、ポーランド語、チェコ語、ハンガリー語、ルーマニア語、ブルガリア語、クロアチア語、スロバキア語

Qwen-Audio-3.0-ASR-Flash

モデル ID

モード

API

精度向上

感情認識

話者分離

言語

最大音声時間/サイズ

qwen-audio-3.0-asr-flash

オフライン

HTTP

ホットワード、プロンプトコンテキスト

非対応

非対応

多言語 (方言対応)

5 分 / 2 GB

サポート言語 (バージョン別)

  • qwen-audio-3.0-asr-flash: 中国語 (標準語、広東語、呉語、閩南語、客家語、贛語、湘語、晋語、および中原、西南、冀魯、江淮、蘭銀、膠遼、東北、北京、香港/台湾などの地域アクセントを含む — 河南、陝西、湖北、四川、重慶、雲南、貴州、広東、広西、河北、天津、山東、安徽、南京、江蘇、杭州、甘粛、寧夏のアクセントをカバー)、英語、日本語、韓国語、ベトナム語、タイ語、インドネシア語、マレー語、フィリピン語、ヒンディー語、アラビア語、フランス語、ドイツ語、スペイン語、ポルトガル語、ロシア語、イタリア語、オランダ語、スウェーデン語、デンマーク語、フィンランド語、ノルウェー語、ギリシャ語、ポーランド語、チェコ語、ハンガリー語、ルーマニア語、ブルガリア語、クロアチア語、スロバキア語

Fun-ASR

モデル ID

モード

API

精度向上

感情認識

話者分離

言語

最大音声時間/サイズ

fun-asr-realtime

リアルタイム

WebSocket

ホットワード

非対応

非対応

中国語、英語、日本語、および方言

無制限

fun-asr-realtime-2026-02-28

リアルタイム

WebSocket

ホットワード

非対応

非対応

中国語、英語、日本語、および方言

無制限

fun-asr-realtime-2025-11-07

リアルタイム

WebSocket

ホットワード

非対応

非対応

中国語、英語、日本語、および方言

無制限

fun-asr-realtime-2025-09-15

リアルタイム

WebSocket

ホットワード

非対応

非対応

中国語、英語

無制限

fun-asr-flash-8k-realtime

リアルタイム

WebSocket

ホットワード

非対応

非対応

中国語

無制限

fun-asr-flash-8k-realtime-2026-01-28

リアルタイム

WebSocket

ホットワード

非対応

非対応

中国語

無制限

fun-asr

オフライン

HTTP

ホットワード

非対応

対応

多言語 (方言対応)

12 時間 / 2 GB

fun-asr-flash-2026-06-15

オフライン

HTTP

プロンプトコンテキスト

非対応

非対応

多言語 (方言対応)

5 分 / 2 GB

fun-asr-2025-11-07

オフライン

HTTP

ホットワード

非対応

対応

多言語 (方言対応)

12 時間 / 2 GB

fun-asr-2025-08-25

オフライン

HTTP

ホットワード

非対応

対応

中国語、英語

12 時間 / 2 GB

fun-asr-mtl

オフライン

HTTP

ホットワード

非対応

対応

多言語 (方言対応)

12 時間 / 2 GB

fun-asr-mtl-2025-08-25

オフライン

HTTP

ホットワード

非対応

対応

多言語 (方言対応)

12 時間 / 2 GB

サポート言語 (バージョン別)

  • Fun-ASR-Realtime のメインバージョン (fun-asr-realtimefun-asr-realtime-2026-02-28fun-asr-realtime-2025-11-07): 中国語 (標準語、広東語、呉語、閩南語、客家語、贛語、湘語、晋語、および中原、西南、冀魯、江淮、蘭銀、膠遼、東北、北京、香港/台湾などの地域アクセントを含む — 河南、陝西、湖北、四川、重慶、雲南、貴州、広東、広西、河北、天津、山東、安徽、南京、江蘇、杭州、甘粛、寧夏のアクセントをカバー)、英語、日本語
  • fun-asr-realtime-2025-09-15: 中国語 (標準語)、英語
  • Fun-ASR-Flash-Realtime(8K) (fun-asr-flash-8k-realtimefun-asr-flash-8k-realtime-2026-01-28): 中国語
  • Fun-ASR のメインバージョン (fun-asrfun-asr-2025-11-07): 中国語 (標準語、広東語、呉語、閩南語、客家語、贛語、湘語、晋語、および中原、西南、冀魯、江淮、蘭銀、膠遼、東北、北京、香港/台湾などの地域アクセントを含む — 河南、陝西、湖北、四川、重慶、雲南、貴州、広東、広西、河北、天津、山東、安徽、南京、江蘇、杭州、甘粛、寧夏のアクセントをカバー)、英語、日本語、韓国語、ベトナム語、タイ語、インドネシア語、マレー語、フィリピン語、ヒンディー語、アラビア語、フランス語、ドイツ語、スペイン語、ポルトガル語、ロシア語、イタリア語、オランダ語、スウェーデン語、デンマーク語、フィンランド語、ノルウェー語、ギリシャ語、ポーランド語、チェコ語、ハンガリー語、ルーマニア語、ブルガリア語、クロアチア語、スロバキア語
  • Fun-ASR-Flash (fun-asr-flash-2026-06-15): 中国語 (標準語、広東語、呉語、閩南語、客家語、贛語、湘語、晋語、および中原、西南、冀魯、江淮、蘭銀、膠遼、東北、北京、香港/台湾などの地域アクセントを含む — 河南、陝西、湖北、四川、重慶、雲南、貴州、広東、広西、河北、天津、山東、安徽、南京、江蘇、杭州、甘粛、寧夏のアクセントをカバー)、英語、日本語、韓国語、ベトナム語、タイ語、インドネシア語、マレー語、フィリピン語、ヒンディー語、アラビア語、フランス語、ドイツ語、スペイン語、ポルトガル語、ロシア語、イタリア語、オランダ語、スウェーデン語、デンマーク語、フィンランド語、ノルウェー語、ギリシャ語、ポーランド語、チェコ語、ハンガリー語、ルーマニア語、ブルガリア語、クロアチア語、スロバキア語
  • fun-asr-2025-08-25: 中国語 (標準語)、英語
  • Fun-ASR(MTL) (fun-asr-mtlfun-asr-mtl-2025-08-25): 中国語 (標準語、広東語)、英語、日本語、韓国語、ベトナム語、タイ語、インドネシア語、マレー語、フィリピン語、ヒンディー語、アラビア語、フランス語、ドイツ語、スペイン語、ポルトガル語、ロシア語、イタリア語、オランダ語、スウェーデン語、デンマーク語、フィンランド語、ノルウェー語、ギリシャ語、ポーランド語、チェコ語、ハンガリー語、ルーマニア語、ブルガリア語、クロアチア語、スロバキア語

Qwen-ASR

モデル ID

モード

API

精度向上

感情認識

話者分離

言語

最大音声時間/サイズ

qwen3-asr-flash-realtime

リアルタイム

WebSocket

非対応

対応

非対応

多言語 (方言対応)

無制限

qwen3-asr-flash-realtime-2026-02-10

リアルタイム

WebSocket

非対応

対応

非対応

多言語 (方言対応)

無制限

qwen3-asr-flash-realtime-2025-10-27

リアルタイム

WebSocket

非対応

対応

非対応

多言語 (方言対応)

無制限

qwen3-asr-flash-filetrans

オフライン

HTTP

非対応

対応

非対応

多言語 (方言対応)

12 時間 / 2 GB

qwen3-asr-flash-filetrans-2025-11-17

オフライン

HTTP

非対応

対応

非対応

多言語 (方言対応)

12 時間 / 2 GB

qwen3-asr-flash

オフライン

HTTP (OpenAI 互換)

非対応

対応

非対応

多言語 (方言対応)

5 分 / 10 MB

qwen3-asr-flash-2026-02-10

オフライン

HTTP (OpenAI 互換)

非対応

対応

非対応

多言語 (方言対応)

5 分 / 10 MB

qwen3-asr-flash-2025-09-08

オフライン

HTTP (OpenAI 互換)

非対応

対応

非対応

多言語 (方言対応)

5 分 / 10 MB

サポート言語: すべての Qwen-ASR モデル (qwen3-asr-flash-realtimeqwen3-asr-flash-filetransqwen3-asr-flash、およびそれらのスナップショットバージョン) は同じ言語リストを共有します: 中国語 (標準語、四川語、閩南語、呉語、広東語)、英語、日本語、ドイツ語、韓国語、ロシア語、フランス語、ポルトガル語、アラビア語、イタリア語、スペイン語、ヒンディー語、インドネシア語、タイ語、トルコ語、ウクライナ語、ベトナム語、チェコ語、デンマーク語、フィリピン語、フィンランド語、アイスランド語、マレー語、ノルウェー語、ポーランド語、スウェーデン語。

Paraformer

Paraformer は旧世代の ASR モデルファミリーです。可能な場合は Fun-ASR または Qwen-ASR への移行を推奨します。

モデル ID

API

説明

paraformer-realtime-v2

WebSocket

リアルタイム認識。中国語、英語、日本語、韓国語、ドイツ語、フランス語、ロシア語

paraformer-realtime-v1

WebSocket

リアルタイム認識。中国語、英語、日本語、韓国語、ドイツ語、フランス語、ロシア語

paraformer-realtime-8k-v2

WebSocket

8 kHz テレフォニー向けのリアルタイム認識。中国語

paraformer-realtime-8k-v1

WebSocket

8 kHz テレフォニー向けのリアルタイム認識。中国語

paraformer-v2

HTTP

話者分離付きファイル文字起こし。中国語、英語、日本語、韓国語、ドイツ語、フランス語、ロシア語

paraformer-8k-v2

HTTP

8 kHz テレフォニー向けのファイル文字起こし。中国語

サポート言語 (バージョン別)

  • paraformer-realtime-v2paraformer-v2: 中国語 (標準語、広東語、呉語、閩南語、東北、甘粛、貴州、河南、湖北、湖南、寧夏、山西、陝西、山東、四川、天津、江西、雲南、上海)、英語、日本語、韓国語、ドイツ語、フランス語、ロシア語
  • paraformer-realtime-v1paraformer-realtime-8k-v2paraformer-realtime-8k-v1paraformer-8k-v2: 中国語 (標準語)

音声仕様

リアルタイムおよびオフラインモードの音声仕様です。サポートされている言語については、「すべてのモデル」のモデルファミリーのサブセクションをご参照ください。

リアルタイム

モデル ID

入力メソッド

音声フォーマット

サンプルレート

サイズ/時間

Qwen-Audio-3.0-ASR-Flash-Streaming (qwen-audio-3.0-asr-flash-streaming シリーズ)

バイナリストリーム

pcmwavmp3opusspeexaacamr

任意

無制限

Fun-ASR-Realtime / Fun-ASR-MTL-Realtime (fun-asr-realtimefun-asr-mtl-realtime シリーズ)

バイナリストリーム

pcmwavmp3opusspeexaacamr

任意

無制限

Fun-ASR-Flash-8K-Realtime (fun-asr-flash-8k-realtime シリーズ)

バイナリストリーム

Fun-ASR-Realtime と同じ

8 kHz

無制限

Qwen-ASR-Realtime (qwen3-asr-flash-realtime シリーズ)

バイナリストリーム

pcmopus

8 kHz、16 kHz

無制限

Paraformer-Realtime (paraformer-realtime-v2/v1paraformer-realtime-8k-v2/v1)

バイナリストリーム

Fun-ASR-Realtime と同じ

paraformer-realtime-v2 は任意レート、paraformer-realtime-v1 は 16 kHz、paraformer-realtime-8k-* は 8 kHz

無制限

すべてのリアルタイムモデルは、モノラル (シングルチャンネル) 入力のみを受け付けます。

オフライン

モデル ID

入力メソッド

音声フォーマット

サンプルレート

ファイルサイズ/時間

Qwen-Audio-3.0-ASR-Flash-Filetrans (qwen-audio-3.0-asr-flash-filetrans シリーズ)

一般公開されているファイル URL。リクエストごとに 1 URL

aacamraviflacflvm4amkvmovmp3mp4mpegoggopuswavwebmwmawmv

任意

2 GB 以下、12 時間以下 (話者分離を有効にする場合は 2 時間以下を推奨)

Qwen-Audio-3.0-ASR-Flash (qwen-audio-3.0-asr-flash シリーズ)

URL / Base64。リクエストごとに 1 ファイル

aacamraviflacflvm4amkvmovmp3mp4mpegoggopuswavwebmwmawmv

任意

2 GB 以下、5 分以下

Fun-ASR (fun-asrfun-asr-mtl シリーズ)

一般公開されているファイル URL。リクエストごとに 1 URL

aacamraviflacflvm4amkvmovmp3mp4mpegoggopuswavwebmwmawmv

任意

2 GB 以下、12 時間以下 (話者分離を有効にする場合は 2 時間以下を推奨)

Fun-ASR-Flash (fun-asr-flash-2026-06-15)

URL / Base64。リクエストごとに 1 ファイル

aacamraviflacflvm4amkvmovmp3mp4mpegoggopuswavwebmwmawmv

任意

2 GB 以下、5 分以下

Paraformer (paraformer-v2/v1paraformer-mtl-v1paraformer-8k-v2/v1)

Fun-ASR と同じ

Fun-ASR と同じ

paraformer-v2 は任意レート、paraformer-8k-* は 8 kHz のみ

Fun-ASR と同じ

Qwen3-ASR-Flash-Filetrans (qwen3-asr-flash-filetrans シリーズ)

一般公開されているファイル URL。リクエストごとに 1 URL

aacamraviflacflvm4amkvmovmp3mp4mpegoggopuswavwebmwmawmv

pcm は 16 kHz が必須です。他のフォーマットは任意のレートを受け付けます (サーバーは認識前に 16 kHz にリサンプリングします)

2 GB 以下、12 時間以下

Qwen3-ASR-Flash (qwen3-asr-flash シリーズ)

URL / Base64 / ローカルファイルの絶対パス。リクエストごとに 1 ファイル

aacamraviaiffflacflvmkvmp3mpegoggopuswavwebmwmawmv

pcm は 16 kHz が必須です。他のフォーマットは任意のレートを受け付けます (サーバーは認識前に 16 kHz にリサンプリングします)

10 MB 以下、5 分以下