すべてのプロダクト
Search
ドキュメントセンター

Alibaba Cloud Model Studio:音声テキスト変換

最終更新日:May 08, 2026

リアルタイム音声認識、音声ファイルの文字起こしなど、さまざまな音声テキスト変換のシナリオに適したモデルを選択します。

リアルタイムか非リアルタイムか

リアルタイム認識は、話者が話している最中に結果を出力します。非リアルタイム認識は、録音が完了した後に音声を文字起こしします。

  • リアルタイム(リアルタイム音声認識):WebSocket プロトコルを使用して、音声入力をストリーミングし、テキスト出力をストリーミングします。ライブ字幕、音声アシスタント、会議の文字起こしなどに適しています。fun-asr-realtime(ホットワード、方言対応)または qwen3.5-omni-plus-realtime(プロンプトコンテキスト、多言語対応)をご利用ください。

  • 非リアルタイム(音声ファイルの文字起こし):HTTP プロトコルを使用して音声ファイルを送信し、文字起こし結果を取得します。コンタクトセンターの録音、ポッドキャスト、インタビューなどに適しています。fun-asr(ホットワード、話者分離)または qwen3.5-omni-plus(プロンプトコンテキスト、多言語対応)をご利用ください。

Fun-ASR および Qwen3-ASR のリアルタイムモデルは、DashScope SDK(Java、Python)をサポートしています。 その他のモデルは、それぞれのプロトコルに基づき、直接 WebSocket または HTTP 呼び出しを行う必要があります。

リアルタイムでのご利用については、「リアルタイム音声認識」をご参照ください。非リアルタイムでのご利用については、「音声ファイルの文字起こし」をご参照ください。

ドメイン固有の用語の処理

以下の 2 つのアプローチが利用可能で、柔軟性の高い順に記載されています。

  1. プロンプトコンテキストの注入:システムプロンプトでドメインを記述します。事前の構成は不要で、各リクエストごとにモデルが適応します。ただし、専用 ASR モデルと比べてリクエストあたりの遅延が大きくなるというトレードオフがあります。qwen3.5-omni-plus-realtime(リアルタイム)または qwen3.5-omni-plus(非リアルタイム)をご利用ください。

  2. ホットワード(カスタム語彙):重み付きの語彙リストを提供します。頻繁に変更されない安定した用語に最適です。fun-asr-realtime(リアルタイム)または fun-asr(非リアルタイム)をご利用ください。

説明

Qwen3.5-Omni は従来型の ASR エンジンではなく、音声を理解できる大規模言語モデルです。システムプロンプトを通じてコンテキストを注入することで、ホットワードリストなしにモデルが適応します。

話者分離

話者分離をサポートするのは、非リアルタイムの Fun-ASR モデル(fun-asrfun-asr-mtl)のみです。「誰が何を言ったか」を識別する必要がある場合は、これらのモデルをご利用ください。

感情認識

Qwen3-ASR および Qwen3.5-Omni モデルは、文字起こしと同時に感情を認識できます。qwen3-asr-flash-realtime(リアルタイム)または qwen3-asr-flash-filetrans(非リアルタイム)をご利用ください。

推奨モデル

以下の表は、各シナリオに推奨されるモデルを示しています。詳細については、モデルギャラリーをご参照ください。

モデル

モード

API

精度向上機能

感情認識

話者分離

サポート言語

最大音声持続時間/サイズ

fun-asr-realtime

リアルタイム

WebSocket

ホットワード

未対応

未対応

中国語、英語、日本語、および方言

無制限

fun-asr

非リアルタイム

HTTP

ホットワード

未対応

対応

多言語および方言

12 時間 / 2 GB

qwen3.5-omni-plus-realtime

リアルタイム

WebSocket

プロンプトコンテキスト

対応

未対応

多言語

2 時間

qwen3.5-omni-plus

非リアルタイム

HTTP(OpenAI 互換)

プロンプトコンテキスト

対応

未対応

多言語

3 時間 / 2 GB

すべてのモデル

Fun-ASR

モデル

モード

API

精度向上機能

感情認識

話者分離

サポート言語

最大音声持続時間/サイズ

fun-asr-realtime

リアルタイム

WebSocket

ホットワード

未対応

未対応

中国語、英語、日本語、および方言

無制限

fun-asr-realtime-2026-02-28

リアルタイム

WebSocket

ホットワード

未対応

未対応

中国語、英語、日本語、および方言

無制限

fun-asr-realtime-2025-11-07

リアルタイム

WebSocket

ホットワード

未対応

未対応

中国語、英語、日本語、および方言

無制限

fun-asr-realtime-2025-09-15

リアルタイム

WebSocket

ホットワード

未対応

未対応

中国語、英語

無制限

fun-asr-flash-8k-realtime

リアルタイム

WebSocket

ホットワード

未対応

未対応

中国語

無制限

fun-asr-flash-8k-realtime-2026-01-28

リアルタイム

WebSocket

ホットワード

未対応

未対応

中国語

無制限

fun-asr

非リアルタイム

HTTP

ホットワード

未対応

対応

多言語および方言

12 時間 / 2 GB

fun-asr-2025-11-07

非リアルタイム

HTTP

ホットワード

未対応

対応

多言語および方言

12 時間 / 2 GB

fun-asr-2025-08-25

非リアルタイム

HTTP

ホットワード

未対応

対応

中国語、英語

12 時間 / 2 GB

fun-asr-mtl

非リアルタイム

HTTP

ホットワード

未対応

対応

多言語および方言

12 時間 / 2 GB

fun-asr-mtl-2025-08-25

非リアルタイム

HTTP

ホットワード

未対応

対応

多言語および方言

12 時間 / 2 GB

Qwen3-ASR

モデル

モード

API

精度向上機能

感情認識

話者分離

サポート言語

最大音声持続時間/サイズ

qwen3-asr-flash-realtime

リアルタイム

WebSocket

未対応

対応

未対応

多言語および方言

無制限

qwen3-asr-flash-realtime-2026-02-10

リアルタイム

WebSocket

未対応

対応

未対応

多言語および方言

無制限

qwen3-asr-flash-realtime-2025-10-27

リアルタイム

WebSocket

未対応

対応

未対応

多言語および方言

無制限

qwen3-asr-flash-filetrans

非リアルタイム

HTTP

未対応

対応

未対応

多言語および方言

12 時間 / 2 GB

qwen3-asr-flash-filetrans-2025-11-17

非リアルタイム

HTTP

未対応

対応

未対応

多言語および方言

12 時間 / 2 GB

qwen3-asr-flash

非リアルタイム

HTTP(OpenAI 互換)

未対応

対応

未対応

多言語および方言

5 分 / 10 MB

qwen3-asr-flash-2026-02-10

非リアルタイム

HTTP(OpenAI 互換)

未対応

対応

未対応

多言語および方言

5 分 / 10 MB

qwen3-asr-flash-2025-09-08

非リアルタイム

HTTP(OpenAI 互換)

未対応

対応

未対応

多言語および方言

5 分 / 10 MB

Qwen3.5-Omni / Qwen3-Omni

モデル

モード

API

精度向上機能

感情認識

話者分離

サポート言語

最大音声持続時間/サイズ

qwen3.5-omni-plus-realtime

リアルタイム

WebSocket

プロンプトコンテキスト

対応

未対応

多言語

2 時間

qwen3.5-omni-plus

非リアルタイム

HTTP(OpenAI 互換)

プロンプトコンテキスト

対応

未対応

多言語

3 時間 / 2 GB

qwen3.5-omni-flash-realtime

リアルタイム

WebSocket

プロンプトコンテキスト

対応

未対応

多言語

2 時間

qwen3.5-omni-flash

非リアルタイム

HTTP(OpenAI 互換)

プロンプトコンテキスト

対応

未対応

多言語

3 時間 / 2 GB

qwen3-omni-flash-realtime

リアルタイム

WebSocket

プロンプトコンテキスト

対応

未対応

多言語および方言

2 時間

qwen3-omni-flash

非リアルタイム

HTTP(OpenAI 互換)

プロンプトコンテキスト

対応

未対応

多言語および方言

20 分 / 100 MB

レガシモデル

以下はレガシ ASR モデルです。ワークロードが許す場合は、上記の推奨モデルへの移行を推奨します。

モデル

API

説明

paraformer-realtime-v2

WebSocket

リアルタイム認識、中国語、英語、日本語、韓国語、ドイツ語、フランス語、ロシア語対応

paraformer-realtime-v1

WebSocket

リアルタイム認識、中国語、英語、日本語、韓国語、ドイツ語、フランス語、ロシア語対応

paraformer-realtime-8k-v2

WebSocket

リアルタイム認識、8 kHz テレフォニー、中国語対応

paraformer-realtime-8k-v1

WebSocket

リアルタイム認識、8 kHz テレフォニー、中国語対応

paraformer-v2

HTTP

話者分離付き音声ファイルの文字起こし、中国語、英語、日本語、韓国語、ドイツ語、フランス語、ロシア語対応

paraformer-8k-v2

HTTP

音声ファイルの文字起こし、8 kHz テレフォニー、中国語対応

説明

すべてのモデルは、WAV、MP3、AAC などの一般的な音声フォーマットをサポートしています。