Qwen-Audio-3.1-ASR-Flashは、高品質で多言語・多文化なコンテンツの文字起こしシナリオ向けに設計された、効率的な短時間音声認識をサポートする大規模モデルです。このモデルは、多言語および中国各地の方言認識に対応しており、中国古典詩のリズム、韻律、文言表現に最適化されています。コンテキスト強化、句読点予測、テキスト正規化機能を備えています。また、このバージョンでは複数の方言に対する制御可能なASR/AST出力もサポートしています。ネイティブな文字起こしと推敲機能に加え、産業グレードの複数話者ダイアログにおける話者識別付き文字起こし機能も搭載しています。
推論サービスプロバイダー
qwen-audio-3.1-asr-flashの推論サービスプロバイダーはAlibaba Cloud Model Studioです。
モデル機能
| 機能 | サポート | 機能 | サポート |
|---|
| 入力モダリティ | オーディオ | 出力モダリティ | テキスト |
| モデル体験 | 未サポート | Function Calling | 未サポート |
| Structured Outputs | 未サポート | Web検索 | 未サポート |
| Prefix Completion | 未サポート | コンテキストキャッシュ | 未サポート |
| バッチ推論 | 未サポート | ファインチューニング | 未サポート |
コンテキスト制限
| パラメータ | 値 | パラメータ | 値 |
|---|
| 最大入力長 | 7168トークン | 最大出力長 | 1024トークン |
| コンテキストウィンドウ | 8192トークン | | |
料金
このページには、モデルAPI呼び出しの通常料金のみが表示されており、期間限定のプロモーションは含まれていません。プロモーション情報については、Model Studio Consoleをご覧ください。
中国(北京)
| 課金項目 | 料金(USD) | 単位 |
|---|
| 入力 | 0.113 | 百万トークンあたり |
| 出力 | 0.382 | 百万トークンあたり |
Singapore
範囲:International
| 課金項目 | 料金(USD) | 単位 |
|---|
| 入力 | 0.15 | 百万トークンあたり |
| 出力 | 0.47 | 百万トークンあたり |
レート制限
中国(北京)
| パラメータ | 値 |
|---|
| RPM(1分あたりのリクエスト数) | 600 |
Singapore
範囲:International
| パラメータ | 値 |
|---|
| RPM(1分あたりのリクエスト数) | 600 |
APIの使用