Qwen-Audio-3.1-ASR-Flash-Streamingは、リアルタイム会議、ライブ字幕、インテリジェント対話などのシナリオ向けに設計されたエンドツーエンドのリアルタイム音声認識モデルです。ストリーミング音声書き起こしにおいて低遅延かつ高精度であることが特徴です。このモデルは、多言語および多地域の中国語方言認識、中国語と英語のシームレスな切り替え、ホットワードおよびコンテキスト強化、句読点予測、テキスト正規化をサポートしています。また、強力なノイズ耐性を備えており、複雑な音響環境にも適応できます。さらに、このバージョンでは多方言に対する制御可能なASR/AST出力もサポートされています。
推論サービスプロバイダー
qwen-audio-3.1-asr-flash-streamingの推論サービスプロバイダーはAlibaba Cloud Model Studioです。
モデル機能
| 機能 | サポート | 機能 | サポート |
|---|
| 入力モダリティ | オーディオ | 出力モダリティ | テキスト |
| モデル体験 | 未サポート | Function Calling | 未サポート |
| Structured Outputs | 未サポート | Web検索 | 未サポート |
| Prefix Completion | 未サポート | コンテキストキャッシュ | 未サポート |
| バッチ推論 | 未サポート | ファインチューニング | 未サポート |
コンテキスト制限
| パラメータ | 値 | パラメータ | 値 |
|---|
| 最大入力長 | 8192トークン | 最大出力長 | 1024トークン |
| コンテキストウィンドウ | 8192トークン | | |
料金
このページには、モデルAPI呼び出しの通常料金のみが表示されており、期間限定のプロモーションは含まれていません。プロモーション情報については、Model Studio Consoleをご覧ください。
中国(北京)
| 課金項目 | 料金(USD) | 単位 |
|---|
| 入力 | 0.848 | 百万トークンあたり |
| 出力 | 0.636 | 百万トークンあたり |
Singapore
範囲:International
| 課金項目 | 料金(USD) | 単位 |
|---|
| 入力 | 0.93 | 百万トークンあたり |
| 出力 | 0.70 | 百万トークンあたり |
レート制限
中国(北京)
| パラメータ | 値 |
|---|
| RPM(1分あたりのリクエスト数) | 600 |
Singapore
範囲:International
| パラメータ | 値 |
|---|
| RPM(1分あたりのリクエスト数) | 600 |
APIの使用