Qwen-Audio-3.1-ASR-Flash-Messageは、ボイスメッセージ、音声入力、企業向けシナリオに最適化された生成型音声認識モデルです。中国語、英語などの言語をサポートし、インドネシア語、日本語、タイ語、フィリピン語、ベトナム語、韓国語、マレー語に対して最適化されています。このモデルは、増分ストリーミング書き起こし、P0/P1ホットワード、テキスト正規化、先行する転写テキストやビジネスコンテキストに基づく認識、オプションのネイティブテキスト推敲をサポートしています。複数の話者、背景会話、遠距離オーディオ、環境ノイズがある状況での認識安定性を向上させます。自動言語検出またはターゲット言語の指定をサポートしており、中国語方言を話し言葉のまま書き起こしたり、標準的な普通話テキストに変換したりできます。
推論サービスプロバイダー
qwen-audio-3.1-asr-flash-messageの推論サービスプロバイダーはAlibaba Cloud Model Studioです。
モデル機能
| 機能 | サポート | 機能 | サポート |
|---|
| 入力モダリティ | オーディオ | 出力モダリティ | テキスト |
| モデル体験 | 未サポート | Function Calling | 未サポート |
| Structured Outputs | サポート済み | Web検索 | 未サポート |
| Prefix Completion | 未サポート | コンテキストキャッシュ | 未サポート |
| バッチ推論 | 未サポート | ファインチューニング | 未サポート |
コンテキスト制限
| パラメータ | 値 | パラメータ | 値 |
|---|
| 最大入力長 | 7168トークン | 最大出力長 | 1024トークン |
| コンテキストウィンドウ | 8192トークン | | |
料金
このページには、モデルAPI呼び出しの通常料金のみが表示されており、期間限定のプロモーションは含まれていません。プロモーション情報については、Model Studio Consoleをご覧ください。
中国(北京)
| 課金項目 | 料金(USD) | 単位 |
|---|
| 入力 | 0.848 | 百万トークンあたり |
| 出力 | 0.636 | 百万トークンあたり |
Singapore
範囲:International
| 課金項目 | 料金(USD) | 単位 |
|---|
| 入力 | 0.93 | 百万トークンあたり |
| 出力 | 0.70 | 百万トークンあたり |
レート制限
中国(北京)
| パラメータ | 値 |
|---|
| RPM(1分あたりのリクエスト数) | 1200 |
Singapore
範囲:International
| パラメータ | 値 |
|---|
| RPM(1分あたりのリクエスト数) | 1200 |
APIの使用