keep_dialect boolean (オプション)
デフォルトは false で、方言を標準中国語に変換します。true に設定すると、方言表現を保持します。
vad_model string (オプション)
VAD モデル。near_meeting_16k(近距離)または far_field_meeting_16k(遠距離、デフォルト)を指定します。
disfluency_removal_enabled boolean (オプション)
つなぎ言葉を除去し、出力を整えるかどうか。デフォルトは false。有効にするには true に設定します。
intermediate_result_enabled boolean (オプション)
ストリーミング中間結果を返すかどうか。デフォルトは false。中間結果を返すには true に設定します。
formatstring(必須)
音声フォーマット。
有効値:
pcm
wav
mp3
opus
speex
aac
amr
重要opus/speex:Ogg カプセル化を使用する必要があります。
wav:PCM エンコーディングを使用する必要があります。
amr:AMR-NB タイプのみがサポートされています。
sample_rateinteger(必須)
サンプリングレート(Hz)。16000 のみをサポートします。
vocabulary_idstring(任意)
プリコンパイルされたホットワードリストの ID。
この ID は、ホットワードリスト作成 API を呼び出して事前に生成します。認識時に ID を渡すことで、リスト内のホットワードを使用できます。
語彙が既知で比較的に安定しており、リクエスト間で同じ単語リストを再利用する必要があるシナリオに適しています。
使用方法の詳細については、「プリコンパイルされたホットワード」をご参照ください。
vocabularyobject(任意)
動的ホットワード。
キーと値のペアとして渡されます。キーはホットワードのテキスト (string)、値はホットワードの重み (integer) です。事前にホットワードリストを作成する必要はありません。重みの範囲は [1, 5] または 50 に設定します。値が [1, 5] の範囲では、値が大きいほどモデルがその単語を出力する可能性が高くなります。値が 50 の場合はスーパーホットワードを指定し、再現率が大幅に向上しますが、スーパーホットワードの数は 50 を超えることはできません。
一時的なセッションレベルのホットワード最適化に適しています。
プリコンパイルされたホットワードと一緒に設定された場合、動的ホットワードのみが有効になります。使用方法の詳細については、「動的ホットワード」をご参照ください。
重要qwen-audio-3.1-asr-flash-message のみが動的ホットワードをサポートしています。
max_sentence_silenceinteger(任意)
VAD の文分割の無音しきい値(ミリ秒)。発話後の無音時間がこの値を超えると、文の終了と判断します。デフォルト:1300。有効範囲:[200, 6000]。
heartbeatboolean(任意)
ハートビートパケットを有効にするかどうか。
デフォルト値:false。
- true:無音音声を継続的に送信しても、サーバーへの接続を維持します。
- false (デフォルト):無音音声を継続的に送信しても、60 秒後にタイムアウトにより接続が切断されます。
無音音声とは、音声ファイルまたはデータストリーム内の音声信号を含まないコンテンツを指します。無音音声は、Audacity や Adobe Audition などの音声編集ソフトウェアを使用したり、FFmpeg などのコマンドラインツールを使用したりするなど、いくつかの方法で生成できます。
speech_noise_thresholdfloat(任意)
音声とノイズを区別するためのしきい値で、音声アクティビティ検出 (VAD) の感度を調整するために使用されます。
有効値:[-1.0, 1.0]。
値の説明:
- 値が -1 に近いほど:ノイズのしきい値が下がり、ノイズが音声として認識されやすくなるため、より多くのノイズが書き起こされる可能性があります。
- 値が +1 に近いほど:ノイズのしきい値が上がり、音声がノイズとして誤って判断されやすくなるため、一部の音声がフィルタリングされる可能性があります。
これは詳細設定パラメーターです。調整すると認識結果に大きな影響を与える可能性があります。推奨事項:
- 調整する前に、結果を十分にテストし、検証してください。
- 実際の音声環境に基づいて、小さな増分で調整してください (0.1 のステップを推奨します)。