このトピックでは、Intelligent Speech Interaction の主要な概念を紹介し、サービスの仕組みについて説明します。
サンプルレート
オーディオのサンプルレートとは、録音デバイスが 1 秒あたりに音声信号をサンプリングする回数です。サンプルレートが高いほど、音声はより忠実かつ自然に再現されます。
音声認識は、16,000 Hz と 8,000 Hz のサンプルレートをサポートしています。通常、電話の音声は 8,000 Hz を使用し、それ以外の音声は 16,000 Hz を使用します。
オーディオのサンプルレートが 16,000 Hz を超える場合は、音声認識サービスに送信する前に 16,000 Hz に変換してください。8,000 Hz のオーディオを 16,000 Hz に変換しないでください。代わりに、プロジェクトで 8,000 Hz のサンプルレートをサポートするモデルを選択してください。
サンプルサイズ
サンプルサイズ (ビット深度とも呼ばれます) は、各オーディオサンプルの振幅を量子化するために使用されるビット数です。サンプルサイズが大きいほど、解像度は高くなります。
音声認識では、一般的に 16 ビットのリトルエンディアンサンプルが使用されます。各サンプルは 2 バイトを占有し、16,000 Hz のオーディオでは 1/16,000 秒を表します。2 バイトのサンプルサイズは、CD 品質のオーディオに求められるビット深度の要件を満たします。
各サンプルは振幅値を記録します。サンプルサイズによって精度が決まります。
1 バイト (8 ビット) は 256 段階の振幅レベルを表します。
2 バイト (16 ビット) は 65,536 段階の振幅レベルを表します。
オーディオエンコーディング
オーディオエンコーディングは、オーディオデータの保存方法と転送方法を定義します。オーディオエンコーディング形式は、オーディオファイル形式とは異なります。たとえば、WAV ファイルのヘッダーはオーディオエンコーディングを指定し、オーディオデータには PCM、AMR、またはその他のサポートされているエンコーディングが使用される場合があります。
Intelligent Speech Interaction サービスを呼び出す前に、そのサービスがオーディオエンコーディングをサポートしていることを確認してください。
サウンドチャンネル
サウンドチャンネルは、特定の空間的位置でキャプチャされた独立した音声信号を表します。したがって、チャンネル数は録音された音源の数と等しくなります。オーディオは、一般的にモノラルまたはステレオで録音されます。
録音ファイル認識を除き、Intelligent Speech Interaction サービスは モノラルオーディオのみをサポートします。ステレオまたはマルチチャンネルのオーディオは、サービスに送信する前にモノラルに変換してください。
逆テキスト正規化
逆テキスト正規化 (ITN) は、音声認識の出力結果に含まれる数字、金額、日付、住所などを、標準化された読みやすい形式に変換します。以下の表に例を示します。
発話テキスト | ITN 適用後の認識結果 |
Twenty percent | 20% |
May eleventh | May 11 |
Please dial one one zero | Please dial 110 |
Appkey
Intelligent Speech Interaction の [管理コンソール] で作成された各プロジェクトには、Appkey と呼ばれる一意の識別子があります。サービスがプロジェクト設定を読み込めるように、すべてのサービスコールに Appkey を含める必要があります。
コンタクトセンターでの通話やモバイル入力メソッドなどのさまざまなユースケースでは、異なる音声機能が必要になります。最良の結果を得るには、各プロジェクトを意図したユースケースに合わせて設定してください。
AccessKey ペア
AccessKey ペアは、Alibaba Cloud API へのプログラマティックなコールを認証します。AccessKey ペアは、[AccessKey 管理] ページで作成および表示できます。
AccessKey ペアは、AccessKey ID と AccessKey Secret で構成されます。AccessKey ID は呼び出し元を識別し、AccessKey Secret はリクエストパラメーターに署名して改ざんを防止するために使用されます。この 2 つの値は、必ずペアで使用する必要があります。AccessKey Secret はパスワードのように扱い、決して開示しないでください。
アクセス トークン
アクセス トークンは、Intelligent Speech Interaction サービスへのコールを認証するもので、有効期間が限られています。AccessKey ID と AccessKey Secret を使用して生成します。
モバイルデバイスやその他のクライアントからのコールの場合、サーバー上でトークンを生成し、クライアントに送信してください。これにより、AccessKey ペアが漏洩するのを防ぐことができます。
中間結果
音声認識が中間結果を返すかどうかを設定できます。
false に設定すると、サービスは発話全体を認識した後に、1 つの完全な結果を返します。
true に設定すると、サービスは話者が話している間に中間結果を返し、その後に完全な最終結果を返します。
たとえば、最終結果が "Hello and welcome to Alibaba Cloud," の場合に中間結果を有効にすると、話者が話している間に次の 5 つの結果が返されることがあります。
Hello
Hello and
Hello and welcome
Hello and welcome to
Hello and welcome to Alibaba Cloud中間結果は、その後のレスポンスで修正されることがあります。
中間結果の間で追加されるテキストの量はさまざまです。各レスポンスで必ず 1 文字だけが追加されるとは限りません。
task_id
各音声サービスリクエストには、SDK によって自動的に生成される一意の task_id があります。リクエストのトラブルシューティングには、この task_id を使用します。