How can I quadruple the speed of speech synthesis?

研究背景

音声合成システムは主に、連結型合成システムとパラメトリック合成システムの 2 つのカテゴリに大別されます。このうちパラメトリック合成システムは、ニューラルネットワークをモデルとして導入した後、合成の品質と自然さにおいて大きな進歩を遂げました。一方で、IoT デバイス(スマートスピーカーやスマートテレビなど)の急速な普及により、デバイス上で動作するパラメトリック合成システムには、計算リソースの制約とリアルタイム速度の要件という課題も生じています。本研究で導入される深層フィードフォワード逐次メモリネットワークは、合成品質を維持しながら計算量を効果的に削減し、合成速度を向上させることができます。

本研究では、統計的パラメトリック音声合成システムをベースラインとして、双方向 LSTM(BLSTM)を使用しています。現在の主要な統計的パラメトリック音声合成システムと同様に、深層フィードフォワード逐次メモリネットワーク(DFSMN)に基づく提案システムも、ボコーダー、フロントエンドモジュール、バックエンドモジュールの 3 つの主要コンポーネントで構成されています(上図参照)。ボコーダーにはオープンソースツールの WORLD を使用しており、学習時に元の音声波形からスペクトル情報、基本周波数の対数、帯域ピリオド特徴(BAP)、および有無声マークを抽出し、音声合成時には音響パラメーターから実際の音声への変換をリアルタイムで実行します。フロントエンドモジュールは入力テキストの正規化と語彙分析を行い、これらの言語特徴をニューラルネットワークの学習入力としてエンコードします。バックエンドモジュールは、入力言語特徴から音響パラメーターへのマッピングを構築します。本システムでは、バックエンドモジュールとして DFSMN を使用しています。

Deep Feedforward Sequential Memory Networks

標準的なフィードフォワード逐次メモリネットワーク(FSMN)の改良版として、コンパクト FSMN(cFSMN)は低ランク行列分解をネットワーク構造に導入しています。この改良により FSMN が簡素化され、モデルのパラメーター数が削減されるとともに、学習および推論プロセスが高速化されます。

上図は cFSMN の構造を模式的に示しています。ニューラルネットワークの各 cFSMN 層の計算プロセスは、次のステップで表現できます。① 線形写像により、前の層の出力を低次元ベクトルに変換します。② メモリモジュールが計算を実行し、現在フレームの前後複数フレームにわたる低次元ベクトルの次元ごとの重み付き合計を算出します。③ 重み付き合計をアフィン変換と非線形関数に通して、現在層の出力を得ます。これら 3 つのステップは、以下の数式で交互に表現できます。

再帰型ニューラルネットワーク(RNN、BLSTM を含む)と同様に、cFSMN はメモリモジュールの次数を調整することで遠距離の系列情報を捉える能力を持ちます。一方で、cFSMN は標準的な誤差逆伝播(BP)アルゴリズムで直接学習でき、時間軸に沿った誤差逆伝播(BPTT)を必要とする RNN と比べて学習が高速で、勾配消失の問題も生じにくいという特長があります。

cFSMN をさらに発展させることで、深層フィードフォワード逐次メモリネットワーク(DFSMN)が得られます。DFSMN は、さまざまな深層ニューラルネットワークで広く採用されているスキップ接続技術を活用しており、誤差逆伝播アルゴリズム実行時に勾配が非線形変換を迂回できるようになります。これにより、より多くの DFSMN 層を積み重ねても、ネットワークは依然として迅速かつ正確に収束します。DFSMN モデルにおいて、深さを増すことによる利点は 2 つあります。1 つは、より深いネットワークは一般的に表現力が強力であること、もう 1 つは、深さを増すことで DFSMN モデルが現在フレームの出力予測に利用できるコンテキスト長が間接的に伸び、遠距離の系列情報を捉えるのに非常に有利であることです。具体的には、隣接する 2 層のメモリモジュール間にスキップ接続を追加します(以下の数式参照)。各 DFSMN 層のメモリモジュールの次元は同じであるため、スキップ接続は恒等変換として実装できます。

DFSMN は非常に柔軟性の高いモデルと捉えることができます。入力系列が非常に短い場合や予測遅延が重要な場合は、小さい次数のメモリモジュールを使用できます。この場合、現在フレーム付近のフレーム情報のみを使用して現在フレームの出力を予測します。一方、入力系列が非常に長い場合や予測遅延が重要でないシナリオでは、大きい次数のメモリモジュールを使用でき、系列の遠距離情報を効果的に活用してモデル化できるため、モデルの性能向上に寄与します。

次数に加えて、DFSMN のメモリモジュールにはもう 1 つのハイパーパラメーターであるストライドを追加しています。これは、過去または未来のフレームから情報を抽出する際に、メモリモジュールが何フレーム隣接フレームをスキップするかを示します。これは、音声認識タスクと比べて音声合成タスクでは隣接フレーム間の重複が多いため、正当化されます。

前述のように、各層のメモリモジュールの次数を直接上げるだけでなく、モデルの深さを増すことも、現在フレームの出力予測時にモデルが利用できるコンテキスト長を間接的に伸ばすことができます。この効果は上図に示されています。

実験

実験段階では、男性が読み上げた中国語の小説データセットを使用しました。データセットを 2 つの部分に分割し、学習データセットは読み上げ 38,600 文(約 83 時間)、検証データセットは読み上げ 1,400 文(約 3 時間)で構成されます。すべての音声データのサンプリングレートは 16 kHz で、フレーム長は 25 ミリ秒、フレームシフトは 5 ミリ秒です。WORLD ボコーダーを使用して、フレームごとの音響パラメーターを抽出しました。これには、60 次元のメルケプストラム係数、3 次元の基本周波数の対数、11 次元の BAP 特徴、および 1 次元の有無声マークが含まれます。これら 4 セットの特徴をニューラルネットワークの 4 つの学習ターゲットとして、多目的学習を行いました。フロントエンドモジュールで抽出された言語特徴は合計 754 次元で、ニューラルネットワークの学習入力として使用されます。

比較対象のベースラインシステムは、下部に全結合層 1 層、上部に BLSTM 層 3 層を持つ強力な BLSTM モデルに基づいています。全結合層は 2,048 ユニット、BLSTM 層は 2,048 メモリユニットを含みます。このモデルは時間軸に沿った誤差逆伝播(BPTT)で学習され、DFSMN モデルは標準的な誤差逆伝播(BP)で学習されます。ベースラインシステムを含め、すべてのモデルは 2 台の GPU で、ブロックごとのモデル更新フィルタリング(BMUF)アルゴリズムを使用して学習されました。学習目的関数として、多目的フレームレベル平均二乗誤差(MSE)を使用しています。

すべての DFSMN モデルは、下部に複数の DFSMN 層、上部に 2 つの全結合層で構成されており、各 DFSMN 層は 2,048 ノードと 512 射影ノードを含み、各全結合層は 2,048 ノードを含みます。上図では、第 3 列がモデルを構成する DFSMN 層数と全結合層数を示し、第 4 列が DFSMN 層のメモリモジュールの次数とステップサイズを示しています。FSMN 系モデルの音声合成タスクへの適用は今回が初めてであるため、実験は浅層・低次数のモデル A から開始しました(モデル A のみステップサイズ 1 です。これはステップサイズ 2 の方がステップサイズ 1 の対応モデルより一貫してわずかに良い結果を示したためです)。システム A から D にかけて、DFSMN 層数を 3 に固定したまま次数を段階的に増加させました。システム D から F にかけて、次数とステップサイズを (10, 10, 2, 2) に固定したまま層数を段階的に増加させました。システム F から I にかけて、DFSMN 層数を 10 に固定して次数をさらに段階的に増加させました。上記の一連の実験において、DFSMN モデルの深さと次数が増すにつれて、客観指標が徐々に低下する(低いほど良い)傾向が明確に見られ、システム H の客観指標は BLSTM ベースラインを上回りました。

一方で、平均主観評価(MOS)テスト(高いほど良い)も実施し、その結果は上図に示されています。主観テストは、有料クラウドソーシングプラットフォームを通じて 40 人のネイティブ中国語話者により実施されました。各システムから 20 文の合成音声を生成し、それぞれ 10 人の異なる評価者により独立して評価されました。平均主観スコアのテスト結果によると、システム A から E にかけて聴感上の自然性が段階的に向上し、システム E で BLSTM ベースラインシステムと同等のレベルに達しました。ただし、後続システムの客観指標は改善を続けたものの、主観指標はシステム E のスコア付近で上下に変動するだけで、それ以上の向上は見られませんでした。

結論

上記の主観テストおよび客観テストの結果から、過去および未来の 120 フレーム(600 ミリ秒)の情報を捉えることが、音声合成の音響モデルに必要なコンテキスト長の上限であり、それ以上のコンテキスト情報は合成結果に直接的な寄与をしないという結論に至りました。BLSTM ベースラインシステムと比較して、提案する DFSMN システムはベースラインと同等の主観聴感品質を得ることができ、モデルサイズはベースラインのわずか 4 分の 1 で、予測速度はベースラインの 4 倍に達します。これにより、本システムはメモリ使用量と計算効率の両方が求められる IoT デバイスなどのエッジ環境への展開に非常に適しています。

Related Articles

Explore More Special Offers

  1. Short Message Service(SMS) & Mail Service

    50,000 email package starts as low as USD 1.99, 120 short messages start at only USD 1.00

phone お問い合わせ
Hi, I'm Alibaba Cloud AI Assistant!
I can help with questions and solutions.