Intrinsic image decomposition based on scale space transformation

概要

画像をその内在的な反射率画像と照明画像に分解するための新しいネットワーク構造を提案する。この問題を Image-to-Image 変換問題として扱い、入出力をスケールスペースで分解する。出力画像(反射率と照明)をラプラシアン成分に展開することで、各チャンネル内で並列的に Image-to-Image 伝達関数を学習するマルチチャンネルネットワーク構造を開発した。この関数はスキップ接続を持つ畳み込みニューラルネットワークで表現される。このネットワーク構造は汎用的かつスケーラブルであり、内在画像分解問題において優れた性能を示した。MPI-Sintel データセットと MIT Intrinsic Images データセットの 2 つのベンチマークデータセットでネットワークを評価した。定量的および定性的な結果の両方から、我々のモデルが既存の最先端手法に対して明確な改善を達成していることが示された。

1:導入

表現学習における最近の新たな動向は、照明、ポーズ、属性などの入力次元を考慮して画像から個々の構成要素を分解することを学習する研究方向である。しかし、この問題の基本的な形態の一つ、すなわち画像を内在的な反射率画像と照明画像に分解する問題は、十分な注目を集めていない。内在画像分解問題の解決は、材質編集を可能にし、深さ推定の手がかりを提供し、人間の知覚における輝度恒常性という長年の問題に対する計算論的な説明を提供するだろう。しかし、これまでになされた注目すべき進展にもかかわらず、この問題は引き続き取り組むべき困難な課題である。

難しさの一部は、この問題の不確実性に起因する。反射率画像と照明画像に関する事前知識に基づき、Retinex アルゴリズムは分解を勾配領域における閾値処理問題に制約する。このモデルは実用的な効果を持つが、複雑な材質や幾何学の鋭いエッジ、強い点光源による影を扱うことができない。もう一つの課題は、画像レンダリングプロセスの複雑さにある。これはシーンの材質、幾何学、照明を複雑な光学プロセスを通じて 2D 画像に変換するプロセスである。内在画像分解の目的は、このプロセスを部分的に逆変換しようとするものである。

我々の研究では、深層ニューラルネットワークを関数近似器として使用し、Image-to-Image 変換の枠組みで内在画像分解処理のマッピング関係を学習する。同様の考え方を持つモデルが提案されているが(例:[1, 2])、我々のモデルはネットワーク入出力のスケールスペースと、関数近似パイプラインを水平方向に並列なセットに拡張することによるサブバンド変換を探求する。

我々の研究の主な貢献は、スケールスペース分解に基づく生成ネットワークを内在画像分解のために提案することである。これは学習可能なアップサンプラーとダウンサンプラーを用いて古典的なガウシアンピラミッドとラプラシアンピラミッド構造を構築することで実現する。最終的なモデルは、出力の反射率画像と照明画像のスケールごとの分解を生成する複合ネットワークである。各スケールの分解はサブネットワークによって予測され、これらのサブネットワークの結果が統合されて最終結果となる。

また、画像の詳細を効果的に保持し、反射率画像の滑らかさと照明の固有の特性を保証できる新しい損失関数を提案する。さらに、ラベル付きデータの不足に対処するためのデータ拡張手法を提案する。Breeder learning に着想を得て、事前学習済みネットワークを用いてラベルなし画像のラベルを生成し、画像に一定の摂動を加えて新しいデータセットを生成し、最後に生成されたデータセットを用いてネットワークの性能を向上させる。

MPI-Sintel データセットと MIT Intrinsic Images データセットでモデルを評価した。実験結果は提案モデルの有効性を示している。最終モデルはさまざまな評価指標において既存手法を大幅に上回る性能を発揮する。

2:我々のアプローチ

まず、入力画像 I から出力画像 A への変換を、複雑で高度に非線形かつピクセルレベルで非局所的なマッピング関数 I→f(I) として考える。深層畳み込みニューラルネットワークが、画像分類から画像と言語間の変換に至るまで、さまざまなマッピングに対する汎用的かつ実用的なパラメータ化と最適化の枠組みであることは十分に実証されている。ここで、入出力の両方が自然な詳細度(LOD)ピラミッド構造を持つ画像であり、マッピング関数が入力を出力にピラミッド階層に従ってマルチチャンネルに分解して連結する可能性がある画像間変換問題に、ネットワークアーキテクチャをどう適応させるかを考える。次のセクション(2.1)で、この特性を活用して最終的なマルチチャンネル階層型ネットワークアーキテクチャに至る、ResNet アーキテクチャからのモデル改良過程を説明する。

画像 I のガウシアンピラミッドを [I0, I1, ..., IK] と表記する。ここで I0 = I であり、K は総層数である。k 番目のラプラシアンピラミッド層を Lk(I) = Ik - u(k+1) と定義する。ここで u はアップサンプリング演算子である。定義により、画像のラプラシアンピラミッド展開は I = [L0(I), L1(I), ..., Lk-1(I), IK] となる。ここで L0(I) のスケールと IK はガウシアンピラミッドの最低スケール層で定義される。

2.1 ネットワーク構造の進化

まず、2 つのブロック(L と H)からなる簡略化ネットワークを用いて低周波数帯域のマッピング I→f(I) をモデル化する。L と H は高周波数帯域のマッピングと任意の残差を処理する。これらのネットワークは L の省略形で与えられる。L の出力と H の出力をスキップ接続して合計することで、このネットワークは ResNet アーキテクチャの一例となる。

次に、出力にラプラシアンピラミッド展開を適用することで、(a) の損失を 2 つの成分に分割できる。L の出力は低周波数のガウシアン成分に適合するよう制約され、H の出力はラプラシアンの詳細成分に個別に適合させられる(図 2-b)。この改良されたネットワークは (a) と等価であるが、より厳密な制約が課されている。

(b) から (c) への重要な移行は、L の出力を H の出力に接続することで、積み上げられた 2 つのブロックを 2 つの並列ブランチに再接続でき、損失の調整も H に応じて行われる点にある。得られるネットワーク構造 (c) は (b) と等価であり、ラプラス分解方程式の 2 つの等価な形式を表している。すなわち、残り成分を左辺から右辺に移動させて符号を変更することで得られる。(c) の L の損失は正則化形式と同じままであり、我々の実験ではこれがオプションであることがわかった。ネットワーク構造 (d) は最終的な拡張モデルの基礎となる。

(d) のラプラシアンピラミッド分解に類似した構造に対して、高周波数帯域用の複数のサブネットワークブロック H0, H1, ... HK-1 と低周波数用の 1 つのサブネットワークブロック LK を導入する。ネットワーク入力ブロックはダウンサンプリングがカスケード接続され、ネットワークブロックの出力は左から右へアップサンプリングおよび集約されて目標出力を形成する。ダウンサンプリングとアップサンプリング演算子のすべてのパラメータ(図 2 の灰色の網掛け台形)はネットワーク内で学習される。すべてのネットワークブロックは同じアーキテクチャトポロジーを共有し、これを「残差ブロック」と呼び、セクション 2.2 で詳しく説明する。

2.2 残差ブロック

残差ブロックは同じトポロジーを共有するエンドツーエンドの畳み込みサブネットワークであり、異なるスケールの入力を対応するラプラシアンピラミッド成分に変換する。各残差ブロックは 6 個の連続した Conv(3x3)-ELU-Conv(3x3)-ELU サブ構造で構成される。入力画像のピクセル値を予測するため、全結合層は使用しない。Huang らの DenseNet アーキテクチャの一部のバリアントを含む、最近の研究で一般的なスキップ接続方式を採用している。具体的には、各サブ構造内で最後の Conv の出力がスキップ接続によって要素ごとに累積され、その結果が最後の ELU ユニットに入力される。中間層は 32 個の特徴チャンネルを持ち、出力は 3 チャンネルの画像または残差画像である。最初の層と最後の層のスキップ接続パスには、残りパスの出力とサイズを合わせるための 1x1 Conv が追加されている。

活性化関数として ReLU とバッチ正規化の代わりに Exponential Linear Unit(ELU)を使用する。ELU は x < 0 のときに負の活性化値を生成でき、ゼロ平均の活性化を持つという特性があり、これらはいずれもネットワークが深くなるにつれてノイズへのロバスト性とアンサンブルトレーニングを向上させる。さらに、BN 層を削除する。これは ELU によって部分的に代替可能であり、メモリ使用量において 2 倍高速で効率的である。

2.3 損失関数

データ損失:データ損失は予測画像と実画像間のピクセルレベルの類似性を定義する。ピクセルごとの平均二乗誤差の代わりに、予測されたアルベドとシェーディングの積が入力と一致すべきという制約と組み合わせて、以下の共同バイラテラルフィルタリング(交差バイラテラルフィルタリング [3, 4] とも呼ばれる)を採用する。

知覚損失:変換中に高レベルの意味構造も保持されるべきであるため、CNN 特徴ベースの知覚損失を使用する。標準的な VGG-19 [5] ネットワークを利用してニューラル活性化から意味情報を抽出する。知覚損失は以下のように定義される。

変分損失:最後に変分項を使用して出力を滑らかにする。

ここで i と j は画像の行と列のインデックスである。

2.4 データ拡張トレーニング

このセクションでは、ラベルなし画像を自己拡張ネットワークのトレーニングプロセスに組み込むデータ拡張戦略について説明する。繁殖研究からの着想を活かす。その考え方は、順方向生成モデルを使用してモデル用の新しいトレーニングペアを生成し、モデルが生成したパラメータに摂動を加えて拡張することである。このメカニズムは Bootstrap の精神をある程度受け継いでおり、かなり効果的であることが証明されている。たとえば Li らは最近、この戦略を外観モデリングネットワークに適用し、ラベルなし画像に対してモデルが予測した反射率に基づいてトレーニング画像を生成した。

まず、グラウンドトゥルースの反射率画像と照明画像を持つ適度なサイズのデータセットで素朴なネットワークをトレーニングする。その後このネットワークを新しい画像セットに適用してアルベド A とシェーディング S の推定値を得る。シンプルな合成手順を通じて推定値から新しい画像を生成できる。なお、損失定義上 A と S は入力画像と完全に一致するよう厳密に制約されていないため、新しく合成された画像は元の画像から乖離することになる。

拡張データセットにさらなる摂動を導入するため、A と S に適応多様体フィルター(AMF)を追加で適用し、フィルタリングされた結果を使って新しいデータを合成する。AMF フィルター演算子は、入力画像や初期ネットワークから生じた可能性のある A と S のノイズや不要な詳細を抑制し、新しく合成された画像とそのグラウンドトゥルースの多様性を調整するために使用される。

3:実験

このセクションでは、MPI-Sintel データセットと MIT Intrinsic Images データセットでのモデル評価について説明する。

3.1 データセット

MPI-Sintel データセットは 18 個のシーンレベルのコンピュータ生成画像シーケンスで構成されており、そのうち 17 個は 50 枚のシーン画像を含み、1 つは 40 枚の画像を含む。実験では A×S = I という制約を満たす ResynthSintel バージョンを使用する。これまでの研究との一対一比較のため、シーン分割と画像分割の 2 種類のトレーニング/テスト分割を使用する。シーン分割ではシーンレベルでデータセットを分割し、シーンの半分をトレーニングに、残りの半分をテストに使用する。画像分割ではシーンカテゴリに関係なく、画像の半分をランダムに選択してトレーニング/テスト用に割り当てる。MIT Intrinsic データセットの元のバージョンには、実験室環境で撮影された 20 個の異なる被写体画像があり、各画像に 11 種類の照明条件が含まれている。

3.2 MPI データセットの実験結果

MPI-Sintel データセットでの評価結果を図に示す。同様に、我々のモデルは既存手法と比較して満足のいく結果を生成しており、特にネットワークがテストデータに過適合しにくいシーン分割テストで顕著である。

既存研究との比較:まず、Constant Shading と Constant Albedo の 2 つのシンプルなベースライン、いくつかの伝統的手法、および最新のニューラルネットワークベースモデルを含む一連の既存手法とモデルを比較する。結果は、データ拡張トレーニングの有無にかかわらず、我々のモデルが 3 つの指標すべての評価で最高の性能を発揮することを示している。

Sintel 画像分割に関するすべての手法の数値結果はやや誤解を招く可能性があることを指摘しておきたい。これは、Sintel データセット内の同じシーンカテゴリの画像シーケンスが互いに非常に似ているため、画像レベルですべてのデータを分割すると(同じシーンタイプの画像がトレーニングセットとテストセットの両方に現れる可能性がある)、トレーニングセット全体でトレーニングされたネットワークが画像分割テストセットでも依然として高い性能を示すからである。しかし、シーン分割データセットにはこの問題がない。実験から得られた興味深い結果は、シーン分割における既存結果に対する差が画像分割よりも大きいということである。表では、画像分割ではかなり控えめな差を保持しているが、シーン分割での差は si-MSE で 25%、DSSIM で 43% に達しており、このネットワーク構造がより挑戦的なデータセットでも依然として優れた性能を発揮することを示唆している。

逐次構造から並列構造へ:セクション 2.1 で説明したネットワークアーキテクチャの重要な改良は、逐次構造からマルチブランチ並列構造への変換である。この改良は、深く積み上げられたネットワークを並列チャンネルのセットとして扱うことで、勾配逆伝播の問題を軽減する。この行(Ours Sequential)は図 2 の逐次アーキテクチャ (a) を通じた結果を示している。このアーキテクチャが既存の手法と同等の性能を発揮することがわかるが、特に DSSIM 指標において最終モデルには理想的ではない。

階層的最適化と同時最適化:我々の研究のもう一つのアーキテクチャ上の最適化は、各ラプラシアンピラミッドレベルでの制約(損失)を削除し、単一の損失制約ですべてのネットワークチャンネルを同時にトレーニングすることである。後者の場合、最適化方式を同時最適化と呼び、前者を階層的最適化と呼ぶ。補足資料にはいくつかの数値結果が含まれており、階層的最適化をより詳しく説明している。表 1-2 の実験では、同時最適化方式がすべての指標で 10%-15% の改善を示している。

他の要因に関する自己比較:ピラミッド構造、損失関数、代替ネットワーク入力、データ拡張を含む他の要因に関する一連の制御比較実験も行った。

ピラミッド構造:単一チャンネルネットワークを使用した実験(Ours w/o Pyramid)の結果を示す。すなわち、マルチチャンネル分解構造を使用せずに単一の残差ブロックで入力から直接出力を生成する。表 1 と表 2 の結果は、ピラミッド構造を持つモデルが制御設定と比較して 30% 以上の改善を示していることを示す。ピラミッドレベル数が増加しても、ネットワークの複雑度は定数倍まで線形にしか増加しないことに注意されたい。

損失関数:損失関数を古典的な MSE 損失に置き換えた実験(Ours w/ MSE loss)の結果を示す。MSE 損失の量子化誤差は、スケール不変 MSE 指標の大きな因子のために減少しないことが判明した。ただし、補足資料の定性結果は MSE 損失がぼやけたエッジの結果を生成することを明らかにしている。構造ベースの指標である DSSIM も、シーン分割で 10.23 から 8.86 へと、MSE 損失と我々の損失の間に明確な差を示している。

CNN 特徴を入力として使用:既存のマルチスケール深層ネットワークのほとんどが CNN ネットワークによって生成されたマルチスケール特徴を入力として使用しているため、このタスクでガウシアンピラミッド画像コンポーネントをネットワーク入力として使用した場合の影響をさらに調査する。実験(Ours w/ 'FPN' input)は FPN ネットワークに続いて CNN 特徴を完全に入力として使用した場合の結果を示す。比較では最終モデルに対してわずかな利点を示すが明確ではない。これは CNN の高レベル特徴が我々のピクセル間変換ネットワークの必要なセマンティック情報の大部分を依然としてうまく保持できていることを示唆している。

3.3 MIT データセットの実験結果

MIT Intrinsic Images データセットでの我々のモデルの性能も評価し、既存の手法と比較する。結果を図に示す。この実験セットでは、2 つの異なる設定でデータ拡張を実施する。Ours+DA と Ours+DA+ である。その違いは拡張に使用するデータにある。Ours+DA は、類似したオブジェクトカテゴリ名のセットによって拡張データがデータセットから抽出される一般的な設定である。Ours+DA+ では、新しい照明条件でデータセットを作成する。これにより元のデータセットに非常に似たデータセットが作成され、実質的に入手不可能となる。つまり、拡張データの品質に上限を設けることになる。我々の結果は、両方の拡張設定が有効であることを示しており、後者はこのタスクに導入したデータ拡張方式から導き出せる限界に関する手がかりを提供する。

4 結論

ラプラシアンピラミッドに基づくニューラルネットワークアーキテクチャを内在画像分解のために導入した。我々のニューラルネットワークは、この問題をさまざまなスケールでの Image-to-Image 変換としてモデル化する。MPI Sintel と MIT データセットで実験を行い、実験結果は我々のアルゴリズムが優れた数値結果と画質を実現できることを示している。今後の課題として、提案されたネットワークアーキテクチャをピクセルラベリングや深度回帰などの他の画像間変換問題でテストし、改良することが期待される。

Related Articles

Explore More Special Offers

  1. Short Message Service(SMS) & Mail Service

    50,000 email package starts as low as USD 1.99, 120 short messages start at only USD 1.00

phone お問い合わせ
Hi, I'm Alibaba Cloud AI Assistant!
I can help with questions and solutions.