Practice of Active Learning Method: Make the Model "Active"

I. 背景

1. アクティブラーニングとは

インターネットで検索すると、ほとんどの検索結果は「子どもや生徒にいかにアクティブに学ばせるか」という内容です。残念ながら、それはお役に立てません。ここで言う話ではありません。

ここでのアクティブラーニング (AL) は機械学習アルゴリズムです。最も価値の高いトレーニングサンプルを積極的に見つけてトレーニングセットに追加します。サンプルにラベルが付いていない場合は、自動的に人手でのラベリングを要求し、その後モデルトレーニングに使用します。つまり、より少ないトレーニングサンプルで最高パフォーマンスのモデルをトレーニングすることです。

2. どのような問題を解決すべきか

・データアノテーションのコストが高い。特に専門分野において顕著です。

・データ量が膨大で全量トレーニングが困難、またはトレーニング用マシンや時間に制約があります。

3. 価値は何か

アクティブラーニングは、サンプルラベリング量を削減してコストを節約できます。これにはラベリングコストとトレーニングリソースコストが含まれます。また、アクティブラーニングは同じデータ量でもモデルパフォーマンスを向上させることができます。

たとえば、未ラベルサンプルプールに 1,000 万のサンプルがあるとします。アクティブラーニングを使用して 200 万のサンプルを選択してラベル付きトレーニングを行えば、1,000 万のトレーニングと同等パフォーマンスのモデルをトレーニングできます。一般的に、アクティブラーニングはサンプルアノテーション量を半分以上削減できると考えられています。アクティブラーニングでデータセットの部分集合を選択してトレーニングした場合、全量トレーニングを超えるモデルパフォーマンスを達成できることもあります。これはまさに私たちのビジネスシナリオで実証されています。

4. 直面しているビジネス上の課題は何か

・モデルパフォーマンスの向上:CRO コンテンツセキュリティチームのリスクコントロールモデルは毎月パフォーマンスの改善が求められます。

・リフローデータの活用:各ビジネスシナリオでは新たな違反手法が継続的に発生しています。新しい違反サンプルの予防と検知が必要ですが、オンラインリフローデータの量は膨大です。リフローデータを直接ラベリングしてトレーニングするのは非効率で、ラベリングコスト、トレーニングマシンコスト、トレーニング時間が大きくなります。

・ダーティデータの処理:画像ラベリングの基準は一意に定められていますが、各アノテーターの基準定義に対する理解が異なり、誤ラベリングが発生しやすく、データセットには一定割合のダーティデータが存在します。

II. アクティブラーニングアルゴリズムの概要

現在のアクティブラーニングアルゴリズムの中で、最も広く使用されている手法は情報ベースの手法で、現在のモデルに対して最も不確実性の高いサンプルをトレーニングデータとして選択します。もう一つ広く注目されている手法は Query By Committee ベースの手法で、異なるモデル間で最も不確実性の高いサンプルをトレーニングデータとして選択します。ここでは主にこの 2 種類の手法を分析します。

1. 不確実性ベースの手法:(不確実性)[1]

情報ベースの戦略は、その実用性から広く使用されています。

考え方

不確実性が大きいほど含まれる情報量が多く、トレーニングの価値が高くなります。

プロセス

ラベル付きデータ部分集合でモデルをトレーニングし、そのモデルで残りの未ラベルサンプルを予測します。予測結果に基づき、不確実性の尺度を用いて最も不確実性の高いサンプルを見つけ出し、アノテーターにラベリングを依頼します。ラベル付きサンプルをトレーニングセットに追加してモデルを再トレーニングし、このプロセスを繰り返します。

代表的な手法

代表的な不確実性の尺度は 3 種類あり、それぞれが 3 つのアクティブラーニング戦略に派生しています。なお、情報量の比較は確率値の比較で置き換えることができます。

1)最小信頼度(LC)

モデル予測において信頼度値が高いにもかかわらず依然として「信頼性」が低いサンプルに注目します。混同しやすいサンプルに注目しないという欠点があります。

ここで、image.png はサンプル image.png がクラス image.png に分類される確率であり、通常はモデル出力のスコア値で、image.png はクラスインデックスです。

2)最小マージン(SM)

最大信頼度と 2 番目の信頼度のマージンが最小のサンプル、つまり混同しやすいサンプルに注目します。この手法は LC の欠点を改善したものです。

3)エントロピー(ENT)

総合的な情報量が最大のサンプルに注目します。

3 分類問題を例に、上記 3 手法の注目光サンプルの比較を示します。

2. Query By Committee (QBC)

考え方

最適化された ML モデルをバージョン空間の探索と見なします。QBC はバージョン空間の探索範囲を圧縮することで最適な ML モデルを見つけ出します。

プロセス

同一のトレーニングセットで同一構造の複数モデルをトレーニングします。モデル間の投票により議論のあるサンプルを選択します。議論のあるサンプルにラベルを付けた後、モデルを再トレーニングし、このプロセスを繰り返します。

代表的な手法

2〜3 のモデルで構成されるコミティーで良好なパフォーマンスを達成できます。多様性がアンサンブルモデルのパフォーマンスの鍵です [1]。

・H.S. Seung [2] が 1992 年に QBC 手法を初めて提案し、複数モデルの分類結果に対する投票で最も投票結果が一致しないサンプルを選択しました。

・DAS [3] は 2019 年に arXiv で公開された、深層ニューラルネットワーク版の QBC 手法です。同一構造の 2 つの VGG-16 ネットワークを同一データセットでトレーニングし、予測が一致しないサンプルを選び出します。

・Active Decorate [4] 手法:QBC ベースで新規データをマイニングし、ラベリング後にトレーニングセットに追加して新規分類器をトレーニングし、既存モデルと直接統合してコミティーとして、その後新しいコミティーに基づいて新規データを選択し続けます。これを繰り返します。

QBC 手法のトレーニング価値の計算式は以下の通りです。

3. まとめ

これら 2 つの手法のうち、一方はモデルの現在の状態に基づいて不確実性を測定し、もう一方は複数の異なるモデルを通じて不確実性を測定します。これら 2 種類の手法はアクティブラーニングにおいて比較的汎用的かつ効率的で、私たちのビジネスにおいても価値があります。

III. ビジネスシナリオに基づいた手法設計

ビジネスシナリオでは既に大量のラベル付きデータを蓄積していますが、トレーニングデータ量を増やすだけではモデルパフォーマンスの向上にはつながりません。さらに、モデルパフォーマンス向上には厳しい要件があります。たとえば、モデルが大規模でトレーニングセットも大きく、モデルトレーニングに時間がかかる場合、アクティブラーニングアルゴリズムのマイニング効率に高い要求があります。また、トレーニング手法の改善も必要です。数百万レベルのトレーニングデータをマイニングする必要がある場合、サンプルのトレーニング価値の評価方法もそれに合わせて改善する必要があります。そうしないとトレーニング部分集合に過学習しやすくなります。以下で、ビジネスシナリオに基づいたアクティブラーニングアルゴリズムの詳細を説明します。

1. マイニング効率

既存のアクティブラーニング手法では、1 回に 1 サンプルまたは 1 バッチのサンプルをマイニングできます。たとえば 500 万サンプルのデータを処理するのに何サイクルかかるか計算してみましょう。

リソースには限りがあり、全量を計算することはできません。

ビジネスシナリオでは、アクティブラーニングアルゴリズムが 1 回に数万または数十万のサンプルをマイニングできる必要があります。これは主流の論文におけるアクティブラーニングとは異なります。既に大量のラベル付きデータがあるため、ビジネスシナリオでは以下の能力を持つアルゴリズムが必要です。

・情報を十分に活用できること。

・1 回に数万または数十万のサンプルをマイニングしてトレーニングセットに追加し、トレーニングの反復サイクルを最小化できること。

したがって、QUIRE [5] のようなバッチ選択をサポートしない手法は直接除外できます。バッチ選択をサポートする手法をベースに、データ量を調整してマイニング効率を向上させました。

2. データバランス

価値のあるサンプルをバッチでマイニングしてトレーニングセットに追加し、モデルをトレーニングすればパフォーマンスは向上するでしょうか。

それは単純すぎます (= =)|||

トレーニングサンプルの各カテゴリ間のデータ比率のバランスは、モデルパフォーマンスに大きな影響を与えます。QBC 手法やエントロピー法など、多くのアクティブラーニング手法はデータバランスの問題を考慮せず、各手法の基準で最も価値の高いサンプルのみを選択します。私たちの経験では、カテゴリバランスを制御した前提で、アクティブラーニング手法によりサンプルの価値を評価し、各カテゴリから適切な比率で価値のあるトレーニングサンプルをマイニングすることが重要です。

3. ダーティデータの排除

価値のあるサンプルをバッチでマイニングし、トレーニングセットに追加してモデルをトレーニングし、データバランスも制御すればパフォーマンスは向上するでしょうか。

それは単純すぎて、時には甘いです orz

曖昧なサンプルはトレーニング価値が高く、マイニングされる確率も高くなります。しかし、私たちが直面する問題では、このデータバッチは誤ラベリングであることが多いのです。

オープンソースアルゴリズムやタスクに応じて独自設計したアルゴリズムを含む、さまざまなダーティデータ排除手法を試しました。最終的に以下の経験をまとめ、共有します。

・ダーティデータ排除は必須です。モデルパフォーマンスに大きな影響を与えるためです。

・ダーティデータを完全に排除することはできません。完全排除にはコストがかかるためです。

・ノイズラーニング手法を考慮しない場合でも、データ選択によりダーティデータを一定割合以下に抑えるだけで、良好なパフォーマンスのモデルを得ることができます。

4. サンプルの難易度

価値のあるサンプルをバッチでマイニングし、トレーニングセットに追加してモデルをトレーニングし、データバランスを制御し、ダーティデータも排除すればパフォーマンスは向上するでしょうか。

おそらく。良い結果が出ることを祈ります。

トレーニングデータを 2 倍にマイニングしてトレーニングセットを直接 2 倍にすると、モデルはほぼすべてバイアスがかかります(少なくとも私たちのシナリオでは)。ある状態のモデルの判断に基づいて大量のトレーニングデータを一度に決定する方法は「バイアス」を導入しやすく、トレーニングされたモデルが見つけた決定境界が最適ではないのです。

この問題を解決するため、トレーニングセットのサンプル構成の観点からアプローチを変えます。選択したデータセットが現在の決定境界付近のハードサンプルだけでないようにし、一定割合のイージーサンプルを含めます。アクティブラーニングアルゴリズム内でパフォーマンスの弱い予測モデルを使用してデータ選択を行うことで、この目標を達成します。

5. HW アクティブラーニング手法

私たちのビジネスシナリオでは、以下の特徴を持つアルゴリズムが必要です。

・データの一括マイニング。

・データ均衡の制御。

・ダーティデータ排除能力。

・サンプル難易度の適切な制御。決定境界付近以外のサンプルもある程度導入すること。

・既存データのアノテーション情報を活用できること。

最小信頼度手法をベースに、リスクコントロールビジネスに適応したアクティブラーニング手法を設計し、HW アクティブラーニングアルゴリズムを考案しました。サンプルセット image.png の各サンプルのトレーニング価値について、以下の計算方法を用います。

IV. 実験と結果

1. 小規模データセット検証実験

ビジネスデータを使用して合計 30 万のトレーニングセットを構築し、アクティブラーニングアルゴリズムを迅速に検証します。最も適切な手法を選定し、より大規模なデータセットで使用してビジネスモデルのパフォーマンス向上を図ります。

異なるアクティブラーニング手法で一度に 10 万件のデータを選択し、トレーニングセットに追加してモデルをトレーニングします。各モデルのパフォーマンス比較は以下の通りです。FPR=1% 時の TPR 値を指標として使用します。

ROC 曲線は以下の通りです。

実験のまとめ:

HW 手法と QBC 手法はさまざまなビジネスシナリオで良好なパフォーマンスを示しています。QBC を実現するには複数モデルをトレーニングする必要があるため、特にデータ量が大きくなるにつれて、HW の方が効率性に優れています。

2. ビジネス実践

前述の通り、提案した HW アクティブラーニング手法をコンテンツ識別サービスモデルに適用し、以下の結果を得ました。FPR=1% 時の TPR 値を指標として使用します。

V. まとめ

アクティブラーニングは、最も価値の高いトレーニングサンプルを選択してトレーニングセットに追加することで、モデルのパフォーマンスを向上させることができます。アクティブラーニングの考え方に基づき、一度に数十万のサンプルをマイニングできる HW アクティブラーニング手法を設計し、ビジネスモデルのパフォーマンス向上を実現しました。

VI. 課題と展望

今回の取り組みにはまだ未解決の課題があります。たとえば:

・「ダーティデータ比率」の手法や経験は汎用的でしょうか。ノイズラーニング手法を適用すれば、サービスモデルのパフォーマンスをさらに向上させられるでしょうか。

・1 ステップで十分なトレーニングデータをマイニングするだけでなく、複数回のマイニングとトレーニングを繰り返すことで選択効率を犠牲にしても、モデルパフォーマンスをさらに向上させられるでしょうか。

Related Articles

Explore More Special Offers

  1. Short Message Service(SMS) & Mail Service

    50,000 email package starts as low as USD 1.99, 120 short messages start at only USD 1.00

phone お問い合わせ
Hi, I'm Alibaba Cloud AI Assistant!
I can help with questions and solutions.