[DSW Gallery] Realize financial risk control based on graph algorithm

グラフアルゴリズムによる金融リスク管理の実現

グラフアルゴリズムは、リレーショナルネットワークのビジネスシナリオを解決するために一般的に使用されます。従来の構造化データとは異なり、グラフアルゴリズムではデータをエンドツーエンドのリレーショナルグラフとして整理する必要があります。辺と頂点の概念をより重視した構造です。ここでは、K-Core、最大連結部分グラフ、ラベル伝播クラスタリングなど、豊富なグラフアルゴリズムコンポーネントを提供しています。

この例では、人物関係グラフデータと少量のラベル付きユーザーデータを使用して、グラフアルゴリズムに基づく金融リスク管理を実装します。

動作環境の要件

PyAlink は公式 PAI-DSW イメージにデフォルトでインストール済みです。メモリ要件は 4 GB 以上です。

このノートブックの内容は、他のファイルを用意することなく直接確認できます。

pyalink パッケージのインポートとローカル実行環境の有効化

・この例では、useLocalEnv を使用して Alink ジョブをローカル(DSW のコンテナ内)で実行し、マルチスレッド方式で分散コンピューティングをシミュレートします。

・Alink では、usePaiEnv を使用して MaxCompute にジョブを送信することもできます。

from pyalink. alink import *

useLocalEnv(1)

データ準備

この例では、人物関係グラフデータテーブルと既知のユーザーラベルテーブル(優良ユーザーと不正ユーザーを識別するラベル)の 2 つのデータセットが必要です。

人物関係グラフデータ

・2 人ずつの接続は、同僚関係や家族関係など、何らかの関係性を持っていることを示します。

人物関係グラフデータの定義

人物関係テーブルの表示

edges.lazyPrint(5)

BatchOperator.execute()

離散変数の統計を表示

edges. select('source, target').lazyVizDive()

BatchOperator.execute()

人物関係テーブルの統計を表示

edges.lazyPrintStatistics()

BatchOperator.execute()

人物関係テーブルの統計パネルを表示

edges.lazyVizStatistics()

BatchOperator.execute()

既知のユーザーラベルテーブル

df_ labeled_ vertices = pd.DataFrame([

["Enoch", "Credit User", 1.0],

["Evan", "Fraudulent Users", 0.8]

])



labeled_ vertices = BatchOperator. fromDataframe(df_labeled_vertices, schemaStr='vertices string, labels string, weight double')

labeled_ vertices.print()

グラフアルゴリズムによる不正ユーザーの判定

以下の 3 つのステップに分かれます。

ステップ 1:最大連結部分グラフ

最大連結部分グラフコンポーネントを通じて、データ内のグループを 2 つの部分に分割し、group_id を割り当てます。その後、filter と JOIN を使用して、グラフから無関係な人物を除外します。

最大連結部分グラフコンポーネントは、接続性を持つ最大集合を見つけることで、グループ内のリスク管理と無関係な人物を除外できます。

ステップ 2:各人物の直接的・間接的な接触者の探索

・最短経路コンポーネントの出力結果において、distance は Enoch が何人を経由して対象の接触者に到達できるかを示します。

ステップ 3:ラベル伝播による未ラベル頂点のラベル判定

ラベル伝播分類は半教師あり分類アルゴリズムです。その原理は、ラベル付きノードのラベル情報を使用して、ラベルなしノードのラベル情報を予測することです。

アルゴリズムの実装において、各ノードのラベルは類似度に基づいて隣接ノードに伝播されます。各ステップのノード伝播で、各ノードは隣接ノードのラベルに基づいて自身のラベルを更新します。ノードとの類似度が高いほど、隣接ノードのラベルへの影響度が大きくなります。類似ノード間でラベルが一致しやすいほど、ラベルの伝播も容易になります。ラベル伝播の過程で、ラベル付きデータのラベルは変更されず、ソースとしてラベルなしデータに伝達されます。

最後に、反復プロセスが終了すると、類似ノードの確率分布が近似し、同じカテゴリに分類されます。これにより、ラベル伝播プロセスが完了します。

Related Articles

Explore More Special Offers

  1. Short Message Service(SMS) & Mail Service

    50,000 email package starts as low as USD 1.99, 120 short messages start at only USD 1.00

phone お問い合わせ
Hi, I'm Alibaba Cloud AI Assistant!
I can help with questions and solutions.