すべてのプロダクト
Search
ドキュメントセンター

Platform For AI:LLM 機密コンテンツマスク (MaxCompute)

最終更新日:Sep 09, 2026

LLM 機密コンテンツマスク (MaxCompute) コンポーネントは、大規模言語モデル (LLM) のトレーニングに使用されるテキストデータ内の機密情報をマスクします。個人を特定できる情報を検出し、固定のトークンに置換します。これにより、周辺のコンテンツを変更せずに、ダウンストリーム LLM トレーニングパイプラインにサニタイズされたテキストを渡すことができます。

制限事項

  • このコンポーネントでは、コンピューティングエンジンとして MaxCompute が必要です。

仕組み

このコンポーネントは、選択した各テキスト列を正規表現でスキャンし、一致する文字列を事前定義されたトークンに置換します。それ以外のテキストは変更されません。

次の表に、サポートされている各エンティティタイプ、置換トークン、および検出に使用される正規表現を示します。

エンティティタイプ 置換トークン 正規表現
携帯電話番号 [MOBILEPHONE] r'(?<!\d)(1(3[0-9]|4[579]|5[0-3,5-9]|6[6]|7[0135678]|8[0-9]|9[89])\d{8})(?!\d)'
r'(?<!\d)(1[\d]{2}-\d{4}-\d{4}\D|\D1\d{10}\D|\D1[\d]{2} \d{4} \d{4})(?!\d)'
r'(?<!\d)(1[3-9]\d{9})(?!\d)'
固定電話番号 [TELEPHONE] r'(?<!\d)(\(?0\d{2,3}[-\s)]?\d{7,8})(?!\d)'
メールアドレス [EMAIL] r'[a-zA-Z0-9_.+-]+@[a-zA-Z0-9-]+.[a-zA-Z0-9-.]+'
中国住民身分証番号 [IDNUM] r'(?<!\d)([1-6]\d{5}[12]\d{3}(0[1-9]|1[12])(0[1-9]|1[0-9]|2[0-9]|3[01])\d{3}(\d|X|x))(?!\d)'
r'(?<!\d)([1-9]\d{5}[12]\d{3}(0[1-9]|1[012])(0[1-9]|[12][0-9]|3[01])\d{3}[0-9xX])(?!\d)'

例:文中の機密コンテンツのマスキング

入力:

Contact taro.tanaka@company.com or call 13812345678 for assistance.

出力:

Contact [EMAIL] or call [MOBILEPHONE] for assistance.

同じマスキングルールを選択したすべての列に適用します。各テキスト列を個別にスキャンし、その列内で一致したすべての文字列を置換します。

コンポーネントの設定

Machine Learning Designer で LLM 機密コンテンツマスク (MaxCompute) コンポーネントを設定します。次の表にパラメータを示します。

フィールド設定

パラメータ 必須 説明 デフォルト値
[ターゲット列の選択] はい 処理対象のテキスト列です。複数の列を選択できます。選択したすべての列に同じマスキングルールを適用します。 なし
[出力テーブルのライフサイクル] いいえ コンポーネントによって生成される一時テーブルが自動的にリサイクルされるまでの保持期間 (日) です。正の整数で指定する必要があります。 28

チューニング

パラメータ 必須 説明 デフォルト値
[マップタスクインスタンスあたりの CPU 数] いいえ 各マップタスクインスタンスに割り当てる CPU 数です。有効な値は 50~800 です。 100
[マップタスクインスタンスあたりのメモリサイズ] いいえ 各マップタスクインスタンスに割り当てるメモリサイズ (MB) です。有効な値は 256~12,288 です。 1024
[マップの入力データの最大サイズ] いいえ 各マップタスクインスタンスが処理するデータ量の上限 (MB) です。有効な値は 1~2,147,483,647 です。メモリエラーが発生する場合はこの値を小さくしてください。小規模なデータセットでマップタスク数を減らすには、この値を大きくします。 256

次のステップ

Machine Learning Designer の概要と、コンポーネントを使用したパイプラインの作成方法については、Machine Learning Designer の概要 をご参照ください。