How to use algorithms to empower material governance

プロジェクト概要

素材は大規模プロモーションにおいて極めて重要な要素であり、商品情報、核心的なメリット、セールスポイントなどの内容を含みます。商品名や商品特徴、そして効果的なプロモーション施策とも密接に関連しています。

ニューリテールの大きな潮流の中で、一方では国が制定した電子商取引法が EC 業界に対してますます整備されつつあり、虚偽や誇張された宣伝を行う事業者は国の法律に抵触しやすく、違反リスクが高くなっています。他方では、消費アップグレード時代というマクロ環境の中で、消費者の品質に対する基準は年々高まっており、低品質な素材は消費者に劣悪な購買体験を与え、結果として成約に影響を及ぼします。これを受けて、低品質素材の発掘プロジェクトを速やかに立ち上げ、機械学習による素材管理の推進、プラットフォームのリスク回避を実現し、消費者により良い購買体験を提供することを目指しています。

本プロジェクトの全体的な価値は、主に以下の側面に現れています。

プラットフォーム側:事業者による虚偽・誇張広告は規制違反につながりやすいため、本ソリューションはそれによる法的リスクや世論リスクを回避できると同時に、消費者の検索コンバージョン率の向上にも寄与します。

事業者側:低品質素材を発掘し、事業者が入力するコンテンツを標準化することで、大規模プロモーション素材を日常業務に保存して再利用可能にし、「一度の入力で複数回活用」を実現します。

消費者側:消費者により良いブラウジング体験を提供し、目にする割引が実際に享受できる本物の割引であることを保証します。

影響範囲

あらゆる種類の低品質素材は、消費者の閲覧・購買体験に深刻な影響を与えています。同時に、プラットフォームへのリスクや世論問題の発生にもつながりかねません。ユーザー体験の守護者およびプラットフォームリスクの管理者として、ゼロトレランスの姿勢で低品質素材を発掘し、事業者に素材の修正を促し、指定期間内に修正されなかった商品素材の権限処理を行い、消費者の閲覧・購買体験を確保し、プラットフォームのリスクを低減する責任があります。

分類識別

大枠として、低品質素材を 3 つのカテゴリーに分類しています。

異常な短いタイトル

商品の短いタイトルは 6 〜 10 文字で、商品名、商品属性、商品の基本的な特徴を簡潔に表現するものです。しかし、異常な短いタイトルにはさまざまな異常情報が含まれ、クリックを誘発するような内容もあり、消費者の購買体験に深刻な影響を与えます。

異常なメリットポイント

商品のメリットポイントは、主に商品の割引やオファーなどの情報を表現するものです。同様に低品質なメリットポイントには、「ahhhhhhhh」や「メリットポイント追加予定」といった低品質情報や、「有名ブランド 70 万元相当のオファー」「損を覚悟で棚から下ろす」といった購買を煽る内容が含まれることもあり、消費者の購買体験を損ない、プラットフォームへのリスクにもつながります。

過度な宣伝

事業者がストア全体 50% 割引のイベントに登録し「ストア全体 50% 割引事業者」となった場合、「ストア全体 50% 割引」「ストア全体 50% 未満の割引」「ストア全体 50% 割引」などの訴求ポイントを表示して、消費者の閲覧・購買を促すことができます。しかし、一部の事業者は「ストア全体 50% 割引事業者」として登録しておらず、登録したプロモーション商品の中に少なくとも 1 つは 50% 割引ではない商品が含まれています。これは虚偽広告に該当し、さらなる世論リスクを招く恐れがあります。

ソリューション

課題と対応策

「文は第一、武は第二」という言葉があるように、明らかに低品質な短いタイトルを除き、多くのタイプの短いタイトルを厳密に定義するのは困難です。「無制限クーポン受取可能」「原価割れで販売中」「XXXX 公式旗艦店」などは、人によって解釈が異なる場合があります。

対応策:事業者およびビジネスチームと連携し、低品質な短いタイトルおよび低品質なメリットポイントの基準を明確にし、各カテゴリーの特徴を抽出して識別・分類に活用します。

ダブル 11 期間中のイベント登録素材数は膨大で、タイムリーさと正確さの要件が高く、データは毎日更新する必要があり、ビジネス側でクリーニングを受け入れる体制が求められます。

対応策:データを ODPS に同期して処理し、高いタイムリーさの要件に対応します。

ダブル 11 期間中のビジネス素材の解釈は高い正確性が求められ、二次ビジネスラインでの異常サンプルの手動アノテーションに依存せず、データはより正確である必要があります。

対応策:TF-IDF モデル、FastText モデル、編集距離類似度、コサイン類似度、最長共通部分列など、信頼性が高く解釈性の強いアルゴリズムを選択し、識別の正確性を確保します。

技術ソリューション

システム全体は入力層、データ前処理層、モデル層、結果層、処理層の 5 つの層で構成されます。

入力層:データソースに応じて自動的に異なる読み取り方法を選択します。素材提出システムにはメッセージ同期または DB 同期方式を採用し、オフライン素材の読み取りには ODPS 同期方式を採用し、画像素材の読み取りには OCR 技術による素材抽出を利用します。

データ前処理層:入力層で識別されたデータに対して前処理を行います。商品タイトルや商品メリットポイントなどの長文テキストを NLP 技術により個々のエンティティ単語に分割し、分割後のエンティティ単語に対して NLP 技術による品詞タグ付けを行います。

モデル層(識別モジュール):識別モジュールには編集距離類似度モデル、コサイン類似度モデル、TF-IDF モデルが含まれます。

モデル層(分類モジュール):分類モジュールには最長共通部分文字列モデル、最長共通部分列モデル、FastText モデルが含まれます。

結果層:モデル層の分類結果に基づき、識別結果をタグ付けします。低品質な短いタイトル(商品 6 〜 8 の短いタイトル、最適化対象タイトルなど)、メリットポイントの短いタイトル(お手頃価格、低価格など)、プロモーション用短いタイトル(本日限りの特別価格、急いで購入してくださいなど)、大規模プロモーション用短いタイトル(ダブル 12 最終日の低価格、ダブル 11 史上最安値など)、低品質メリット(要修正、税関手続きなど)、過度な宣伝(全員 50% 割引さらに 50% 割引、損を覚悟で販売、売り切れなど)などに分類されます。

処理層:結果データのソースに応じて異なる処理方法が自動的に選択されます。オフライン結果データに対しては、モニターとアラートにより事業者に素材の修正を促し、指定期間内に素材を変更していない商品については権限処理を行います。オンライン素材データに対しては、理由を明示せずに同期的に検知・ブロックし、事業者に標準的な方法で素材コンテンツを入力するよう促すことで、大規模プロモーション素材を日常業務に保存して再利用可能にし、「一度の入力で複数回活用」を実現します。

アルゴリズムモデル

商品タイトルと完全タイトルの類似度を計算して異常な短いタイトルを識別し、商品メリットと低品質タイトルの類似度を計算して異常なメリットポイントを識別します。TF-IDF モデル、編集距離類似度、コサイン類似度、ユークリッド距離などの複合的な類似度を用いて低品質な短いタイトルを識別し、閾値を設定して類似度が閾値以下のタイトルを異常な短いタイトルとして抽出します。抽出されたタイトルに対してさらに fastText モデルで分類を行い、最終的に低品質、メリットポイント、スローガン、不一致テキスト、ショップ名などのタイプに分類します。

TF-IDF モデル

TF-IDF モデルの核心的な考え方は、自然言語テキストを単語ベクトルに変換することです。ここで単語ベクトルとは、辞書 D 内の任意の単語 w に対して固定次元の実数ベクトル v(m) を定めるもので、v(m) を単語 w の単語ベクトルと呼びます。2 つの文で使用される単語が似ていれば内容も似ているはずであるため、単語頻度からエンティティ単語のベクトルを構築し、ベクトルを通じて類似度を計算できます。

では、2 つのベクトルの類似度をどのように計算するのでしょうか。2 つのベクトルを空間内の 2 つの線分とみなし、どちらも原点 ([0, 0, ...]) から始まり異なる方向を指していると考えることができます。2 つの線分の間に夹角が形成されます。夹角が 0 度の場合、方向が同じで線分は重なり合います。夹角が 90 度の場合、直角を形成し方向は全く異なります。180 度の場合、正反対の方向を向いています。したがって、夹角の大小でベクトルの類似度を判断でき、角度が小さいほど似ています。短いタイトルベクトルを [x1, y1]、完全なタイトルベクトルを [x2, y2] とすると、コサインの法則により以下の式が成り立ちます。

この計算方法を n 次元ベクトルに拡張し、A と B を 2 つの n 次元ベクトルとして、A = [A1, A2, ..., An]、B = [B1, B2, ..., Bn] とすると、A と B の間の角度 θ のコサインは以下のようになります。

コサイン値が 1 に近いほど角度は 0 度に近く、すなわち 2 つのベクトルはより似ています。コサイン値が 0 に近いほど角度は 180 度に近く、2 つのベクトルの関連性が低いことを意味します。

具体的な例を見てみましょう。

商品の短いタイトル(sub_title):ドレープニットシャツ、商品タイトル(title):ポートドレープニットシャツウィメン。

単語分割 → sub_title:ドレープ / プリーツ / ニット / シャツ、title:ポート / ポート / ドレープ / プリーツ / ウィメン / ニット / T シャツ。

単語ベクトルの次元を記述:合計 8 次元の単語ベクトル → ポート、ポート、ドレープ、プリーツ、ウィメン、ニット、シャツ、T シャツ。

コサイン類似度の計算方法に基づき、短いタイトルとタイトルの類似度は 0.57 で、両者の間の角度は約 55 度となり、比較的似ていることがわかります。

fastText モデル

fastText モデルの入力は単語シーケンス、すなわちテキストの断片であり、その単語シーケンスが各カテゴリに属する確率を出力します。シーケンス内の単語とフレーズは特徴ベクトルを形成し、線形変換を通じて中間層にマッピングされ、中間層はさらにラベルにマッピングされます。

編集距離類似度

編集距離アルゴリズムは、2 つの文字列間で一方を他方に変換するために必要な最小編集操作回数を指します。距離が大きいほど、両者はより異なっていることを意味します。許可される編集操作には、文字を別の文字に置換する、文字を挿入する、文字を削除するが含まれ、編集関数 edit(i, j) を定義し、文字列 s1 の長さ i の部分文字列から文字列 s2 の長さ j の部分文字列への編集距離を表現します。

i == 0 かつ j == 0 の場合、edit(i, j) = 0。すなわち両者が空シーケンスの場合、編集距離は 0 です。

i == 0 かつ j > 0 の場合、edit(i, j) = j。すなわち s1 が空シーケンスで s2 の長さが j の場合、編集距離は s2 の長さ j です。

i > 0 かつ j == 0 の場合、edit(i, j) = i。すなわち s2 が空シーケンスで s1 の長さが i の場合、編集距離は s1 の長さ i です。

i >= 1 かつ j >= 1 の場合、edit(i, j) == min{ edit(i-1, j) + 1, edit(i, j-1) + 1, edit(i-1, j-1) + f(i, j) }。これは文字列 i から文字列 j へ変換する 3 つの方法(文字列 A の末尾の文字を削除、文字列 A の末尾に文字を追加、文字列 A の末尾の文字を文字列 B の末尾の文字で置換)を表し、それぞれの編集距離を計算した後に最小値を最終的な編集距離とします。

類似度の計算 = 1 - 編集距離 / Math.Max(str1.length, str2.length)。

認識効果

異常な短いタイトル
異常な短いタイトルを識別し、低品質短いタイトル、メリットポイント短いタイトル、プロモーションスローガン短いタイトル、ショップ名短いタイトルに分類しています。認識効果の一部は以下の通りです。

異常なメリットポイント
異常なメリットポイントを識別し、低品質メリットポイントと過度な宣伝メリットポイントに分類しています。認識効果の一部は以下の通りです。

今後の展望

機械知能は次第に新たな領域への入口となっています。今後は素材データを基盤に、アルゴリズム技術をさらに強化して素材管理を推進し、技術とプロダクトの融合を引き続き探求し、データとナレッジシステムを蓄積して消費者体験の向上を図り、消費者が目にする割引が本物で利用可能であることを確保すると同時に、事業者の商品素材の「一度の入力で複数回活用」を実現します。

技術面では、生成モデル、強化学習、機械読解、感情分析の分野をさらに深化させます。事業者素材の審査・削除体制を構築し、低品質素材をリアルタイムで検出します。

Related Articles

Explore More Special Offers

  1. Short Message Service(SMS) & Mail Service

    50,000 email package starts as low as USD 1.99, 120 short messages start at only USD 1.00

phone お問い合わせ
Hi, I'm Alibaba Cloud AI Assistant!
I can help with questions and solutions.