How does the knowledge graph born for e-commerce respond to user needs

1. 背景

2017 年 6 月のサービス開始以来、E コマース認知マップは実践から体系化への継続的な探求を通じて、比較的完成度の高い E コマースデータ認知システムを段階的に構築してきた。

現在、グループの事業領域が拡大する中で、データ相互接続への需要がますます強まっている。これはクロスドメイン検索、ショッピングガイド、インタラクションの基盤であり、ユーザーが真の意味での「ショッピング」を実現するための基本条件でもある。しかし、その前に現状の課題分析を行う必要がある。

1.1 課題

より複雑なデータ活用シナリオに対応するため、従来の E コマースだけでなく、ニューリテール、多言語対応、オンラインとオフラインが融合した複雑なショッピングシナリオにも直面しており、使用されるデータも従来のテキストの範囲を超えている。これらのデータには以下のような特徴が多く見られる。

非構造化:インターネット上の大量データは様々なソースに散在し、基本的に非構造化テキストで表現されている。現在のカテゴリ体系は商品管理の観点から長期間にわたり多くの作業を行ってきたが、それでも大量のデータをカバーする氷山の一角に過ぎない。これだけでは実際のユーザーニーズを理解するには到底不十分である。

ノイズが多い:従来のテキスト分析と異なり、現在のグループ内データの大部分はクエリ、タイトル、コメント、攻略などである。ユーザーの習慣やビジネス要件により、これらのデータは通常のテキストとは大きく異なる文法構造を持ち、また利益目的のノイズやダーティデータも多く含まれており、ユーザーニーズを正確に発見し構造化する上で大きな困難をもたらしている。

マルチモーダル・マルチソース:グループの事業拡大に伴い、現在の検索レコメンデーションは商品内のテキスト情報だけでなく、動画や画像もコンテンツとして大量に使用されている。様々なソースからのデータを統合し、マルチモーダルデータを関連付ける方法もデータ構築における難点の一つである。

データの分散と相互接続の欠如:現在の CPV システム構築の観点から見ると、各部署は事業の急速な発展により独自の CPV システムを維持する必要がある。これは商品管理や検索においても非常に重要な部分であるが、適用シーンの業界属性が異なるため、例えば Xianyu の「バッグアクセサリー」はビジネスシナリオの頻度が高いため細分化が必要なカテゴリである一方、Taobao 部署では取引検索の頻度が低いため、「シューズバッグアクセサリー」は小規模なカテゴリに過ぎない。これにより、各部署は独自の CPV システムでクエリや検索を苦労して維持し、毎回独自のカテゴリ体系を再構築し、ストレージクエリの再サポート、商品の再関連付け、カテゴリ予測の再実行などを行う必要がある。ビジネスニーズに基づいて比較的汎用的なアプリケーション指向概念システムを構築し、クエリサービスを提供することは急務である。

データの深い認知の不足:データの深い認知とは商品を認識することではなく、ユーザーニーズ間の関係を認識することである。例えば、バーベキュー調味料とツールを大量にクリックした場合、屋外バーベキューを行う必要があると認識できるが、このような機能が現在グループ全体で不足している。

1.2 需要分析

以下の背景紹介を通じて、グローバルに統一された知識表現とクエリフレームワークを構築するために以下の主要なタスクが必要であることを理解できる。

複雑シナリオにおけるデータ構造化:複雑なシナリオでは、まずデータクレンジングを行い、頻度フィルタリング、ルール、統計分析を通じてダーティデータを削除し、その後フレーズマイニングや情報抽出などの方法で有用性の高いデータを抽出し、データの構造化と階層分割を行う必要がある。

分散データの統一表現フレームワーク:分散データを管理するためには、まずグローバルスキーマ表現とストレージ方法を定義し、次にスキーマに基づいて属性マイニングと発見を行い、データを統合する必要がある。これは表現学習を通じて実現される。

データの深い認知:深い認知にはデータ自体の認知とデータ関連性の認知という 2 つの側面がある。商品自体の行動と情報を通じて、ユーザーの商品購入意図を認識できる。外部データの投入とまとめを通じて、商品体系外の常識とユーザーニーズの関連性を把握できる。

1.3 E コマース認知マップ

上記の課題を解決するため、我々は E コマース ConceptNet を提案した。目標は E コマース分野の知識体系を構築し、ユーザーニーズへの深い理解を通じて E コマースシーンにおける人・商品・市場の関係を実現し、ビジネス側や業界をエンパワーメントすることである。

1.3.1 モジュール分割
全体的な分割において、認知マップは 4 つの重要なタスクに分けられる。異なるタイプの概念(ユーザー、シーン、仮想カテゴリ、アイテム)を異種グラフとして構築し、ユーザー・シーン・商品の関連付けを実現する。

ユーザーグラフ構築:一般的なユーザープロファイル情報(年齢、性別、購買力)に加え、「高齢者向け」「子供向け」などの群衆データ、およびユーザーのカテゴリ属性プリファレンスデータを保持する。

1.3.2 シーングラフ構築

シーンはユーザーニーズの概念化と見なせる。既存のクエリやタイトルからユーザーニーズを識別し、「屋外バーベキュー」や「リゾートウェア」のような一般的なシーン概念に一般化する作業がシーングラフの主な作業である。シーンニーズの継続的な精緻化を通じて、カテゴリや業種を超えたユーザーニーズを表す概念をショッピングシーン(sc)として抽象化する。

概念のマイニングはグラフ上のノードを取得することに相当する。概念マイニングの基盤の上に、概念とカテゴリ間、概念と概念間の関係を構築し始め、これはグラフ上の有向エッジを確立することに相当し、エッジの強度を計算する。具体的なプロセスは以下の通りである。

現時点で、10 万以上の概念と 10 倍のカテゴリ関連性を生成済みである。

1.3.3 カテゴリ細分化

カテゴリ細分化の根源は、現在のカテゴリ体系が粗すぎるか細かすぎるかにあり、構築面から 2 つのレベルを含む。

カテゴリ集約:例えば「ワンピース」は認知レベルでは 1 つのカテゴリであるが、異なる業界の管理により「レディース」「メンズ」「子供服」などの異なるカテゴリに存在する。この場合、2 つの第 1 レベルカテゴリの下に、常識体系による「ワンピース」の認知を維持する必要がある。

カテゴリ分割:既存のカテゴリ体系ではユーザーニーズを十分に集約できないことが判明したため、より詳細なカテゴリが必要になった。例えば「チベット旅行」というシーンがあり、「スカーフ」カテゴリの下にさらに詳細な分類が必要である。この場合、「防風スカーフ」という仮想カテゴリが必要となる。このプロセスにはエンティティ/概念抽出と関係分類も含まれ、現在は主にカテゴリ間の関係を確立している。

現時点で、CPV カテゴリツリー、カテゴリ間関連性、外部ネットワークデータを統合した 68.9 万以上のペアを既に生成している。

1.3.4 商品グラフ構築

フレーズマイニング:商品マップ側で必要なのは、より多くの商品属性認識を行うことである。完全な CPV システムの前提はフレーズ認識である。そのため、ブートストラップフレームワークの下で CPV マイニングのクローズドループを確立した。目標は長期間にわたり効果的に CPV データを蓄積し、クエリと商品の認知を拡張することである(これは商品マーキングのデータソースの一つでもある)。

例:

現時点で、PV 上位 70 のカテゴリレビューを完了し、12 万以上の CPV ペアを追加した。用語を完全に認識できるクエリの割合は 30% から 60% に向上した(現在は中粒度の単語分割を使用しており、初期分析では 70% が上限であった。今後フレーズマイニングプロセスを追加して、マイニングカバレッジをさらに拡大していく)。現在、このデータはカテゴリ予測にされており、スマートインタラクションの基礎データは日次で生成されている。

商品マーキング:商品マーキングは知識と商品を関連付けるための重要な技術である。上記 3 つのポイントで生成されたデータは、最終的にマーキングを通じて商品との接続を確立する。商品マーキングが完了後、クエリから商品の意味認知までの完全なクローズドループを実現できる。


3 月末までに商品マーキングの初版を実現できる見込みである。

2. 知識体系

知識構築の過程で、グローバルに統一されたスキーマ表現体系が必要であることに徐々に気づいた。そのため、wordnet と conceptnet の体系構築プロセスを調査し、独自の概念表現体系を段階的に形成してきた。これが現在の認知マップ(E コマース ConceptNet)の中核であり、その目標は E コマース分野のユーザーニーズを意味レベルで理解し、概念化して意味オントロジーにマッピングし、語彙レベルの関係を通じてオントロジー間の関係を徐々に形式化することである。概念間のレベルはオントロジー間のレベルで表現され、エンティティカテゴリと関係は概念間の関係を通じて抽象化される。

データの観点から見ると、エンティティを記述するには、まずそれをカテゴリのインスタンスとして定義する必要があり、通常は概念で表現できる。概念には独自の異なる属性があり、あるクラスの概念の属性セットは概念のスキーマと呼べる。同じタイプのスキーマを持つ概念は通常異なるドメインに属し、ドメインは独自の意味オントロジーを持つ。オントロジーの階層(例:「イングランド」-is-part-of-「イギリス」)を通じて、概念の階層と表現を形式化できる。そして、細から粗へ、E コマースの概念体系の一連の表現方法を定義し、オントロジーと概念、およびそれらの間の関係を継続的に精緻化することで、ユーザーと商品、さらには外部エンティティを関連付ける。

3. 技術フレームワーク

3.1 プラットフォームモジュール

一般的に、データサービスプラットフォームを使用して上記のグラフエンジンをサポートし、Qianmo データ管理プラットフォームと Turing ビジネスドッキングプラットフォームを通じて知識の生産と利用を実現している。

3.2 モジュール詳細

Qianmo:データラベリングと表示

E コマース知識グラフの基礎プラットフォームとして、Qianmo は現在すべての知識ラベリングとレビュープロセスを統合し、データのクエリと可視化を提供している。今後、アルゴリズムによる概念マイニングサービスと商品マーキングサービスも Qianmo を通じて提供される予定である。

データレビューの試行錯誤を続ける中で、初期レビューから最終レビューまでの比較的完全なプロセスを確立した。詳細は Qianmo レビューツールを参照。

可視化:Qianmo はレビュープラットフォームに加え、より詳細な形式のデータ可視化も提供しており、良好なインタラクションを通じて知識クエリを容易にする。

3.3 Turing:全サービスの選択と公開

現在、知識の大部分はカード形式で提供されているため、Turing はクラウドテーマを通じて公開される完全なビジネスサービスツールセットを提供している。

概念選択:

ユーザーはサブチャネル配信のために独自のテーマをすべて選択できる。

3.4 Graph Engine:データストレージとクエリ

ストレージメディアとして、フレキシブルなアノテーションには MySQL を、フルクエリにはグラフデータベースを、永続データバージョン管理には ODPS を使用している。

データは iGraph と BigGraph にインポートされる前に、ポイントテーブルとエッジテーブルに分割され、オンラインクエリは Gremlin を通じて実行される。

グラフデータベースの上層には、グラフエンジンモジュールをカプセル化して、異なるトリガーとマルチチャネルマルチホップリコール機能を持つシナリオを商品に提供している。現在、user、item_list、query のリコールが提供されており、Miaoxiaomi で使用されており、検索発見との共同デバッグでは、クエリインターフェースを通じてクエリとテストを行える。

3.5 技術着地

クラウドテーマ(認知マップ):現在、約 10,000 のシーンがナレッジカードの形式でクラウドテーマに公開されている。ファーストゲス商品と比較して、クリックとダイバージェンスは商品に比べて大幅に改善されており、現在データダイバージェンスを探っている。

Related Articles

Explore More Special Offers

  1. Short Message Service(SMS) & Mail Service

    50,000 email package starts as low as USD 1.99, 120 short messages start at only USD 1.00

phone お問い合わせ
Hi, I'm Alibaba Cloud AI Assistant!
I can help with questions and solutions.