How to solve the problem of lengthy product titles
概要
Taobao や Tmall などの EC プラットフォームでは、マーチャントが SEO 対策のために冗長な商品タイトルを記載することが多い。特にモバイルアプリ側の表示スペースが限られるシナリオでは、長すぎる商品タイトルは完全に表示されず、途中で切り詰められることが多く、ユーザー体験に深刻な影響を及ぼしている。元の商品タイトルを全体の取引に影響を与えずに所定の長さに圧縮する方法は、非常に困難な課題である。
従来のタイトル要約手法は、多くの手動前処理を必要とし、コストがかかるうえ、EC シナリオにおけるクリック率や転換率などの指標に対する特別な考慮がなされていなかった。これに基づき、ユーザー検索ログを活用したマルチタスク学習による商品タイトル圧縮手法を提案する。
本手法は 2 つの Sequence-to-Sequence 学習タスクを同時に実行する。メインタスクは Pointer Network モデルに基づく元タイトルからショートタイトルへの抽出型要約であり、補助タスクはアテンションメカニズム付きのエンコーダーデコーダーモデルに基づく元タイトルからの検索クエリ生成である。2 つのタスク間でネットワークエンコーディングパラメータを共有し、トレーニングプロセス中に元タイトルに対する両者のアテンション分布を共同で最適化する。これにより、2 つのタスクの元タイトル中の重要情報に対するアテンションを可能な限り一致させる。
オフラインでの人手評価とオンライン実験により、マルチタスク学習手法で生成された商品ショートタイトルは、元の商品タイトルの中核情報を保持するだけでなく、ユーザーの検索クエリ情報も反映しており、取引転換に影響を与えないことが実証されている。
研究背景
商品タイトルは、EC プラットフォーム上で売り手と買い手がコミュニケーションを図る重要な手段である。ユーザーは検索入口でクエリを入力し、検索結果ページ (SRP) で商品リストを閲覧し、対象商品を選択して、最終的に購入を完了する。ショッピング取引の全プロセスにおいて、商品タイトル、商品説明、商品画像などのさまざまな情報がユーザーの購買決定に複合的に影響する。情報量が豊富でありながら冗長でないタイトルは、エンドユーザーの体験を大きく向上させる。
第 40 回「中国インターネット発展状況統計報告」によると、2017 年 6 月時点で中国のモバイルインターネットユーザー数は 7 億 2,400 万人に達し、携帯電話を利用したインターネットアクセスの割合は 2016 年末の 95.1% から 96.3% に上昇した。オンライン購入は PC 側からモバイルアプリ側へとますます移行しており、両者の差はさらに拡大し続けている。そのため、主要 EC プラットフォームのリソースもそれぞれのアプリに重点が置かれている。PC とアプリの最も顕著な違いは表示画面サイズである。通常、スマートフォンの表示画面は 4.5 インチから 5.5 インチであり、PC の画面サイズよりはるかに小さく、アルゴリズムとプロダクト設計に新たな要件をもたらしている。
現在、Taobao の商品タイトルは主にマーチャントが作成している。検索再現率を向上させ、取引を促進するため、マーチャントはタイトルに多くの冗長なキーワードを詰め込みがちである。ユーザーがモバイルデバイスで閲覧する際、長すぎる商品タイトルは画面サイズの制約により表示が不完全となり、途中で切り詰められる結果、ユーザー体験に深刻な影響を及ぼしている。
図 1 に示すように、SRP ページでは商品の元タイトルは完全に表示されず、約 14 文字のショートタイトルしか表示できない。ユーザーが完全なタイトルを取得するには、さらにクリックして商品詳細ページに入る必要がある。商品の元タイトルは 30 語近くある。さらに、パーソナライズされたプッシュや推薦シナリオでは、商品のショートタイトルが情報の主体であり、長さにも一定の制限がある。可能な限り短いテキストで商品の中核的な属性を表現し、ユーザーのクリックや閲覧への関心を喚起して、転換率を向上させる方法は、深く研究すべき課題である。
既存手法の紹介
テキスト要約 (圧縮) は、自然言語処理における重要な研究分野の一つである。要約の生成方法により、抽出型と生成型の 2 種類に分類できる。抽出型は、その名の通り、要約の文や単語が元テキストから抽出されるのに対し、生成型はより柔軟で、要約中の文や単語が元テキストから抽出される必要はない。従来の抽出型要約手法は、大まかに貪欲法、グラフベース法、制約付き最適化法に分類できる。近年、ニューラルネットワーク手法もテキスト要約分野に応用され、特に生成型要約手法で顕著な進歩を遂げている。業界の既存手法は、記事の長さの圧縮を最適化目標としてテキスト要約を実現している。EC シナリオでは、テキスト圧縮率以外にも考慮すべき点がある。商品タイトルの長さを全体の取引転換率に影響を与えずに短縮する方法は、業界における難題となっている。
手法の紹介
図 2 に示すように、本論文で提案するマルチタスク学習手法は 2 つの Sequence-to-Sequence タスクから構成される。メインタスクは商品タイトルの圧縮で、元の商品タイトルからショートタイトルを生成する。Pointer Network モデルを用い、アテンションメカニズムを通じて元タイトルからキーワードを選択して出力する。補助タスクは検索クエリの生成で、元の商品タイトルからアテンションメカニズム付きのエンコーダーデコーダーモデルを用いて生成する。2 つのタスクはエンコーディングネットワークのパラメータを共有し、両者の元タイトルに対するアテンション分布を共同で最適化することで、元タイトル中の重要情報へのアテンションを可能な限り一致させる。補助タスクの導入により、メインタスクは元タイトルからより情報量が多く、ユーザーのクリックを促しやすい語をより効果的に保持できる。対応して、2 つのタスクのトレーニングデータを構築する。メインタスクでは女性服カテゴリの商品元タイトルと、モバイル Taobao 推薦チャネルの専門家が書き直した商品ショートタイトルを使用する。補助タスクでは女性服カテゴリの商品元タイトルと、取引を誘導する対応するユーザー検索クエリを使用する。
主な貢献
本論文のマルチタスク学習手法による商品タイトル圧縮は、生成された商品ショートタイトルがオフライン自動評価、人手評価、オンライン評価のすべてにおいて従来の抽出型要約手法を上回る性能を示した。
エンドツーエンドのトレーニング手法により、従来の手法で必要とされた大量の手動前処理や特徴量エンジニアリングを回避できる。
マルチタスク学習におけるアテンション分布の一貫性設計により、最終的な商品ショートタイトルは元タイトル中の重要な語、特に取引を誘導する中核的な語を反映でき、他の EC シナリオにも大きな意義を持つ。
実験結果
Taobao の女性服カテゴリの商品タイトルデータを使用して実験を行い、5 つの異なるテキスト要約手法を比較した。1 つ目はベースライン手法で、目標長に従い直接切り捨てる方法 (Trunc.) である。2 つ目は従来の整数線形計画法 (ILP) で、タイトルに対して単語分割、NER、項重み付けなどの前処理を必要とする。3 つ目は Pointer Network を用いたエンコーダーデコーダー抽出手法 (Ptr-Net) である。4 つ目はマルチタスク学習手法で、2 つのサブタスクの損失関数を直接合計したものを全体の損失関数として最適化する (Vanilla-MTL) 方法である。5 つ目は本論文で提案するアテンション分布の一貫性を考慮したマルチタスク学習手法 (Agree-MTL) である。
異なる手法の自動評価比較
表 1 は、生成されたショートタイトルと参照ショートタイトルの間で 3 種類の ROUGE スコアを計算し、自動評価結果として異なるテキスト要約手法を比較している。本論文で提案するマルチタスク学習手法は、他のいくつかの手法を大幅に上回る性能を示している。
異なる手法の人手評価比較
表 2 は異なる手法で生成された商品ショートタイトルの人手評価比較を示している。EC シナリオの商品の中核商品ワードは比較的デリケートであるため、一般的な可読性と情報性の指標に加え、異なる手法で生成されたショートタイトルの中核商品ワードが正確かも比較した。表 2 の結果から、本論文で提案する手法は 3 つの指標すべてで他の手法を上回っている。
オフライン自動評価と人手評価に加え、実際のオンライン環境での AB テストも実施した。従来のオンライン ILP 圧縮法と比較して、本論文で提案するマルチタスク学習手法は CTR で 2.58 ポイント、CVR で 1.32% の向上を実現した。
図 3 は異なる手法で生成された商品ショートタイトルの例を示している。前処理結果の影響を受け、直接切り捨てと ILP ベースライン手法で生成されたショートタイトルは流暢性と可読性が低い。一方、Ptr-Net とマルチタスク学習は Sequence-to-Sequence 手法に属し、生成されたショートタイトルの可読性は両ベースラインを上回っている。図 3 の左側の例は、本手法で生成されたショートタイトルがユーザーの高頻度検索クエリに出現する語を含むことを示している。ユーザーは検索クエリで中国語ブランド名の代わりに英語ブランド名を使用することが多く、これが取引促進に寄与する。
総括
マーチャントによる過度な SEO 対策のため、C2C EC プラットフォームの商品タイトルは通常冗長で長く、モバイルアプリ側では完全に表示できない。この問題を解決するため、本論文では抽出型要約手法を用いて冗長な商品タイトルを圧縮する。
従来の要約手法は、元タイトルのセマンティクスを保持しながらタイトルの圧縮を実現するのみで、EC シナリオにおける圧縮後の商品のクリック率や取引転換率への影響を考慮していなかった。EC プラットフォームには大量のユーザー検索クエリと商品取引情報が蓄積されている。このデータを活用することで、より戦略的に元の長いタイトルを圧縮できる。
そこで、2 つのシーケンス学習サブタスクを含むマルチタスク学習によるタイトル圧縮手法を提案する。メインタスクは Pointer Network モデルに基づく元タイトルからショートタイトルへの抽出型要約生成であり、補助タスクはアテンションメカニズムを搭載したエンコーダーデコーダーモデルに基づく元タイトルから対応する商品のユーザー検索クエリ生成である。2 つのタスク間でエンコーディングパラメータを共有し、2 つのサブタスクの元タイトルに対するアテンション分布を可能な限り一致させるように共同最適化する。これにより、メインタスクで生成されるショートタイトルは、元の商品タイトルの中核情報を保持しつつ、取引転換を促進するキーワードをより反映するようになる。
オフラインでの人手評価とオンライン実験により、本手法で生成されたショートタイトルは、取引転換率に影響を与えることなく、可読性、情報性、商品中核ワードの正確性において従来の要約手法を上回ることが実証された。
Taobao や Tmall などの EC プラットフォームでは、マーチャントが SEO 対策のために冗長な商品タイトルを記載することが多い。特にモバイルアプリ側の表示スペースが限られるシナリオでは、長すぎる商品タイトルは完全に表示されず、途中で切り詰められることが多く、ユーザー体験に深刻な影響を及ぼしている。元の商品タイトルを全体の取引に影響を与えずに所定の長さに圧縮する方法は、非常に困難な課題である。
従来のタイトル要約手法は、多くの手動前処理を必要とし、コストがかかるうえ、EC シナリオにおけるクリック率や転換率などの指標に対する特別な考慮がなされていなかった。これに基づき、ユーザー検索ログを活用したマルチタスク学習による商品タイトル圧縮手法を提案する。
本手法は 2 つの Sequence-to-Sequence 学習タスクを同時に実行する。メインタスクは Pointer Network モデルに基づく元タイトルからショートタイトルへの抽出型要約であり、補助タスクはアテンションメカニズム付きのエンコーダーデコーダーモデルに基づく元タイトルからの検索クエリ生成である。2 つのタスク間でネットワークエンコーディングパラメータを共有し、トレーニングプロセス中に元タイトルに対する両者のアテンション分布を共同で最適化する。これにより、2 つのタスクの元タイトル中の重要情報に対するアテンションを可能な限り一致させる。
オフラインでの人手評価とオンライン実験により、マルチタスク学習手法で生成された商品ショートタイトルは、元の商品タイトルの中核情報を保持するだけでなく、ユーザーの検索クエリ情報も反映しており、取引転換に影響を与えないことが実証されている。
研究背景
商品タイトルは、EC プラットフォーム上で売り手と買い手がコミュニケーションを図る重要な手段である。ユーザーは検索入口でクエリを入力し、検索結果ページ (SRP) で商品リストを閲覧し、対象商品を選択して、最終的に購入を完了する。ショッピング取引の全プロセスにおいて、商品タイトル、商品説明、商品画像などのさまざまな情報がユーザーの購買決定に複合的に影響する。情報量が豊富でありながら冗長でないタイトルは、エンドユーザーの体験を大きく向上させる。
第 40 回「中国インターネット発展状況統計報告」によると、2017 年 6 月時点で中国のモバイルインターネットユーザー数は 7 億 2,400 万人に達し、携帯電話を利用したインターネットアクセスの割合は 2016 年末の 95.1% から 96.3% に上昇した。オンライン購入は PC 側からモバイルアプリ側へとますます移行しており、両者の差はさらに拡大し続けている。そのため、主要 EC プラットフォームのリソースもそれぞれのアプリに重点が置かれている。PC とアプリの最も顕著な違いは表示画面サイズである。通常、スマートフォンの表示画面は 4.5 インチから 5.5 インチであり、PC の画面サイズよりはるかに小さく、アルゴリズムとプロダクト設計に新たな要件をもたらしている。
現在、Taobao の商品タイトルは主にマーチャントが作成している。検索再現率を向上させ、取引を促進するため、マーチャントはタイトルに多くの冗長なキーワードを詰め込みがちである。ユーザーがモバイルデバイスで閲覧する際、長すぎる商品タイトルは画面サイズの制約により表示が不完全となり、途中で切り詰められる結果、ユーザー体験に深刻な影響を及ぼしている。
図 1 に示すように、SRP ページでは商品の元タイトルは完全に表示されず、約 14 文字のショートタイトルしか表示できない。ユーザーが完全なタイトルを取得するには、さらにクリックして商品詳細ページに入る必要がある。商品の元タイトルは 30 語近くある。さらに、パーソナライズされたプッシュや推薦シナリオでは、商品のショートタイトルが情報の主体であり、長さにも一定の制限がある。可能な限り短いテキストで商品の中核的な属性を表現し、ユーザーのクリックや閲覧への関心を喚起して、転換率を向上させる方法は、深く研究すべき課題である。
既存手法の紹介
テキスト要約 (圧縮) は、自然言語処理における重要な研究分野の一つである。要約の生成方法により、抽出型と生成型の 2 種類に分類できる。抽出型は、その名の通り、要約の文や単語が元テキストから抽出されるのに対し、生成型はより柔軟で、要約中の文や単語が元テキストから抽出される必要はない。従来の抽出型要約手法は、大まかに貪欲法、グラフベース法、制約付き最適化法に分類できる。近年、ニューラルネットワーク手法もテキスト要約分野に応用され、特に生成型要約手法で顕著な進歩を遂げている。業界の既存手法は、記事の長さの圧縮を最適化目標としてテキスト要約を実現している。EC シナリオでは、テキスト圧縮率以外にも考慮すべき点がある。商品タイトルの長さを全体の取引転換率に影響を与えずに短縮する方法は、業界における難題となっている。
手法の紹介
図 2 に示すように、本論文で提案するマルチタスク学習手法は 2 つの Sequence-to-Sequence タスクから構成される。メインタスクは商品タイトルの圧縮で、元の商品タイトルからショートタイトルを生成する。Pointer Network モデルを用い、アテンションメカニズムを通じて元タイトルからキーワードを選択して出力する。補助タスクは検索クエリの生成で、元の商品タイトルからアテンションメカニズム付きのエンコーダーデコーダーモデルを用いて生成する。2 つのタスクはエンコーディングネットワークのパラメータを共有し、両者の元タイトルに対するアテンション分布を共同で最適化することで、元タイトル中の重要情報へのアテンションを可能な限り一致させる。補助タスクの導入により、メインタスクは元タイトルからより情報量が多く、ユーザーのクリックを促しやすい語をより効果的に保持できる。対応して、2 つのタスクのトレーニングデータを構築する。メインタスクでは女性服カテゴリの商品元タイトルと、モバイル Taobao 推薦チャネルの専門家が書き直した商品ショートタイトルを使用する。補助タスクでは女性服カテゴリの商品元タイトルと、取引を誘導する対応するユーザー検索クエリを使用する。
主な貢献
本論文のマルチタスク学習手法による商品タイトル圧縮は、生成された商品ショートタイトルがオフライン自動評価、人手評価、オンライン評価のすべてにおいて従来の抽出型要約手法を上回る性能を示した。
エンドツーエンドのトレーニング手法により、従来の手法で必要とされた大量の手動前処理や特徴量エンジニアリングを回避できる。
マルチタスク学習におけるアテンション分布の一貫性設計により、最終的な商品ショートタイトルは元タイトル中の重要な語、特に取引を誘導する中核的な語を反映でき、他の EC シナリオにも大きな意義を持つ。
実験結果
Taobao の女性服カテゴリの商品タイトルデータを使用して実験を行い、5 つの異なるテキスト要約手法を比較した。1 つ目はベースライン手法で、目標長に従い直接切り捨てる方法 (Trunc.) である。2 つ目は従来の整数線形計画法 (ILP) で、タイトルに対して単語分割、NER、項重み付けなどの前処理を必要とする。3 つ目は Pointer Network を用いたエンコーダーデコーダー抽出手法 (Ptr-Net) である。4 つ目はマルチタスク学習手法で、2 つのサブタスクの損失関数を直接合計したものを全体の損失関数として最適化する (Vanilla-MTL) 方法である。5 つ目は本論文で提案するアテンション分布の一貫性を考慮したマルチタスク学習手法 (Agree-MTL) である。
異なる手法の自動評価比較
表 1 は、生成されたショートタイトルと参照ショートタイトルの間で 3 種類の ROUGE スコアを計算し、自動評価結果として異なるテキスト要約手法を比較している。本論文で提案するマルチタスク学習手法は、他のいくつかの手法を大幅に上回る性能を示している。
異なる手法の人手評価比較
表 2 は異なる手法で生成された商品ショートタイトルの人手評価比較を示している。EC シナリオの商品の中核商品ワードは比較的デリケートであるため、一般的な可読性と情報性の指標に加え、異なる手法で生成されたショートタイトルの中核商品ワードが正確かも比較した。表 2 の結果から、本論文で提案する手法は 3 つの指標すべてで他の手法を上回っている。
オフライン自動評価と人手評価に加え、実際のオンライン環境での AB テストも実施した。従来のオンライン ILP 圧縮法と比較して、本論文で提案するマルチタスク学習手法は CTR で 2.58 ポイント、CVR で 1.32% の向上を実現した。
図 3 は異なる手法で生成された商品ショートタイトルの例を示している。前処理結果の影響を受け、直接切り捨てと ILP ベースライン手法で生成されたショートタイトルは流暢性と可読性が低い。一方、Ptr-Net とマルチタスク学習は Sequence-to-Sequence 手法に属し、生成されたショートタイトルの可読性は両ベースラインを上回っている。図 3 の左側の例は、本手法で生成されたショートタイトルがユーザーの高頻度検索クエリに出現する語を含むことを示している。ユーザーは検索クエリで中国語ブランド名の代わりに英語ブランド名を使用することが多く、これが取引促進に寄与する。
総括
マーチャントによる過度な SEO 対策のため、C2C EC プラットフォームの商品タイトルは通常冗長で長く、モバイルアプリ側では完全に表示できない。この問題を解決するため、本論文では抽出型要約手法を用いて冗長な商品タイトルを圧縮する。
従来の要約手法は、元タイトルのセマンティクスを保持しながらタイトルの圧縮を実現するのみで、EC シナリオにおける圧縮後の商品のクリック率や取引転換率への影響を考慮していなかった。EC プラットフォームには大量のユーザー検索クエリと商品取引情報が蓄積されている。このデータを活用することで、より戦略的に元の長いタイトルを圧縮できる。
そこで、2 つのシーケンス学習サブタスクを含むマルチタスク学習によるタイトル圧縮手法を提案する。メインタスクは Pointer Network モデルに基づく元タイトルからショートタイトルへの抽出型要約生成であり、補助タスクはアテンションメカニズムを搭載したエンコーダーデコーダーモデルに基づく元タイトルから対応する商品のユーザー検索クエリ生成である。2 つのタスク間でエンコーディングパラメータを共有し、2 つのサブタスクの元タイトルに対するアテンション分布を可能な限り一致させるように共同最適化する。これにより、メインタスクで生成されるショートタイトルは、元の商品タイトルの中核情報を保持しつつ、取引転換を促進するキーワードをより反映するようになる。
オフラインでの人手評価とオンライン実験により、本手法で生成されたショートタイトルは、取引転換率に影響を与えることなく、可読性、情報性、商品中核ワードの正確性において従来の要約手法を上回ることが実証された。
Related Articles
-
A detailed explanation of Hadoop core architecture HDFS
Knowledge Base Team
-
What Does IOT Mean
Knowledge Base Team
-
6 Optional Technologies for Data Storage
Knowledge Base Team
-
What Is Blockchain Technology
Knowledge Base Team
Explore More Special Offers
-
Short Message Service(SMS) & Mail Service
50,000 email package starts as low as USD 1.99, 120 short messages start at only USD 1.00
