How does Magic Horse Search improve the timeliness of search?

I. 問題の定義

新鮮性をどう理解するか。古くから「四方を宇といい、古今を宙という」と言われるように、時間はすべての事象を貫いており、時間感知の唯一の基準は変化である。相対的な変化が難しいほど、時間の流れは遅くなると考えられる。光速に近づくと、変化を起こしにくいため時間が遅くなるのである。

コンテンツ側から見た新鮮性の理解

情報シナリオにおける新鮮性の定義基準も変化する。

情報の価値は時間とともに変化する。一般的に、情報の価値は時間とともに低下し、無効化していく。これは物理学における放射性崩壊とよく似ている。物理学の観点から、情報の新鮮性半減期という概念を定義する。情報の相対的価値が半分に低下するのに必要な時間である。記事に時間を定義するとすれば、記事が公開された時点の情報量を 100 と仮定し、情報量が 50 に減衰するのに必要な時間がその記事の半減期となる。

需要側から見た新鮮性の理解

検索シナリオにおける新鮮性の定義基準も変化する。

検索に対する最適な回答は時間とともに変化する。異なるクエリに対して、変化の速度は異なる。要件に対する最適な回答の変化頻度について、時間感度という概念を定義する。ユーザーの時間に対する感度が高いほど、新しいコンテンツを求めており、コンテンツの新鮮性と総合満足度の相関が高くなる。

普遍的な新鮮性

新鮮性は、需要発生の時間分布から大まかに 3 つのカテゴリに分類できる。突発的新鲜性、定期的新鮮性、普遍的新鮮性である。

具体的な分類は次の図を参照されたい。この記事の核心は、普遍的新鮮性の紹介と解決にある。

突発的・定期的な新鮮性とは異なり、普遍的新鮮性クエリの時間分布は一般検索クエリとほぼ同じで、時系列分析的にもほぼ定常的である。

たとえば、杭州の西湖の通行制限、Alibaba の時価総額、蕭山空港から Alibaba 西渓パークへの便利な行き方、今年最も人気のあるレディースファッションのスタイル、杭州のおすすめ店舗、霊隠寺周辺の宿泊施設推奨などがある。

以上で、コンテンツ側と需要側の新鮮性に関連する 2 つの定量的指標、新鮮性半減期と時間感度を導入した。便宜上、これら 2 つの指標の強度を 5 段階に分類する。

II. 評価基準

あらゆる問題の最適化の前提は、測定の基準を知ることである。新鮮性も例外ではない。最適化前に、合理的な評価方案を策定すべきである。第一に、現状を把握し、ケース分類と比率分析を行って、的を絞った最適化を実施できる。第二に、最適化後、比較を通じて全体の指標が改善されたことを確認できる。

新鮮性最適化評価の前から、検索自体には総合満足度評価スコアが存在する。しかし、総合満足度スコアは新鮮性を強く反映していない。新鮮性が明らかにニーズを満たさない場合にのみ減点されるだけで、比較的弱い対応である。新鮮性の問題をより明確に浮き彫りにするため、新鮮性満足度の採点基準を別途構築し、2 つの基準で同時に評価を実施している。

神馬検索の満足度と同様に、Top3 の結果に対して 3 点満点で評価し、結果がニーズを満たさない場合は新鮮性満足度から減点する方式を採用している。

減点基準

以下のルールに該当する場合に減点される。

・8 年以上経過した古い情報。例:「他人が自分のパソコンを操作したかどうかをどう確認するか。2009 年のニュース」。

・情報が無効化しており、ウェブページの内容が期限切れである。ページがニュース、求人、ダウンロードなど時間感度の高いページタイプの場合、より厳格に時間を管理し、1〜2 年以内に収めるべきである。

・時間が古すぎる場合、クエリの時間感度と結果の更新頻度に基づき総合的に判断する。一般的に、5 年以上経過した結果を基準に古いと判定する。

・時間表示とコンテンツの内容が一致していない。

・結果が最新のイベントを反映していない。

採点プロセス

・クエリと結果の感度測定を実施する。

・まず時間の無効性を判定し、次に情報の無効化、時間の古さ、内外の時間不一致、イベントの最新性を判定する。各項目につき 1 点減点する。

・デッドリンクは別途減点する。

・簡易小説クエリは当面評価対象外とし、ダウンロード需要は通常通り評価する。

注意点

・時間感度のあるクエリは、その感度に応じて判定する。たとえば「クーポンの使用期限超過」、「新しい Q&A パソコンのトラブルシューティング - 回答は XP システムの方法」は情報無効である。

・動画リソースの再生とダウンロードについて:時間表示と紹介があり、再生の可否が確認できる場合は、時間に基づいて採点する。時間表示がなく、紹介に対応し、再生できない情報が無効または低品質な場合は、最新の新鮮性として扱い、減点しない。

III. 全体の取り組み方針

普遍的新鮮性プロジェクトに取り組む前に、突発的新鲜性への対応を経験している。ルール最適化 → 移行モデル → 抽象的特徴 → モデル改良の 4 つの段階を経た。プロジェクトを進める際、まずプロジェクト全体の最適化方針を確定し、基盤となる特徴から上位モデルへと進めるアプローチが有効であることが分かった。この方針は安定的に反復できる。初期段階では特徴の設計と最適化が困難だが、後期の効果改善は顕著で、反復スピードも速く、レベルが明確で整理されており、問題の特定と最適化が容易である。

以上の経験から、まず基礎特徴の最適化から着手し、その後タグ付けデータを活用してランキングとリコールモデルの最適化を進めるべきだと考えている。

IV. 基礎特徴の最適化

ウェブページの新鮮性特徴

時間抽出

時間抽出は新鮮性ランキングの最も基礎的な特徴である。時間を抽出する際、まずページの時間を定義する必要がある。ページの時間は主に以下のカテゴリに分かれる。ページコンテンツ時間、ページ更新時間、ページ公開時間、ページ発見時間である。

・ウェブコンテンツ時間:ウェブページで記述されているコンテンツの時間である。たとえば、あるウェブページが 1945 年の第二次世界大戦終結について記述している場合、このページのコンテンツ時間は 1945 年である。2018 年北京オリンピック開会式について紹介している場合は 2018 年 8 月 8 日となる。現在のウェブコンテンツ時間は、すべてのウェブコンテンツ時間からコンテンツを最も代表できる時間であり、アノテーションデータに基づくランキングモデルで実装されている。

・ウェブページ公開時間:一般的にウェブページの生成時間を指し、通常はそのウェブページのリンクの作成時間を意味する。ニュースや中古取引などのコンテンツページでは、ウェブページの公開時間は一般的にページ上に明示されている。

・ウェブページ更新時間:一般的にウェブページのメインコンテンツが最後に変更された時間を指す。一般的なニュースや一般記事ページは生成後に更新されないため、最終更新時間は一般的にウェブページが公開された時間と一致する。

・ウェブページ発見時間:一般的に、検索エンジンのクローラーがウェブページのリンクを発見した時間を指す。クローラーのリンクフローには一定の時間ウィンドウとコンテンツアイランドが必要なため、ウェブページ発見時間はウェブページ公開時間より大幅に遅れる可能性がある。

・ウェブページが初めてインデックスに登録される時間:ウェブページはクローラーに発見されても即座にクロール・解析されない場合があるため、初めてインデックスに登録される時間はウェブページ発見時間より大幅に遅れる可能性がある。

・ウェブページ時間:ウェブページの価値を最も代表する時間である。一般的に、これら 5 つの時間から選択する。現在はルールベースの方法で時間を選択している。

ルールの主な方法は以下の通りである。

・ニュースなどのコンテンツページについて、テンプレートとルールでページの公開時刻を明確に抽出できる場合、その時刻をページ時間として選択する。

・複数の時間に重大な不一致がある場合、信頼度の高い時間を優先する。たとえばページ発見時間やページが初めてインデックスに登録された時間などである。

時間感度(新鮮性半減期)

ウェブページの時間感度は、ウェブページ情報の減衰率である。新鮮性半減期という指標でウェブページ時間の減衰率を測定する。すなわち、ウェブページの情報が現在の情報量の半分まで減衰するのに必要な時間である。

明確な時間として、半減期を定量的にラベル付けすることは困難である。簡便のため、半減期を定性的に離散化し、ラベル付きデータからウェブページの半減期を学習する。

ディメンションデータのガイドライン:

1) 時間感度アノテーション

時間感度アノテーションでは、アノテーション担当者がコンテンツの新鮮性をできるだけ理解できるように、非常に明確な詳細ルールは定義せず、例示で補足している。核心は、担当者にコンテンツの時間感度を体感させ、効果的に考えられるようにすることである。アノテーションルールの学習に近いアプローチを避けることで、より高品質なデータを得られる。

大まかなガイドラインのアノテーションによりデータ品質は向上したが、以下のような課題もある。

・アノテーション担当者のトレーニングコストが非常に高く、担当者の研修に多くの時間を要した。同時にケース説明を実施し、約 1 か月にわたって継続した。

・アノテーションの一致率が低い。プロジェクト開始当初、5 人のクロスグレード一致率(5 人中 3 人以上が隣接グレードをマーク)は 50% 未満であった。プロジェクト最終段階でも、5 人のシングルグレード一致率(5 人中 3 人以上が同一グレードをマーク)は約 60% で、クロスグレード一致率は 70%〜80% の間で変動した。

2) 時間感度モデル

現在、モデルは Pairwise と PointWise の 2 つを使用している。

・Pairwise モデルが出力する連続値はより高い解像度を持ち、上位ランキングの基礎特徴としてより適している。

・PointWise モデルは主に 0、1、2 以上の離散値を出力し、主に上位ランキングのインデックス選択や擬似フィードバックマーク特徴に使用される。リコール結果の時間感度ページの分布を統計することで、クエリの時間感度を逆推論する。これについては後で詳しく説明する。

ページ情報無効化

ページの時間感度は定義されているが、時間感度のあるページの一部は、一定期間経過後に自然価値が低下する。このような页面的な情報無効化の定義は難しいが、明確な時間境界を持つページについては、情報無効化を明確に定義できる。

たとえば、中古取引、組織活動、不動産情報などの情報公開ページは、明確な時間境界を持つ。取引が成立した、商品が下架された、または活動期間が終了した場合、明確に定義できる。これを情報無効化ページと呼ぶ。このページは新鮮性価値が 0 と見なすことができ、厳しいケース抑制が必要である。これについても後続のランキングモジュールで紹介する。

この種のページの識別は、現在ルールベースで異なるサイトやタイプのページを識別している。

需要の新鮮性特徴

需要の時間感度

クエリの時間感度は、ウェブページと同じ概念である。

クエリの時間感度:クエリが必要とするページの時間感度である。リコール結果のページから時間感度を逆推論できる。

クエリの時間感度は新鮮性結果のリコールと新鮮性結果の粗ランキングに関連する。したがって、リコール結果の分析を通じてオンラインで取得することはできない。クエリ側で直接分析してクエリの時間感度を取得する必要がある。

クエリ時間感度モデルは主に 3 つのバージョンの反復を経ている。ここで簡単に紹介する。

1) 第 1 版:時間感度語のアテンションメカニズムに基づく ABCNN モデル

いくつかの時間感度パターンにアテンションを適用し、クエリが時間感度語とマッチするかどうかを判定する。クエリとこれらの時間感度語とのマッチングが検索コーパス内で合理的かつ一般的であれば、このクエリが時間感度クエリである確率が高くなる。主に使用されるマッチング語は「最新」「最近」「今年」「年」「今日」などである。

2) 第 2 版:擬似フィードバックに基づく蒸留技術

前述の通り、ウェブページ側には既に時間感度モデルがある。ウェブページ自体は大量の情報と多くの構造的特徴を持つため、より正確に作成できる。ウェブページの時間感度についてより正確なモデルがあれば、リコール結果の分布分析を通じて大量の擬似ラベルサンプルを生成できる。これらの擬似ラベルサンプルを使用して大規模な CNN モデルをトレーニングし、第 1 版と比較して効果が明らかに向上した。

3) 第 3 版:アクティブラーニングに基づくサンプルアノテーションの反復技術

ランキングの上層では TriggerModel が必要である。TriggerModel は、クエリが新鮮性調整を必要とするかどうか、および新鮮性調整の強度を判定するために使用される。

この TriggerModel は手動アノテーションデータに基づくモデルである。より多くの特徴を使用しており、関連検索の時間感度語(ユーザーがクエリを修正して時間限定語を追加し結果をフィルタリングすることがあるため)、ウェブページの時間感度分布、クエリの時間感度分布、ユーザーのクリック行動などの特征を含む。同時に、ActiveLearning を使用して重要なサンプルにラベルを付け、モデルの解像度を向上させている。

高解像度で高精度なクエリの TriggerModel が得られたら、このモデルを使用して大量の高解像度サンプルを生成できる。同時に、強力な BERT 言語モデルと組み合わせて、より優れた時間感度モデルをトレーニングできる。

同時に、TriggerModel は第 2 版のクエリ時間感度特徴も使用しているため、クエリ感度の効果が向上した際に TriggerModel を再トレーニングして効果を高めることができる。同時に、新しい TriggerModel はクエリ時間感度モデルのトレーニングを導き、反復トレーニングで同時に改善できる。

新鮮性需要強度

新鮮性需要強度は時間感度と並列する概念で、主にユーザーが結果に対して時間次元の需要(「最新」「2020 年」など)を表示しているかどうかを判定するために使用される。

このモデルは比較的シンプルである。初期はルールベースのモデルで、クエリに顕著な新鮮性パターンがあるかを識別していた。その後、リコール結果とユーザー行動から擬似ラベルサンプルを生成してモデル学習を行うようになった(たとえば、ユーザーが明示的にクエリを修正する二次検索。ユーザーが「杭州 通行制限ルール」を検索して結果が良くない場合、「2020 年 杭州 通行制限ルール」「最新 杭州 通行制限ルール」のようにクエリを修正する)。この方法は時間感度モデルの第 2 版と似ている。

V. データアノテーション

現在、神馬検索の上層ランキングモデルの中核はラベル付きサンプルに基づく LTR モデルである。そのため、新鮮性最適化についてより合理的な方案は、ラベル付きサンプルで LTR モデルを再トレーニングすることである。

LTR モデルをトレーニングするには、新鮮性の学習目標をアノテーションする必要がある。反復プロセスには主に 2 つの段階がある。第 1 段階は、新鮮性目標を AC の 5 段階マーク(Perfect、Excellent、Good、Fair、Bad)に統合しようとする試みであった。その後、アノテーションの難しさから、2 段階の独立アノテーション方式を採用した。

新鮮性満足度を AC アノテーションに統合

現在、神馬検索の AC タグ付けは 5 段階(Perfect、Good、Excellent、Fair、Bad = 4、3、2、1、0)に分かれている。新鮮性目標を AC に追加するため、2.5、1.5、0.5 の 3 つのレベルを追加した。

具体的な採点原則は以下の通りである。

・新鮮性が悪く、満足度に影響する場合は、直接 1〜2 段階下げる。

・新鮮性が特に理想的ではないが、満足度に影響しない場合は、0.5 段階下げる。新鮮性が優れた結果については 0.5 段階上げる。

元の 5 段階から 8 段階にアップグレードされ、AC のタグ付けは 7 人での適合が必要であるため、アノテーションの難易度は大幅に上昇した。同時に、神馬検索 AC のアノテーション基準と担当者は長期間安定しており、担当者は一定のタスク感知を形成していた。アノテーション担当者に新しいアノテーションを再学習させた結果、担当者の一致率は 60% 未満と深刻に低下した。複数回のトレーニング後も大きな改善は見られなかった。そのため、後に新鮮性アノテーションを神馬検索 AC のアノテーションシステムに統合する方針を放棄し、新しい独立アノテーション原則を開始した。

独立した新鮮性満足度

独立新鮮性のアノテーション原則は、神馬検索で既に AC アノテーション済みのサンプルに、2 つ目の補助ラベルを付けることである。神馬検索のアノテーション済み AC サンプルから時間感度クエリを選択し、そのクエリの非ゼロファイルの Q-U 結果に対して新鮮性満足度をアノテーションする。

新鮮性満足度アノテーションのガイドライン:各クエリは複数の URL に対応する。評価担当者はクエリの意味を理解し、ページがユーザーのニーズを満たしているかを判断し、ページの新鮮性満足度を評価する必要がある。

・クエリの意味を理解し、ユーザーのニーズを推論する。

・ユーザーのニーズから、結果の新鮮性がどの程度ユーザーのニーズを満たしているかを判断する。

・後述の基準に基づいて合理的なスコアを付ける。

採点基準 2/1/0 は、結果が関連する場合に判断する。

時間属性のあるページは、2、1、0 で採点する。感度との違いは、変更されたページを除外しないことである(メインコンテンツの新鮮性に基づいて判断する)。

・2 - ページの結果の新鮮性が非常に良い。最新または高価値の結果である。

・1 - ページの結果の新鮮性は概ね満足できる。最新または高価値の結果ではないが、一定の参考価値がある。

・0 - ページの結果の新鮮性が悪い。非常に古いか、参考価値がない。

無関係 - ページコンテンツがクエリと完全に無関係。

・デッドリンク / スパム - ページの不正行為 / コンテンツ無効化 / 空白ページ。低品質。

・時間不要な需要 - クエリが明らかに時間を必要としない需要(例:論語の全文)。

・判断不可能 - ページコンテンツに新鮮性の要素が含まれておらず、新鮮性に基づいて採点できない(例:百科事典、長い動画ページ、ウェブサイトのホームページ)。

新鮮性満足度の基準は時間感度と同じである。特に詳細なガイドラインは設けていない。核心は、アノテーション担当者に主体的に考えさせ、新鮮性の損失がユーザー満足度に与える影響を感知させることである。初期アノテーションの一致率も低く、60% 未満であった。長期のトレーニングとケース説明を経て、最終的な一致精度は約 75%〜85% に達した。

VI. ランキングモデル

新鮮性ランキングのモデルは主に 4 層に分かれている。

新鮮性粗ランキング

時間感度クエリに対して、インデックスリコールレベルでできるだけ時間的に新しい結果をリコールする。新鮮性粗ランキングプロジェクトは早期に実施されたが、当時データはまだアノテーションされていなかった。主な方法は特徴強化を通じて新しい結果のランキング確率を向上させることであった。

神馬検索ランキングモデルへの新鮮性特徴の追加

一部の AC 基準では、新鮮性が実際に考慮されている。

・第 1 カテゴリ:たとえば一部のニュース。多くのニュースイベントでは、人物や場所が変わらなくても核心的な出来事が変化し、基本的な満足度に影響を与える。これが AC 基準に反映されている。

・第 2 タイプ:もう一つは情報無効化である。情報無効化は AC 基準で明確に定義されており、無価値なコンテンツとして満足度に直接影響を与える。一般的に、情報無効化の確率は、ウェブページが現在からどれだけ離れているかと正比例する。一定量の情報無効化対象から、いくつかの新鮮性目標を学習できる。

・その他のタイプ:「最新の軍事パレード」や「5 月 1 日の休日配置」など、多くの他のタイプがある。

時間感度クエリのタグ付け結果はタグ付け時間と関連しているため、時間特徴を正確に計算するには、AC サンプルのタグ付け時間を記録する必要がある。同時に、特徴ダンプ時にサンプル時間をタグ付け時点に復元する必要がある。このため、神馬検索特徴ダンプのプロセスを変更し、時間復元機能を追加して新鮮性特徴の正確性を保証している。

時間有効独立ダブルラベルランキングモデル

新鮮性タグデータには 2 つのラベルがあるため、独立したマルチラベルランキングフレームワークを開発する必要がある。このため、アルゴリズムに変更を加え、元の LightGBM ツールをアップグレードしてマルチラベルトレーニングをサポートするようにした。

主な思路は、LambdaMart が交換 Doc の PairwiseLoss を計算する際に 2 つの Label を同時に考慮することである。

・第 1 版の方法:第 1 ラベルが同じ場合、補助ラベルの役割を追加し、補助ラベルの損失を計算する。その後、この方法には応用上の問題があることが分かった。補助ラベルは同じラベルのサンプルにしか機能せず、異なるラベルのサンプルでは損失を生成できない。

・第 2 版の方法:第 1 版の欠点を補うため、ラベル増幅法を使用して元の Label をスケーリングし、AC 基準を 8、6、4、2、0 に変更し、新鮮性目標を 3、2、1、0、(1、0、-1、-2)に変更した。こうして新鮮性ラベルが AC ラベルに追加され、新しいラベル目標が形成された。同時に、LightGBM の交換損失の 2^Label を 2*Label に変更した(ここでは神馬検索の実践を参考にした)。これは主に、ラベルを拡大した後、2^Label では先頭損失が特に大きくなり、実際のオンライン交換損失と不一致が生じるためである。

・第 3 版のアルゴリズム:その後、サンプルを観察した結果、新鮮性の効果は実際にはサンプル自体のラベルと関連していることが分かった。サンプル自体のラベルが 1 の場合、ユーザーは実際には新鮮性を気にしない。ラベルが 3 の場合、新鮮性の役割は小さく、ユーザーも気にしない。新鮮性は主にラベルが 2 のサンプルで機能する。第 3 レベルと第 1 レベルの新鮮性を下げ、第 2 レベルの新鮮性を上げて、新鮮性特徴目標の差別化を改善した。

新鮮性独立モデルによる神馬検索モデルの動的補正

独立した新鮮性モデルが計算したランキングスコアは、直接結果の新鮮性ランキングに使用できない。時間感度と新鮮性需要強度を考慮する必要があるためである。たとえば:

・時間感度が低い場合、新鮮性の効果は弱い。

・全体的な関連性レベルが高くない場合、ランキングの核心は関連性である。

・新鮮性ラベルのサンプルサイズは神馬検索の AC サンプルよりずっと小さく、学習能力は神馬検索の AC モデルより弱い。

これら 3 つの側面を考慮して、新鮮性モデルのスコアを神馬検索のランキングスコアに平滑に融合させる方法を設計した。

RankScore = RankScoreAC*Lamda + RackScoreTimeliness*(1-Lambda)

核心は Lambda の計算である。Lambda 計算の 3 つの次元を探求し、試行した。

初期の第 1 版:TriggerModel と手動ルールの組み合わせ。TriggerModel は時間感度特徴を計算し(TriggerModel については前述のクエリ信号で簡単に紹介)、TriggerModel に基づいて時間感度レベルの信号をフィードバックし、Lambda 値を手動で指定する。

中期の第 2 版:第 1 版の方法に基づき、TriggerModel のしきい値と Lambda 重みの関係を平滑化し、調和平均の簡易方法を設計して Trigger 予測値と Lambda 値を関連付け、調整次元をより滑らかにした。

現在試行中のバージョン:これは現在のランキングで試行中の多目的融合アルゴリズムである。純粋な Pair アノテーションサンプルを通じて、複数の多目的モデル(各多目的モデルは AC の目標と独立したサブ次元を学習済み)を融合し、いくつかのグローバル統計特徴を通じて異なる多目的モデルの重みを学習する。

IRGAN に基づく普遍的新鮮性ランキングの探索

新鮮性アノテーションサンプルのコストが高いため、業界には IRGAN を使用してモデルを反復する企業があった。同時に、突発的新鲜性で同じグループが IRGAN シナリオでメリットを得ていた。我々も IRGAN を通じて新鮮性のメリットを得たいと考え、探索と試行を行った。

赤はマーク済みの関連文書、濃紺はリコール文書中の未マークの関連文書、水色はリコール文書中の未マークの非関連文書である。G のトレーニングは、まず未マーク文書を評価し、スコアの高い文書を D に送って判定させる。D はペアを判定して、G に選ばれたもの(偽と判定)か実際にマークされたもの(真と判定)かを判断し、スコアを G にフィードバックして修正させる。こうして G は最終的に実際のマークサンプルに近い文書を選択できるようになる。

現在の G と D のネットワーク構造と事前トレーニングプロセスは同じで、対戦前はほぼ同一のモデルである(事前トレーニング前のランダム初期化値が異なるだけ)。しかし、G との対戦トレーニング中、D はマーク済み doc が G が選択した Doc よりも常に優れていると考える。G が実際に優れた文書を選択した場合でもである(G の事前トレーニング能力は D の能力と同じで、最初は非常に優れている可能性がある)。そうなると G はますます悪化していく。そのため、D と G で異なるネットワーク構造を検討できる。D がすべきことはペアの正順と逆順を判定することだけで、シンプルでよい。G は D を混乱させる必要があるため、より複雑なネットワークを使用できる。

VII. リコール

新鮮性ランキングのリコールシステムは、主に汎用リコールのクエリ側処理、時間制限クエリ、独立新鮮性インデックスリコールの 3 つの側面から処理される。

クエリ側の処理

新鮮性クエリでは、ユーザーは「今年」「3 月」「最新」「直近」のようなクエリをよく検索することが分かった。元の神馬検索リコールシステムでは、このような用語の重みは一般的に大きい。多くのリテラルリコールでは term マッチングのみを考慮し、term とウェブページの時間を無視していた。時間制限が考慮されないため、term はマッチしているが時間が非常に古い結果がリコールされることが多かった。これに対処するため、神馬検索のクエリ分析モジュールを別途処理し、TimelinessTermWeightReadjust と TimelinessQueryRewrite の機能を追加した。主に TermWeight とクエリ書き換えの観点からリコールリンクを最適化するためである。

TimelinessTermWeightReadjust

現在、神馬検索のコアエンジンである転置インデックスは、クエリ分析後に AND ワードを指定する。これは転置インデックスのジッパーをマージする際に必ず含まれなければならないヒットワードである。新鮮性の文脈では、「今年」「最近」「最新」などの用語が対象にヒットすることを必ずしも望まない。これらの用語の生命は相対時間であり、ウェブページが公開された時点では最新の結果を指している可能性がある。しかし、時間の経過とともに、ウェブページの内容が変わらなければ、この情報の価値は大幅に低下する。

インデックスクエリの AND ロジックの核心特徴は TermWeight である。Term の重みが低下すれば、その用語はランキングによって削除される可能性が最も高く、ジッパーのマージに参加しなくなる。このため、複数の時間限定修飾語を抽出し、時間限定シナリオでのこれらの用語の重みを下げて、リコール効果を改善した。

TimelinessQueryRewrite

「今年 3 月」について、ユーザーの暗黙の意味は 2020 年 3 月である。クエリ書き換えを通じて、絶対時間を指定する独立したクエリロジックを追加し、時間制約の強制マッチングによってリコール結果の時間次元が満たされることを保証する。

時間制限クエリ

時間制限クエリは理解しやすい。クエリの時間感度の半減期によってリコール結果を制限することである。前述のクエリの時間感度特徴の説明でも触れられている。この段階では主に時間感度特徴が使用される。

このクエリが時間感度を持つと判断した場合、別のクエリを開始する。このクエリは Filter 構文を通じてリコール結果の時間を制限する。この時間は前述のウェブページ時間である。

時間感度が 3、つまり半減期が 1 週間の場合、検索エンジンで Filter 構文を使用して、直近 1 週間の結果のみをリコールするように指定する。同様に、他の感度レベルでも対応する半減期に基づいてリコールを検索し、リコール結果の新鮮性が十分に良いことを保証する。

新鮮性インデックスリコール

新鮮性インデックスリコールは、主にいくつかのビジネスロジックの課題を解決するためである。同時に、パフォーマンスと効果のバランスを取るため、十分に新しいコンテンツを単一のインデックスに配置している。クエリ時に新鮮性インデックスを別途検索してリコールを増加させる。

前述の時間制限クエリと TimelinessQueryRewrite はいずれも別途クエリを開始する。クエリが汎用ライブラリを使用する場合、現在の普遍検索のトリガー基準によると、インデックスへのクエリ量は 50% 増加する。これはインデックスにとって大きなパフォーマンス消費だが、改善は必ずしもそれほど大きくない。

独立インデックス化後、タイムリーなデータ選択と有効ロジックをより柔軟にし、神馬検索インデックスの各種制約から解放できる。

ニュースや強い新鮮性の下では、日、時間、さらには分単位のデータ収集が必要であり、これは神馬検索シナリオでは実現できない。これを担う独立した新鮮性ビジネスインデックスが必要である。

VIII. 収集

新鮮性収集システムは、実際にはランキングの最も基礎的な中核部分である。このリンクに最適なランキングアルゴリズムが含まれていなければ、役に立たない。現在の検索収集システムは、主に突発的で強い新鮮性向けの収集システムと、神馬検索の汎用階層型収集システムに分かれている。

指向性収集システム

シードページベースのニュースシーン収集

強い新鮮性、特にニュースシーンでは、ニュースシードリストページのリンクフロー接続を通じて新鮮性コンテンツが発見されることが多い。簡単な例を挙げると、Sina ホーム、Sina NBA ホーム、Sina ファイナンスホーム、知乎ホットトピックページ、微博ホットトピックページなどである。

シードページを定期的にチェックして新しいリンクがあるかを確認し、新しいコンテンツを発見する。一般的に、このシードページのリンクフローは 1 層のみである。これには実際には多くの内容が含まれており、シードページの発見とアノテーション、シードページ取得のスケジューリングアルゴリズム、シードページの定期的な淘汰メカニズムなどがある。

新鮮性需要駆動型の指向性収集

現在、インターネット発見の現状と将来のトレンドはまだ閉鎖的で、各種ウェブサイトやアプリのデータはインターネット上でアクセスしにくい。同時に、We Media 時代の到来により、誰もが潜在的なシードページとなり得る。従来のシードスケジューリングアルゴリズムではこのような膨大なコンテンツをスケジューリングできず、できたとしても新鮮性と収益性を確保するのは難しい。

この場合、一般的に需要駆動型の収集を行う。簡単に言えば、各ウェブサイトやアプリには独自の検索インターフェイスがある。新鮮性需要を持つクエリリクエストを構築して、これらのウェブサイトやアプリのデータを取得し、需要駆動型の収集を実施する。

Related Articles

Explore More Special Offers

  1. Short Message Service(SMS) & Mail Service

    50,000 email package starts as low as USD 1.99, 120 short messages start at only USD 1.00

phone お問い合わせ
Hi, I'm Alibaba Cloud AI Assistant!
I can help with questions and solutions.