日本語版
最新ニュース
科学&テクノロジー

Netflix での長期的な会員満足度向上のための推奨事項 | Netflix テクノロジー ブログ | 2024 年 8 月

による ジャンウェイ・パン、 ゲイリー・タン、 ヘンリー・ワン、 そして ジャスティン・バジリコNetflix の使命は、世界を楽しませることです。当社のパーソナライゼーション アルゴリズムは、適切な番組、映画、ゲームを適切なタイミングで推奨することで、すべてのメンバーにこの使命を果たす上で重要な役割を果たしています。この目標は、即時のエンゲージメントにとどまりません。メンバーに永続的な楽しみをもたらす体験を提供することを目指しています。従来の推奨システムは、クリック数やエンゲージメントなどの短期的な指標を最適化することが多く、長期的な満足度を十分に反映できない場合があります。当社は、メンバーをその瞬間的に引き付けるだけでなく、長期的な満足度を高めるコンテンツを推奨するよう努めています。これにより、Netflix から得られる価値が高まり、メンバーが継続してメンバーであり続ける可能性が高まります。推奨事項をコンテキスト バンディット問題として捉える簡単な方法は、コンテキスト バンディット問題として捉えることです。メンバーがサイトを訪問すると、それがシステムのコンテキストとなり、システムはどの推奨事項を表示するかというアクションを選択し、メンバーはさまざまなタイプのフィードバックを提供します。これらのフィードバック シグナルは即時のもの (スキップ、再生、高評価/低評価、またはプレイリストへのアイテムの追加) または遅延のもの (番組の視聴完了またはサブスクリプションの更新) になります。これらのフィードバック シグナルからの推奨事項の品質を反映する報酬関数を定義し、履歴データに基づいてコンテキスト バンディット ポリシーをトレーニングして、期待される報酬を最大化できます。推奨モデルを改善する方法はたくさんあります。より有益な入力機能、より多くのデータ、異なるアーキテクチャ、より多くのパラメータなどから改善できる可能性があります。この記事では、長期的なメンバー満足度をより適切に反映する報酬関数を定義することで、推奨目標を改善するというあまり議論されていない側面に焦点を当てます。会員維持は、満足していれば会員は留まるはずなので、長期的な満足度を最適化するための明らかな報酬のように思えるかもしれませんが、いくつかの欠点があります。うるさい: 維持率は、季節的な傾向、マーケティング キャンペーン、サービスとは関係のない個人的な状況など、さまざまな外部要因によって影響を受ける可能性があります。低感度: 維持は、サブスクリプションをキャンセルしようとしているメンバーに対してのみ敏感であり、メンバー満足度の全範囲を捉えるものではありません。帰属が難しい: メンバーは、悪い推薦が続いた場合にのみキャンセルする可能性があります。測定に時間がかかる: 1 か月あたり 1 つのアカウントにつき 1 つのシグナルのみ受信します。これらの課題のため、保持のみを最適化することは現実的ではありません。代わりに、バンディットポリシーを訓練して、長期的な会員満足度と高度に連携しながら、個々の推奨に敏感な代理報酬関数を最適化することができます。代理報酬 r(ユーザー, アイテム) は、推奨アイテムに対するユーザーのインタラクションの関数です。たとえば、「ワンピース」を推奨し、メンバーがプレイしてその後完了して親指を立てた場合、単純な代理報酬は次のように定義されます。 r(ユーザー、アイテム) = f(再生、完了、親指)。クリックスルー率(CTR)クリックスルー率(CTR)、またはこの場合はプレイスルー率は、単純な代理報酬として見ることができます。 r(ユーザー, アイテム) =…

Netflix での長期的な会員満足度向上のための推奨事項 | Netflix テクノロジー ブログ | 2024 年 8 月

による ジャンウェイ・パンゲイリー・タンヘンリー・ワン、 そして ジャスティン・バジリコ

Netflix の使命は、世界を楽しませることです。当社のパーソナライゼーション アルゴリズムは、適切な番組、映画、ゲームを適切なタイミングで推奨することで、すべてのメンバーにこの使命を果たす上で重要な役割を果たしています。この目標は、即時のエンゲージメントにとどまりません。メンバーに永続的な楽しみをもたらす体験を提供することを目指しています。従来の推奨システムは、クリック数やエンゲージメントなどの短期的な指標を最適化することが多く、長期的な満足度を十分に反映できない場合があります。当社は、メンバーをその瞬間的に引き付けるだけでなく、長期的な満足度を高めるコンテンツを推奨するよう努めています。これにより、Netflix から得られる価値が高まり、メンバーが継続してメンバーであり続ける可能性が高まります。

推奨事項をコンテキスト バンディット問題として捉える簡単な方法は、コンテキスト バンディット問題として捉えることです。メンバーがサイトを訪問すると、それがシステムのコンテキストとなり、システムはどの推奨事項を表示するかというアクションを選択し、メンバーはさまざまなタイプのフィードバックを提供します。これらのフィードバック シグナルは即時のもの (スキップ、再生、高評価/低評価、またはプレイリストへのアイテムの追加) または遅延のもの (番組の視聴完了またはサブスクリプションの更新) になります。これらのフィードバック シグナルからの推奨事項の品質を反映する報酬関数を定義し、履歴データに基づいてコンテキスト バンディット ポリシーをトレーニングして、期待される報酬を最大化できます。

推奨モデルを改善する方法はたくさんあります。より有益な入力機能、より多くのデータ、異なるアーキテクチャ、より多くのパラメータなどから改善できる可能性があります。この記事では、長期的なメンバー満足度をより適切に反映する報酬関数を定義することで、推奨目標を改善するというあまり議論されていない側面に焦点を当てます。

会員維持は、満足していれば会員は留まるはずなので、長期的な満足度を最適化するための明らかな報酬のように思えるかもしれませんが、いくつかの欠点があります。

  • うるさい: 維持率は、季節的な傾向、マーケティング キャンペーン、サービスとは関係のない個人的な状況など、さまざまな外部要因によって影響を受ける可能性があります。
  • 低感度: 維持は、サブスクリプションをキャンセルしようとしているメンバーに対してのみ敏感であり、メンバー満足度の全範囲を捉えるものではありません。
  • 帰属が難しい: メンバーは、悪い推薦が続いた場合にのみキャンセルする可能性があります。
  • 測定に時間がかかる: 1 か月あたり 1 つのアカウントにつき 1 つのシグナルのみ受信します。

これらの課題のため、保持のみを最適化することは現実的ではありません。

代わりに、バンディットポリシーを訓練して、長期的な会員満足度と高度に連携しながら、個々の推奨に敏感な代理報酬関数を最適化することができます。代理報酬 r(ユーザー, アイテム) は、推奨アイテムに対するユーザーのインタラクションの関数です。たとえば、「ワンピース」を推奨し、メンバーがプレイしてその後完了して親指を立てた場合、単純な代理報酬は次のように定義されます。 r(ユーザー、アイテム) = f(再生、完了、親指)

クリックスルー率(CTR)

クリックスルー率(CTR)、またはこの場合はプレイスルー率は、単純な代理報酬として見ることができます。 r(ユーザー, アイテム) = ユーザーが推奨をクリックした場合は 1、それ以外の場合は 0 です。CTR は、一般的にユーザーの好みの期待を反映する一般的なフィードバック シグナルです。多くの推奨アプリケーションにとって、これはシンプルですが強力なベースラインです。クリックがターゲット アクションである広告のパーソナライゼーションなど、場合によっては、CTR は実稼働モデルにとって妥当な報酬となることもあります。ただし、ほとんどの場合、CTR を過度に最適化すると、クリックベイト アイテムの宣伝につながり、長期的な満足度を損なう可能性があります。

クリック率を超えて

代理報酬関数を長期的な満足度とより密接に一致させるには、単純なインタラクションを超えて、あらゆる種類のユーザー アクションを考慮し、それらがユーザー満足度に与える真の影響を理解する必要があります。

Netflix の例をいくつか挙げます。

  • シーズンの早い終了 ✅: 推奨されたテレビ番組のシーズンを 1 日で完了することは、楽しさと長期的な満足感の強い兆候です。
  • 完了後に親指を下げる ❌: 数週間かけてテレビ番組を視聴し終えた後に「いいえ」と評価した場合は、かなりの時間を費やしたにもかかわらず満足度が低いことを示しています。
  • 映画を10分間再生する ❓: この場合、ユーザーの満足度はあいまいです。短時間の視聴は、ユーザーが映画を放棄することを決めたことを示している可能性があります。または、単にユーザーが中断されて、後で、おそらく翌日に映画を観終える予定であることを意味する可能性もあります。
  • 新しいジャンルの発見 ✅ ✅: 「イカゲーム」の後に韓国の番組やゲーム番組をさらに視聴することは、ユーザーが何か新しいものを発見していることを示しています。この発見は、メンバーにとって新しい分野でのさまざまなエンゲージメントにつながったため、さらに価値があったと考えられます。

報酬エンジニアリングは、長期的なメンバー満足度に合わせてプロキシ報酬関数を改良する反復的なプロセスです。これは機能エンジニアリングに似ていますが、サービス提供時に利用できないデータから派生できる点が異なります。報酬エンジニアリングには、仮説形成、新しいプロキシ報酬の定義、新しいバンディット ポリシーのトレーニング、A/B テストという 4 つの段階があります。以下は簡単な例です。

代理報酬機能で使用されるユーザー フィードバックは、遅れたり欠落したりすることがよくあります。たとえば、メンバーは、推奨されたショーを初日に数分間だけ再生することに決め、ショーを完全に完了するまでに数週間かかる場合があります。この完了フィードバックは、したがって遅れます。さらに、一部のユーザー フィードバックはまったく発生しない可能性があります。そうでないことを願うかもしれませんが、すべてのメンバーがショーを完了した後に親指を立てたり下げたりするわけではないため、メンバーの満足度が不明のままになります。

フィードバックを観察するためのより長い時間を与えるために待つこともできますが、プロキシ報酬を計算する前に遅延フィードバックをどれくらい待つべきでしょうか? 待ち時間が長すぎると (たとえば、数週間)、最新のデータでバンディット ポリシーを更新する機会を逃してしまいます。Netflix のような非常に動的な環境では、古いバンディット ポリシーはユーザー エクスペリエンスを低下させ、特に新しいアイテムを推奨するのに悪影響を及ぼす可能性があります。

解決策: 不足しているフィードバックを予測する

私たちは、遅延フィードバックを含むすべてのユーザーフィードバックに基づいてプロキシ報酬関数を定義しながら、推奨を行った直後にバンディットポリシーを更新することを目指しています。ポリシーのトレーニング時には遅延フィードバックは観察されていないため、予測することができます。この予測は、すでに観察されたフィードバックとトレーニング時間までのその他の関連情報を入力機能として使用して、遅延フィードバックを含む各トレーニング例に対して行われます。したがって、時間の経過とともに予測も向上します。

次に、観測されたフィードバックと予測されたフィードバックの両方を使用して、各トレーニング例の代理報酬が計算されます。これらのトレーニング例は、バンディット ポリシーを更新するために使用されます。

しかし、代理報酬関数では、まだ観測されたフィードバックのみに頼っているのではないでしょうか。はい、遅延フィードバックは観測されたフィードバックに基づいて予測されるからです。ただし、すべてのフィードバックを直接使用して報酬について推論する方が簡単です。たとえば、遅延親指を立てた予測モデルは、観測されたすべてのフィードバック (短期的なプレイ パターンなど) を考慮する複雑なニューラル ネットワークである可能性があります。代理報酬を、短期的なインタラクション パターンの複雑な関数ではなく、親指を立てたフィードバックの単純な関数として定義する方が簡単です。また、フィードバックの提供方法における潜在的なバイアスを調整するためにも使用できます。

報酬エンジニアリング ダイアグラムは、オプションの遅延フィードバック予測ステップで更新されます。

2種類のMLモデル

このアプローチでは、次の 2 種類の ML モデルが採用されていることに注意してください。

  • 遅延フィードバック予測モデルこれらのモデルは予測する p(最終フィードバック | 観察されたフィードバック)予測は、バンディット ポリシーのトレーニング例の代理報酬を定義および計算するために使用されます。その結果、これらのモデルは、バンディット ポリシーのトレーニング中にオフラインで使用されます。
  • バンディットポリシーモデル: これらのモデルはバンディットポリシーで使用されます π(アイテム | ユーザー; r) オンラインでリアルタイムに推奨事項を生成します。

入力機能やニューラル ネットワーク アーキテクチャの改善により、オフライン モデル メトリック (分類モデルの AUC など) が向上することがよくあります。ただし、これらの改善されたモデルを A/B テストにかけると、メンバーの長期的な満足度を定量化できるオンライン メトリックが平坦またはマイナスになることがよくあります。

このオンラインとオフラインの指標の不一致は、通常、推奨ポリシーで使用される代理報酬が長期的なメンバー満足度と完全に一致していない場合に発生します。このような場合、モデルはより高い代理報酬 (オフライン指標) を達成しますが、長期的なメンバー満足度 (オンライン指標) は低下する可能性があります。

それでも、モデルの改善は本物です。これを解決する1つの方法は、プロキシ報酬の定義をさらに改良して、改善されたモデルとよりよく一致させることです。この調整によってオンライン指標がプラスになると、モデルの改善は効果的に製品化できます。 [1] この課題に関するさらなる議論については、こちらをご覧ください。

この投稿では、Netflix の推奨を長期的な会員満足度に合わせるための報酬エンジニアリングの取り組みの概要を説明しました。維持は依然として私たちの目標ですが、直接最適化するのは簡単ではありません。そのため、私たちの取り組みは、長期的な満足度に一致し、個々の推奨に敏感な代理報酬を定義することに重点を置いています。最後に、Netflix でのユーザーフィードバックの遅延という特有の課題について説明し、私たちにとって効果的であることが証明されたアプローチを提案しました。 [2] Netflix における報酬イノベーションの取り組みに関する以前の概要については、こちらをご覧ください。

推奨事項の改善を継続していますが、いくつかの未解決の疑問が残っています。

  • 行動と保持を相関させることで、適切な代理報酬関数を自動的に学習できるでしょうか?
  • ポリシートレーニングで予測値を使用する前に、遅延フィードバックをどれくらい待つ必要がありますか?
  • 強化学習を活用して、ポリシーを長期的な満足度とさらに一致させるにはどうすればよいでしょうか?

[1] レコメンデーション システムのためのディープラーニング: Netflix のケース スタディ。 AI マガジン 2021。ハラルド・ステック、リナス・バルトゥナス、エッシャム・エラヒ、ダーウェン・リャン、イヴ・ライモンド、ジャスティン・バジリコ。

[2] 長期的な会員満足度に対するイノベーションへの報酬. RecSys 2023。Gary Tang、Jiangwei Pan、Henry Wang、Justin Basilico。

#Netflix #での長期的な会員満足度向上のための推奨事項 #Netflix #テクノロジー #ブログ #年 #月

執筆者について: nipponese

Nipponese News編集部は、国内外のニュースを日本語で分かりやすくお届けします。