人气模型

更新时间:
复制 MD 格式

人气模型是什么

人气模型属于离线计算的模型,是淘宝搜索最基础的排序算法模型。人气模型会计算量化出每个商品的静态质量及受欢迎的程度的值,这个值称之为商品人气分。虽然人气模型来自淘宝搜索业务,但其实这个模型对于其他的搜索场景也有普适性,在非商品搜索场景中通过人气模型也可以计算出被索引的文档的受欢迎程度。

模型训练使用的特征

  • 实体维度:商品/doc、品牌、商家、叶子类目、一级类目等。

  • 时间维度:1天、3天、7天、14天、30天、时间衰减加权等。

  • 行为维度:曝光、点击、收藏、加购、购买、评论、点赞等。

  • 统计维度:数量、人数、频率、点击率、转化率等。

每个特征从以上4个维度中各取一到两个进行组合,再从历史数据中统计该组合特征最终的特征值。比如,商品(实体)最近1天(时间)的曝光(行为)量(统计指标);商品所在店铺(实体)最近30天(时间)的销量(行为类型+统计维度)等等。由以上方法产生的特征数量级相当于4个维度的笛卡尔积。

使用步骤

  1. 创建模型

  2. 训练模型并检查数据报告

  3. 应用到排序配置-策略管理中

【温馨提示】:单个应用最多创建5个人气模型。

创建具体流程

1.创建人气模型,控制台-->搜索算法中心-->排序配置-->人气模型,点击创建。

按要求填写模型名点击确定

在创建人气模型页面,选择目标应用(如 medical),填写模型名称(如 test_02),模型名称要求长度 1-30 个字符,以字母开头,可包含大小写字母、数字和下划线,且不能与其它模型名称相同。数据准备部分需通过数据采集 SDK 上传曝光、点击等行为数据,并确保应用有足够的流量访问。填写完成后单击确定

2.点击确认后,页面显示人气模型创建完成成功提示,并提示后续可执行的操作:

  1. 查看数据报告了解数据质量是否满足要求。

  2. 通过搜索测试A/B 测试评估模型效果。

  3. 在排序配置中应用人气分值。

单击完成按钮。

3.点击排序配置>人气模型>训练模型此时状态会被更新成调度中,等待模型训练完毕即可。

应用人气模型到排序

人气模型训练完成后,会为每个文档计算出商品人气分(即文档静态质量与受欢迎程度的量化值)。要让人气分作用于线上搜索排序,需在排序配置>策略管理中创建或编辑排序策略并引用该模型的算分结果,即上文使用步骤中的第 3 步“应用到排序配置-策略管理中”。

策略管理中创建排序策略时,可选择应用范围(基础排序业务排序)并配置排序表达式。排序策略的创建、算分特征与权重设置、排序表达式的编写方式,请参考排序策略配置

策略配置完成后,查询请求通过first_rank_name(基础排序策略)与second_rank_name(业务排序策略)指定要生效的排序策略,人气分即可参与线上排序算分。你可以在搜索测试页面开启显示排序明细开关,查看各文档的排序得分与最终排序效果。

人气模型详情

人气模型详情页说明

人气模型详情页包含以下信息:

  • 基本信息:创建时间、最后训练开始时间、模型状态(可用)、最新版本状态(已训练并就绪)。

  • 配置信息:定时任务开关(开启/关闭),可单击编辑定时任务进行修改。

  • 数据校验:数据完整度状态(数据可用)、完整度等级(如 l1),可单击升级条件查看详情。

  • 训练历史:表格展示模型版本、版本状态、训练开始时间、训练结束时间。

左侧导航菜单包含:策略配置、人气模型、类目预测模型、CTR 预估模型、定制排序模型。

基本信息

可查看模型的创建时间状态最后训练开始时间以及最新版本状态

配置信息

定时任务:默认开启并每天训练一次,也可以编辑定时任务,自定义训练周期

数据校验

数据完整度状态包含数据可用数据异常

完整度报告显示当前应用的完整度等级,具体完整度等级可见:

数据完整度

介绍

晋升条件

l0

表示数据完全不可用,缺少必要的核心字段,数据量太少,后续的数据处理不能继续进行。

l0-->l1:

最近一天ipv数大于100。

l1

表示数据的核心字段已经具备,满足模型训练条件。

说明

相关API/SDK参考:创建算法资源