eBay基于NLP技术开发的新推荐模型
eBay开发了一种基于自然语言处理(NLP)技术的新推荐模型,特别是基于BERT模型。该模型名为“ranker”,通过分析产品标题中的语义信息,提升了购买、点击和广告收入的指标。与之前的模型相比,ranker在原生应用(Android和iOS)和网页平台上分别提高了3.76%的购买率、2.74%的点击率和4.06%的广告收入。
PLSIM模型的三阶段结构
eBay的推广列表相似推荐模型(PLSIM)由三个阶段组成:
- 检索最相关的推广列表,称为“召回集”。
- 使用离线历史数据训练的ranker模型,根据购买可能性对召回集进行排序,并结合卖家广告率重新排列列表。
- 模型特征包括推荐商品的历史数据、推荐商品与种子商品的相似性、产品类别、国家和用户个性化特征。模型通过梯度提升树(Gradient Boost Tree)持续训练,以根据相对购买概率对商品进行排序。引入深度学习特征显著提高了相似性检测的性能。
旧版推荐模型的局限性及BERT的优势
旧版推荐模型使用词频-逆文档频率(TF-IDF)和Jaccard相似度来评估产品标题。这种方法存在基本限制,无法考虑句子的上下文和同义词。而BERT作为一种深度学习方法,在语言理解方面表现出色。由于eBay的语料库与书籍和维基百科不同,eBay工程师开发了eBERT,这是一种在eBay商品标题上预训练的BERT变体。eBERT在离线的eBay特定标签任务中显著优于标准BERT模型,F1得分为88.9。
优化推理性能的MicroBERT模型
eBERT架构过于复杂,无法满足高吞吐量的推理需求。为了解决这个问题,eBay开发了MicroBERT,这是一个更小的BERT版本,优化了CPU推理性能。MicroBERT在训练阶段使用eBERT作为教师模型,通过知识蒸馏过程保留了eBERT 95%-98%的质量,同时减少了300%的推理时间。
使用InfoNCE损失函数进行微调
MicroBERT使用对比损失函数InfoNCE进行微调。商品标题被编码为嵌入向量,模型通过增加相关标题向量之间的余弦相似度来训练,同时减少小批量中其他标题对的余弦相似度。
新模型的性能及实现方式
新模型在购买排名(售出商品的平均排名)上实现了3.5%的提升。由于模型的复杂性,实时推荐难以实现。因此,标题嵌入通过每日批处理任务生成,并存储在NuKV(eBay的云原生键值存储)中,以商品标题为键,嵌入为值。这种方式使eBay能够满足所需的延迟要求。
**粗体** _斜体_ [链接](http://example.com) `代码` - 列表 > 引用。你还可以使用@来通知其他用户。