欢迎访问我的博客,有问题可以在任意文章底部留言评论

Lookalike的几种实现方式

程序化广告 Haran 6年前 (2020-10-22) 13539次浏览 1个评论

广告投放遇到一个很常见的问题:再营销人群通常转化较高,但规模有限;直接扩大兴趣、地域或关键词定向,规模虽然变大,却容易带来大量低质量流量。

Lookalike(相似受众) 应运而生——它通过数据和算法,将现有优质客户的特征“复制”到潜在用户中,帮助广告主在茫茫人海中精准找到“对的人”。

什么是 Lookalike?

对数字营销从业者来说,这个概念应该不陌生:

简单说:Lookalike 是一种基于现有用户数据,利用算法找到与这些用户行为、兴趣和特征相似的潜在用户群体的工具。

核心目标:在不直接知道新用户信息的情况下,扩大高潜力客户群体,提升广告转化率

打个比方:假如你经营一家高端健身房,现有会员里有一批“每周来3次、年年续费”的优质客户。Lookalike 要做的事,就是让平台从全网用户中,找出和这批优质客户“画像最像”的人,然后你把广告投给他们。你不需要知道这些人是谁,算法帮你找。

传统定向 vs Lookalike定向

比维度 传统定向 Lookalike 定向
受众来源 广告主手动定义标签(如“25-35岁男性”) 算法根据种子用户自动扩展
精准度 依赖人为经验,容易偏差 基于数据驱动,客观精准
覆盖规模 受限于标签组合,规模有限 可指数级扩大潜在受众
时效性 静态,需人工调整 动态,可随种子用户更新

Lookalike是如何工作的?

整个流程可以分为四个步骤:种子用户 → 特征分析 → 相似度计算 → 生成相似受众

第一步:选取种子用户

种子用户是 Lookalike 的“原材料”,其质量直接决定最终效果。种子用户越精准、规模越大,效果越好。

常见种子用户类型:

  • 高价值客户:付费用户、重复购买用户
  • 高活跃度用户:高频访问、深度互动用户
  • 注册或订阅用户:完成留资或订阅的用户
  • 已有转化用户:完成下载、申请、购买等转化行为的用户

 

第二步:分析用户特征

平台会系统分析种子用户的各类特征,包括:

  • 人口统计信息:年龄、性别、地域、职业
  • 兴趣偏好:浏览内容、关注话题、互动对象
  • 行为习惯:上网时段、设备偏好、消费频次
  • 消费特征:客单价、购买品类、决策周期

 

第三步:寻找相似人群

算法从平台的全部活跃用户中,通过机器学习模型计算每个用户与种子用户的相似度,筛选出得分最高的潜在高价值用户群。

 

第四步:生成相似受众

广告主可以直接将广告投放给 Lookalike 人群,并根据相似度分层制定差异化投放策略。

种子人群怎么选?

很多 Lookalike 投放效果差,不一定是算法问题,而是种子定义得太宽泛。

优先使用接近最终业务目标的种子

目标 更适合作为种子的行为 不建议直接作为种子的行为
电商成交 高客单购买、复购、利润较高订单 所有页面访问者
B2B 获客 销售确认有效线索、成交客户 任意表单提交
App 付费 付费、订阅续费、高留存用户 安装用户
内容订阅 付费订阅、持续阅读且转化用户 所有文章浏览用户

如果把“所有访问者”作为种子,模型可能找到的是“容易访问网站的人”,而不是“更可能购买的人”

种子质量比规模更重要

种子规模过小,平台可能缺乏足够信号;但种子越大也不一定越好。将大量低质量、过期或与目标无关的用户混入种子,反而会降低人群区分度。

以 Meta 为例,官方建议 Lookalike 的来源受众通常使用 1,000–5,000 人,并允许从较小来源开始创建;但这只是平台建议,不是所有业务都适用的固定标准。

 

Lookalike 使用哪些算法?

广告平台通常不会公开完整模型、特征权重或实时投放逻辑。因此,下面介绍的是行业中常见的技术路线,而不是某个平台的唯一实现方式。

实际系统通常采用多阶段架构:规则或标签初筛 → 候选人群召回 → 相似度或倾向评分 → 排序 → 竞价与投放反馈优化

显示定位:标签与规则扩展

显式定位是最容易理解的一类方法。

平台先分析种子人群常见的标签,例如地域、设备、内容兴趣、消费层级、品类偏好或行为标签,再从全量用户中筛选拥有相近标签组合的人群

Lookalike的几种实现方式

  • 优点:简单、直接、计算快
  • 缺点:标签体系有限,无法发现“标签不同但行为相似”的深层关系;试错成本高,手动调优难
  • 代表平台:腾讯DMP早期版本采用此方案(注:腾讯DMP已停止服务,此处仅作技术溯源参考)

这种方式适合拥有海量用户数据、能构建完整画像的大平台。但随着行业向智能化方向发展,主流平台已逐步转向隐式定位。

 

隐式定位:基于算法建模

隐式定位不依赖预定义标签,而是通过机器学习、深度学习对种子用户进行建模,然后用模型去“识别”相似用户。

以下是几种主流方法:

基于相似度的模型

相似度模型把每位用户表示成特征向量,再计算候选用户与种子用户之间的接近程度。

常见指标包括:

  • 余弦相似度(Cosine Similarity):适用于高维稀疏特征,例如兴趣标签、浏览类别或内容主题;
  • Jaccard 相似系数:适合比较两个集合的重叠程度,例如两位用户是否浏览过相似类别;
  • 皮尔逊相关系数:更适合存在连续数值关系、且需要比较变化趋势的场景;
  • Tanimoto 系数:可视为广义 Jaccard,相对适合部分数值型向量。

假设用户 A 与用户 B 都有“GA4、GTM、广告归因、数据分析课程”等兴趣或行为特征,两人的向量方向更接近,余弦相似度就可能更高。

但问题也很明显:如果要让每位候选用户都与每位种子用户做一次比较,成本会快速上升。大规模系统常会先使用近似最近邻、向量索引或 LSH(Locality Sensitive Hashing,局部敏感哈希)缩小候选范围,再进行更精细的评分。

Yahoo 的公开论文提出过一套大规模 Lookalike Audience Extension 系统:先用 LSH 构建和筛选候选关系,再按 Campaign 进行更细的排序。这是图模型与机器学习结合的工程案例,而不是所有平台的统一算法。

 

基于分类或倾向评分的模型

另一条常见路线,是把 Lookalike 转化为监督学习问题。

例如:

  • 正样本:已购买、高 LTV 或已成交客户;
  • 负样本:随机抽取、未完成目标行为的用户;
  • 特征:兴趣、内容互动、历史行为、地域、设备、消费或广告响应信号;
  • 输出:用户成为“目标用户”的预测概率或分数。

逻辑回归(LR)是这一类方法中较容易解释的基础模型。它可根据特征估计某用户接近目标人群的概率:用户特征→ 模型评分→ 高于阈值的用户进入候选人群

现在的系统也可能使用 GBDT、深度学习、Embedding、Wide & Deep、Transformer 等模型,以识别非线性关系和复杂行为组合。

协同过滤、图模型与社交关系扩展

协同过滤的核心思想是:

喜好、互动或行为模式相似的用户,可能对相似内容、商品或广告产生相近反应。

例如,用户 A 和用户 C 都经常阅读 GA4 与 GTM 内容,而用户 C 还报名了 Adobe Analytics 课程,那么系统可能将该课程作为用户 A 的潜在兴趣或推荐对象。

当用户、内容、商品、互动和社交关系都构成节点时,系统可以形成图结构,再通过邻居关系、路径、社区或图嵌入来扩展受众。

这类方法在内容推荐、社交网络和大规模广告系统中尤其常见。但“存在社交关系”不等于一定适合扩展,关系强度、共同兴趣、隐私限制和业务目标都会影响效果。

 

 

深度学习与Attention模型

深度模型更适合处理多字段、高维、动态和序列化行为数据。

例如,一个用户最近连续阅读“归因”“GA4”“广告投放”内容,和一个几个月前偶尔浏览过其中一篇文章的用户,虽然拥有相似标签,但即时兴趣强度可能完全不同。

Attention 模型可以尝试识别:

  • 哪些行为更重要;
  • 哪些近期行为更能代表当前意图;
  • 种子人群内部哪些子群体与目标用户更接近。

腾讯公开发表的 RALM(Real-time Attention Based Look-alike Model)论文,讨论了如何通过用户表示学习、全局与局部 Attention,以及种子聚类,在推荐系统中进行实时相似人群扩展。它是一个有参考价值的研究案例,但不应据此推断某一商业产品当前仍使用同一模型。

 

总结如下:

方法类型 核心思路 优点 缺点 谁在用
基于相似度 计算用户与种子用户之间的距离 简单直接,易于理解 计算量大,需加速技术 LinkedIn早期方案
协同过滤 “和你像的人也喜欢什么” 发现隐性关联 冷启动困难 推荐系统常用
分类模型(LR) 训练模型预测“是否为目标用户” 可解释性强 线性模型表达能力有限 腾讯广点通(早期)、360DMP(早期)
分类模型(GBDT) 非线性决策树集成 拟合能力强 计算成本高 阿里巴巴
图模型 构造用户关系图,在图上游走 可处理大规模数据 工程复杂度高 Yahoo
Attention深度模型 实时学习用户兴趣表征 精度高,可实时更新 算力要求高 微信看一看(RALM)

 

Lookalike 的投放策略

拿到 Lookalike 人群后,怎么投最有效率?关键在于分层精细化运营

相似度分层投放

平台通常会按相似度从高到低排序,并按百分比切分:

相似度层级 人群特征 投放建议
1%-2% 与种子用户最接近,转化概率最高 高出价、优先投放,追求ROI
3%-5% 转化潜力稳定,规模适中 主力预算投放,平衡量与质
5%-10% 覆盖更广但精准度下降 品牌曝光、拓新测试,适当控制出价

建议策略:从高相似度(1%-2%)开始投放,验证效果后再逐步扩大到更大范围。不要一次性全量投放,避免预算浪费。

 

效果衡量指标

评估 Lookalike 投放效果,建议关注以下指标:

  • CTR(点击率):与常规定向对比,是否明显提升
  • CVR(转化率):核心指标,验证人群精准度
  • ROI/ROAS:最终目标,评估投放效益
  • CPA(获客成本):是否低于常规定向
  • Lookalike 扩量率:种子用户能扩展出多少倍的受众规模

同时要排除已有客户和再营销用户,避免将原本会转化的人重复计入 Lookalike 成效。

 

最佳实践

  • 种子用户质量 > 数量:1000个高价值付费用户 > 10000个泛活跃用户
  • 定期更新种子用户:用户画像会随时间变化,建议每1-2个月更新一次种子包
  • A/B测试验证:将 Lookalike 定向与常规定向做对照实验,量化提升幅度
  • 结合再营销:先用再营销触达已有用户,再将转化用户作为种子做 Lookalike 扩展,形成获客闭环

 

Lookalike 的局限性与挑战

客观认识 Lookalike 的局限性,才能更好地使用它。

数据依赖性

Lookalike 的效果高度依赖种子用户的数据质量。如果种子用户数量不足(通常要求至少数百个)、标签不准确或样本有偏(比如全是某一地域的用户),算法就难以学到有效的“画像”,最终导致扩展出来的人群质量不佳。

 

冷启动问题

新产品、新品牌或进入新市场时,手上没有现成的种子用户,Lookalike 无法启动。这时候需要先通过其他定向方式获取首批用户,积累一定数据后再启用 Lookalike。

 

隐私合规风险

随着 GDPR(欧盟通用数据保护条例)、CCPA(加州消费者隐私法案)等隐私法规日益严格,平台收集和使用用户数据受到更多限制。广告主需要关注:

  • 种子用户数据的使用是否获得用户授权
  • Lookalike 是否涉及敏感人群定向
  • 数据是否经过脱敏处理

 

算法黑箱

大多数平台不公开 Lookalike 的具体算法细节。广告主很难判断“为什么这些用户被选中”,也难以主动调优。这要求广告主更多地依靠投放测试和数据验证来评估效果,而非单纯信任平台声称的能力。

 

总结

Lookalike 的价值不在于简单复制现有客户,而在于把广告主已有的高价值用户信号,转化为可扩展的获客策略。

如果你刚开始使用 Lookalike,建议先从一批近期高价值购买者或销售确认有效线索开始,优先测试较窄的相似范围,再逐步扩大人群,并持续用真实成交、收入和新客成本评估结果。


有疑问可以在底部留言
喜欢 (12)
发表我的评论
取消评论

Hi,您需要填写昵称和邮箱!

  • 昵称 (必填)
  • 邮箱 (必填)
  • 网址
(1)个小伙伴在吐槽
  1. 但这种方式所错成本高,手动调优难,投放效率低,所以往智能定向的方向发展,请问这句话怎么理解啊,所错?调优难?所以。。。?
    鳗鱼2021-01-09 14:57 回复 Mac OS X | Chrome 87.0.4280.88