广告投放遇到一个很常见的问题:再营销人群通常转化较高,但规模有限;直接扩大兴趣、地域或关键词定向,规模虽然变大,却容易带来大量低质量流量。
Lookalike(相似受众) 应运而生——它通过数据和算法,将现有优质客户的特征“复制”到潜在用户中,帮助广告主在茫茫人海中精准找到“对的人”。
什么是 Lookalike?
对数字营销从业者来说,这个概念应该不陌生:
简单说:Lookalike 是一种基于现有用户数据,利用算法找到与这些用户行为、兴趣和特征相似的潜在用户群体的工具。
核心目标:在不直接知道新用户信息的情况下,扩大高潜力客户群体,提升广告转化率。
打个比方:假如你经营一家高端健身房,现有会员里有一批“每周来3次、年年续费”的优质客户。Lookalike 要做的事,就是让平台从全网用户中,找出和这批优质客户“画像最像”的人,然后你把广告投给他们。你不需要知道这些人是谁,算法帮你找。
传统定向 vs Lookalike定向
| 对比维度 | 传统定向 | Lookalike 定向 |
|---|---|---|
| 受众来源 | 广告主手动定义标签(如“25-35岁男性”) | 算法根据种子用户自动扩展 |
| 精准度 | 依赖人为经验,容易偏差 | 基于数据驱动,客观精准 |
| 覆盖规模 | 受限于标签组合,规模有限 | 可指数级扩大潜在受众 |
| 时效性 | 静态,需人工调整 | 动态,可随种子用户更新 |
Lookalike是如何工作的?
整个流程可以分为四个步骤:种子用户 → 特征分析 → 相似度计算 → 生成相似受众
第一步:选取种子用户
种子用户是 Lookalike 的“原材料”,其质量直接决定最终效果。种子用户越精准、规模越大,效果越好。
常见种子用户类型:
- 高价值客户:付费用户、重复购买用户
- 高活跃度用户:高频访问、深度互动用户
- 注册或订阅用户:完成留资或订阅的用户
- 已有转化用户:完成下载、申请、购买等转化行为的用户
第二步:分析用户特征
平台会系统分析种子用户的各类特征,包括:
- 人口统计信息:年龄、性别、地域、职业
- 兴趣偏好:浏览内容、关注话题、互动对象
- 行为习惯:上网时段、设备偏好、消费频次
- 消费特征:客单价、购买品类、决策周期
第三步:寻找相似人群
算法从平台的全部活跃用户中,通过机器学习模型计算每个用户与种子用户的相似度,筛选出得分最高的潜在高价值用户群。
第四步:生成相似受众
广告主可以直接将广告投放给 Lookalike 人群,并根据相似度分层制定差异化投放策略。
种子人群怎么选?
很多 Lookalike 投放效果差,不一定是算法问题,而是种子定义得太宽泛。
优先使用接近最终业务目标的种子
| 目标 | 更适合作为种子的行为 | 不建议直接作为种子的行为 |
|---|---|---|
| 电商成交 | 高客单购买、复购、利润较高订单 | 所有页面访问者 |
| B2B 获客 | 销售确认有效线索、成交客户 | 任意表单提交 |
| App 付费 | 付费、订阅续费、高留存用户 | 安装用户 |
| 内容订阅 | 付费订阅、持续阅读且转化用户 | 所有文章浏览用户 |
如果把“所有访问者”作为种子,模型可能找到的是“容易访问网站的人”,而不是“更可能购买的人”。
种子质量比规模更重要
种子规模过小,平台可能缺乏足够信号;但种子越大也不一定越好。将大量低质量、过期或与目标无关的用户混入种子,反而会降低人群区分度。
以 Meta 为例,官方建议 Lookalike 的来源受众通常使用 1,000–5,000 人,并允许从较小来源开始创建;但这只是平台建议,不是所有业务都适用的固定标准。
Lookalike 使用哪些算法?
广告平台通常不会公开完整模型、特征权重或实时投放逻辑。因此,下面介绍的是行业中常见的技术路线,而不是某个平台的唯一实现方式。
实际系统通常采用多阶段架构:规则或标签初筛 → 候选人群召回 → 相似度或倾向评分 → 排序 → 竞价与投放反馈优化
显示定位:标签与规则扩展
显式定位是最容易理解的一类方法。
平台先分析种子人群常见的标签,例如地域、设备、内容兴趣、消费层级、品类偏好或行为标签,再从全量用户中筛选拥有相近标签组合的人群
- 优点:简单、直接、计算快
- 缺点:标签体系有限,无法发现“标签不同但行为相似”的深层关系;试错成本高,手动调优难
- 代表平台:腾讯DMP早期版本采用此方案(注:腾讯DMP已停止服务,此处仅作技术溯源参考)
这种方式适合拥有海量用户数据、能构建完整画像的大平台。但随着行业向智能化方向发展,主流平台已逐步转向隐式定位。
隐式定位:基于算法建模
隐式定位不依赖预定义标签,而是通过机器学习、深度学习对种子用户进行建模,然后用模型去“识别”相似用户。
以下是几种主流方法:
基于相似度的模型
相似度模型把每位用户表示成特征向量,再计算候选用户与种子用户之间的接近程度。
常见指标包括:
- 余弦相似度(Cosine Similarity):适用于高维稀疏特征,例如兴趣标签、浏览类别或内容主题;
- Jaccard 相似系数:适合比较两个集合的重叠程度,例如两位用户是否浏览过相似类别;
- 皮尔逊相关系数:更适合存在连续数值关系、且需要比较变化趋势的场景;
- Tanimoto 系数:可视为广义 Jaccard,相对适合部分数值型向量。
假设用户 A 与用户 B 都有“GA4、GTM、广告归因、数据分析课程”等兴趣或行为特征,两人的向量方向更接近,余弦相似度就可能更高。
但问题也很明显:如果要让每位候选用户都与每位种子用户做一次比较,成本会快速上升。大规模系统常会先使用近似最近邻、向量索引或 LSH(Locality Sensitive Hashing,局部敏感哈希)缩小候选范围,再进行更精细的评分。
Yahoo 的公开论文提出过一套大规模 Lookalike Audience Extension 系统:先用 LSH 构建和筛选候选关系,再按 Campaign 进行更细的排序。这是图模型与机器学习结合的工程案例,而不是所有平台的统一算法。
基于分类或倾向评分的模型
另一条常见路线,是把 Lookalike 转化为监督学习问题。
例如:
- 正样本:已购买、高 LTV 或已成交客户;
- 负样本:随机抽取、未完成目标行为的用户;
- 特征:兴趣、内容互动、历史行为、地域、设备、消费或广告响应信号;
- 输出:用户成为“目标用户”的预测概率或分数。
逻辑回归(LR)是这一类方法中较容易解释的基础模型。它可根据特征估计某用户接近目标人群的概率:用户特征→ 模型评分→ 高于阈值的用户进入候选人群
现在的系统也可能使用 GBDT、深度学习、Embedding、Wide & Deep、Transformer 等模型,以识别非线性关系和复杂行为组合。
协同过滤、图模型与社交关系扩展
协同过滤的核心思想是:
喜好、互动或行为模式相似的用户,可能对相似内容、商品或广告产生相近反应。
例如,用户 A 和用户 C 都经常阅读 GA4 与 GTM 内容,而用户 C 还报名了 Adobe Analytics 课程,那么系统可能将该课程作为用户 A 的潜在兴趣或推荐对象。
当用户、内容、商品、互动和社交关系都构成节点时,系统可以形成图结构,再通过邻居关系、路径、社区或图嵌入来扩展受众。
这类方法在内容推荐、社交网络和大规模广告系统中尤其常见。但“存在社交关系”不等于一定适合扩展,关系强度、共同兴趣、隐私限制和业务目标都会影响效果。
深度学习与Attention模型
深度模型更适合处理多字段、高维、动态和序列化行为数据。
例如,一个用户最近连续阅读“归因”“GA4”“广告投放”内容,和一个几个月前偶尔浏览过其中一篇文章的用户,虽然拥有相似标签,但即时兴趣强度可能完全不同。
Attention 模型可以尝试识别:
- 哪些行为更重要;
- 哪些近期行为更能代表当前意图;
- 种子人群内部哪些子群体与目标用户更接近。
腾讯公开发表的 RALM(Real-time Attention Based Look-alike Model)论文,讨论了如何通过用户表示学习、全局与局部 Attention,以及种子聚类,在推荐系统中进行实时相似人群扩展。它是一个有参考价值的研究案例,但不应据此推断某一商业产品当前仍使用同一模型。
总结如下:
| 方法类型 | 核心思路 | 优点 | 缺点 | 谁在用 |
|---|---|---|---|---|
| 基于相似度 | 计算用户与种子用户之间的距离 | 简单直接,易于理解 | 计算量大,需加速技术 | LinkedIn早期方案 |
| 协同过滤 | “和你像的人也喜欢什么” | 发现隐性关联 | 冷启动困难 | 推荐系统常用 |
| 分类模型(LR) | 训练模型预测“是否为目标用户” | 可解释性强 | 线性模型表达能力有限 | 腾讯广点通(早期)、360DMP(早期) |
| 分类模型(GBDT) | 非线性决策树集成 | 拟合能力强 | 计算成本高 | 阿里巴巴 |
| 图模型 | 构造用户关系图,在图上游走 | 可处理大规模数据 | 工程复杂度高 | Yahoo |
| Attention深度模型 | 实时学习用户兴趣表征 | 精度高,可实时更新 | 算力要求高 | 微信看一看(RALM) |
Lookalike 的投放策略
拿到 Lookalike 人群后,怎么投最有效率?关键在于分层精细化运营。
相似度分层投放
平台通常会按相似度从高到低排序,并按百分比切分:
| 相似度层级 | 人群特征 | 投放建议 |
|---|---|---|
| 1%-2% | 与种子用户最接近,转化概率最高 | 高出价、优先投放,追求ROI |
| 3%-5% | 转化潜力稳定,规模适中 | 主力预算投放,平衡量与质 |
| 5%-10% | 覆盖更广但精准度下降 | 品牌曝光、拓新测试,适当控制出价 |
建议策略:从高相似度(1%-2%)开始投放,验证效果后再逐步扩大到更大范围。不要一次性全量投放,避免预算浪费。
效果衡量指标
评估 Lookalike 投放效果,建议关注以下指标:
- CTR(点击率):与常规定向对比,是否明显提升
- CVR(转化率):核心指标,验证人群精准度
- ROI/ROAS:最终目标,评估投放效益
- CPA(获客成本):是否低于常规定向
- Lookalike 扩量率:种子用户能扩展出多少倍的受众规模
同时要排除已有客户和再营销用户,避免将原本会转化的人重复计入 Lookalike 成效。
最佳实践
- 种子用户质量 > 数量:1000个高价值付费用户 > 10000个泛活跃用户
- 定期更新种子用户:用户画像会随时间变化,建议每1-2个月更新一次种子包
- A/B测试验证:将 Lookalike 定向与常规定向做对照实验,量化提升幅度
- 结合再营销:先用再营销触达已有用户,再将转化用户作为种子做 Lookalike 扩展,形成获客闭环
Lookalike 的局限性与挑战
客观认识 Lookalike 的局限性,才能更好地使用它。
数据依赖性
Lookalike 的效果高度依赖种子用户的数据质量。如果种子用户数量不足(通常要求至少数百个)、标签不准确或样本有偏(比如全是某一地域的用户),算法就难以学到有效的“画像”,最终导致扩展出来的人群质量不佳。
冷启动问题
新产品、新品牌或进入新市场时,手上没有现成的种子用户,Lookalike 无法启动。这时候需要先通过其他定向方式获取首批用户,积累一定数据后再启用 Lookalike。
隐私合规风险
随着 GDPR(欧盟通用数据保护条例)、CCPA(加州消费者隐私法案)等隐私法规日益严格,平台收集和使用用户数据受到更多限制。广告主需要关注:
- 种子用户数据的使用是否获得用户授权
- Lookalike 是否涉及敏感人群定向
- 数据是否经过脱敏处理
算法黑箱
大多数平台不公开 Lookalike 的具体算法细节。广告主很难判断“为什么这些用户被选中”,也难以主动调优。这要求广告主更多地依靠投放测试和数据验证来评估效果,而非单纯信任平台声称的能力。
总结
Lookalike 的价值不在于简单复制现有客户,而在于把广告主已有的高价值用户信号,转化为可扩展的获客策略。
如果你刚开始使用 Lookalike,建议先从一批近期高价值购买者或销售确认有效线索开始,优先测试较窄的相似范围,再逐步扩大人群,并持续用真实成交、收入和新客成本评估结果。
