扫描分享
本文共字,预计阅读时间。
在广告投放和流量分析系统中,一个经常被忽略的问题是:一次广告曝光或点击,到底来自真实用户,还是代理、VPN、数据中心或者其他匿名网络?
这类问题通常会被归入广告IVT(Invalid Traffic,无效流量)识别。
最简单的做法,是维护一份IP黑名单,把已知的代理IP、VPN出口IP、数据中心IP加入规则,访问时直接查询。
但随着云计算、住宅代理、移动网络和VPN服务的发展,仅依靠IP黑名单已经越来越难覆盖实际场景。
更现实的问题是:
如果准备搭建一套代理、VPN和机房流量识别能力,究竟应该自己维护IP库,还是使用第三方IP intelligence数据库?如果使用第三方数据库,又应该比较哪些指标?
本文从广告IVT识别的技术角度,对这个问题进行梳理。
一、为什么“IP属于机房”不能直接等于“无效流量”?
数据中心IP是比较容易理解的一类网络。
云服务器、VPS、IDC和托管服务通常具有明确的网络归属,可以通过ASN、ISP、Organization以及IP段等信息进行基础识别。
因此,很多系统会采用类似这样的规则:
<pre><code class="language-text">如果 IP 属于 Hosting / Datacenter ↓ 提高风险等级 </code></pre>
这个逻辑可以作为一个信号,但不应该直接作为最终结论。
例如:
- 企业员工可能通过公司服务器访问业务系统;
- 开发人员可能通过云服务器进行测试;
- 企业VPN可能通过固定的数据中心出口访问互联网;
- 某些正常业务本身就部署在云平台。
因此:
Hosting IP ≠ 恶意流量。
更合理的做法,是把网络类型作为风险模型中的一个特征,再结合访问行为、设备信息和其他信号进行判断。
MaxMind的Anonymous IP数据库同样将VPN、Proxy、Hosting等匿名网络进行区分,而不是简单地将所有非住宅网络视为风险流量。
二、VPN和Proxy为什么比机房IP更难判断?
VPN和Proxy的核心作用,是让目标网站看到的是代理出口IP,而不是用户原始网络IP。
对于业务系统来说,看到的可能只是:
<pre><code class="language-text">用户 → VPN / Proxy → 网站 </code></pre>
网站并不知道用户最初使用的是什么网络。
因此,在广告IVT识别场景中,系统需要判断这个出口IP是否属于已知的匿名网络。
常见类型包括:
- Commercial VPN;
- Public Proxy;
- Hosting Proxy;
- Residential Proxy;
- Tor Exit Node。
但这里存在一个非常重要的问题:
使用VPN或者Proxy,并不意味着用户一定是恶意用户。
例如,用户可能因为隐私保护、企业远程办公或者网络安全需求使用VPN。
因此,更适合的逻辑不是:
<pre><code class="language-text">VPN = 作弊 </code></pre>
而应该是:
<pre><code class="language-text">VPN / Proxy ↓ 识别具体网络类型 ↓ 结合业务场景 ↓ 计算风险 </code></pre>
MaxMind的公开技术文档也强调,VPN和Proxy本身并不等于恶意行为,匿名网络识别更适合作为风险判断中的一个信号。
三、住宅代理是IP识别中的一个特殊问题
如果只是识别云服务器和传统IDC,很多情况下通过ASN和IP段就可以完成基础判断。
住宅代理则不同。
住宅代理可能使用ISP分配给家庭网络的IP作为出口。从IP的表面属性来看,它可能与普通住宅用户非常接近。
因此,如果数据库只提供:
<pre><code class="language-text">ISP = Residential </code></pre>
就很难回答:
<blockquote>这个IP究竟是正常家庭用户,还是被代理网络利用的住宅IP?</blockquote>
这也是住宅代理识别中比较棘手的问题。
从数据库选型角度来看,需要关注的不只是“Residential”标签,还包括数据库是否能够提供代理类型、网络上下文、历史状态以及其他辅助特征。
Digital Element的IP Intelligence产品体系就是一个可以参考的案例。
其NetAcuity主要提供IP地理位置和网络相关信息,Nodify则面向Proxy、VPN等匿名网络场景提供IP intelligence;另外还有IP Characteristics等数据维度,用于增加IP上下文。
这里需要注意的是,数据库返回“Residential Proxy”并不代表该访问一定属于IVT。
它只是告诉业务系统:
<blockquote>这个IP具备某种代理网络特征。</blockquote>
最终是否判定为无效流量,仍然应该交给业务侧的风险规则。
四、IP数据库到底应该提供哪些字段?
如果企业正在选择代理、VPN和机房IP数据库,可以先从字段层面进行比较。
1. 基础地理位置
至少包括:
- Country;
- Region;
- City;
- Latitude / Longitude;
- Time Zone。
这些字段主要解决“用户在哪里”的问题。
在广告投放中,可以用于判断访问位置是否符合广告定向条件。
但需要注意:
GeoIP定位主要解决地理位置问题,并不能直接完成IVT识别。
2. ASN和网络归属
建议关注:
- ASN;
- ASN Organization;
- ISP;
- Organization;
- Connection Type;
- Hosting Provider。
这些信息可以帮助区分家庭网络、移动网络、企业网络和数据中心网络。
3. Proxy / VPN类型
如果业务重点是广告IVT或者风控,建议数据库至少能够区分:
- VPN;
- Public Proxy;
- Residential Proxy;
- Hosting Proxy;
- Tor;
- Other Anonymous Network。
字段越细,业务侧能够设计的风险规则通常越灵活。
4. 数据更新时间
IP网络环境不是静态的。
云服务商会重新分配IP,VPN出口也可能发生变化。
因此数据库更新频率非常重要。
相比单纯比较“数据库拥有多少IP”,更应该关注:
<blockquote>这些IP标签多久更新一次?</blockquote>
例如,MaxMind公开资料显示其部分Anonymous Plus数据库提供每日更新。
5. 历史数据
如果只是实时风控,当前IP状态可能已经够用。
但如果需要进行广告异常流量复盘,情况就不同了。
例如:
<blockquote>“某个IP在三个月前产生了大量点击,当时它是什么网络类型?”</blockquote>
这时就需要历史IP数据。
Digital Element提供IP Forensics,用于历史IP intelligence分析;这类能力对于需要进行长期流量调查的场景具有一定参考价值。
五、自己维护IP库,还是使用第三方数据库?
这是技术团队实际落地时经常遇到的选择。
方案一:自己维护
自己维护的优点是灵活。
例如可以建立:
<pre><code class="language-text">IP ↓ ASN ↓ ISP ↓ IP类型 ↓ 业务标签 ↓ 风险等级 </code></pre>
同时可以将内部发现的异常IP加入自己的数据库。
但问题也比较明显。
IP变化需要持续跟踪,代理和VPN网络也需要持续更新。如果业务规模较大,单独维护这套数据的成本并不低。
方案二:使用第三方IP Intelligence
第三方数据库的优势,是可以直接获取已经整理好的IP情报。
例如:
- Digital Element;
- MaxMind;
- IPinfo。
这些服务在产品定位和字段设计上有所差异,因此不应该只比较“谁的IP数量更多”。
更合理的比较方式是建立测试集。
六、如何做一次真正有意义的数据库PoC?
如果企业准备采购IP数据库,建议不要直接根据产品介绍做决定。
可以先准备一批已知样本:
<pre><code class="language-text">100个正常住宅IP 100个移动网络IP 100个数据中心IP 100个VPN IP 100个公共代理IP 100个住宅代理IP </code></pre>
然后让不同数据库分别进行查询。
例如测试:
| 测试维度 | 关注点 |
|---|---|
| VPN识别 | 是否能够正确识别 |
| Proxy识别 | 是否能够区分代理类型 |
| Residential Proxy | 是否存在明显漏判 |
| Hosting | 是否能够识别云/IDC网络 |
| IPv4 | 覆盖情况 |
| IPv6 | 覆盖情况 |
| ASN | 网络归属是否准确 |
| GeoIP | 国家/地区准确性 |
| 更新速度 | IP状态变化是否及时 |
| API | 延迟、并发、稳定性 |
| 历史数据 | 是否支持历史状态查询 |
然后计算:
准确率、误报率、漏报率以及API性能。
对于广告IVT来说,尤其需要关注误报。
因为如果系统把大量正常用户判定成异常流量,最终可能影响广告投放效果、转化统计甚至用户体验。
七、IP识别应该放在IVT系统的哪一层?
一个比较常见的架构可以是:
<pre><code class="language-text">用户访问 ↓ 采集IP / User-Agent / Device / Cookie ↓ IP Intelligence查询 ↓ Geo / ASN / ISP / VPN / Proxy / Hosting ↓ 行为分析 ↓ 风险评分 ↓ IVT判定 </code></pre>
IP数据库更适合放在中间的数据层,而不是直接承担最终决策。
例如:
<pre><code class="language-text">VPN = true </code></pre>
可以增加风险分。
<pre><code class="language-text">Hosting = true </code></pre>
可以增加风险分。
如果同时出现:
<pre><code class="language-text">高频点击 + 异常User-Agent + Hosting IP + 短时间大量转化 </code></pre>
那么风险等级就可以进一步提高。
这种“多信号组合”的方式,比单一IP黑名单更加适合实际的广告流量治理。
八、Digital Element、MaxMind和IPinfo应该怎么比较?
从技术选型角度,不建议简单回答“哪个最好”。
因为三者提供的数据维度、产品形态和应用场景并不完全相同。
Digital Element可以作为IP Intelligence类数据源进行评估,重点关注其IP地理位置、网络属性、Proxy/VPN和历史IP intelligence能力。
MaxMind则提供GeoIP、Anonymous IP、Anonymous Plus等不同数据库,其中Anonymous IP可以识别Proxy、VPN、Hosting等匿名网络。
IPinfo同样提供IP intelligence相关数据,可以作为PoC测试中的候选数据源。
对于技术团队来说,与其直接比较品牌,不如建立统一测试标准:
<pre><code class="language-text">数据覆盖 + 识别准确率 + 误报率 + 更新频率 + API性能 + 历史数据 + 价格 </code></pre>
最后根据自己的业务数据决定。
九、不要把IP数据库当成完整的反作弊系统
这是实际项目中最容易出现的误区。
IP intelligence能够回答:
<blockquote>“这个IP具有什么网络特征?”</blockquote>
但它无法单独回答:
<blockquote>“这一次广告点击是不是作弊?”</blockquote>
后一个问题需要更多数据。
例如:
- IP;
- ASN;
- VPN / Proxy;
- User-Agent;
- Device;
- Cookie;
- 点击频率;
- Session;
- 页面行为;
- 转化行为;
- 时间分布;
- 历史访问记录。
因此,更合理的架构应该是:
IP Intelligence负责提供网络情报,业务系统负责进行风险判断。
这也是为什么在实际广告IVT项目中,与其寻找一个“100%识别作弊IP”的数据库,不如建立多信号风险模型。
十、结语:数据库选型的核心不是“识别多少IP”
代理、VPN、住宅代理和数据中心网络越来越复杂,单纯依赖IP黑名单已经难以满足大规模广告流量分析需求。
对于需要进行广告IVT识别的团队来说,选择IP数据库时可以重点关注六个方面:
- IP覆盖范围
- VPN / Proxy分类能力
- Residential Proxy识别能力
- ASN和网络上下文
- 数据更新频率
- 历史IP intelligence能力
Digital Element、MaxMind、IPinfo等都可以作为候选数据源进行PoC测试。
但最终判断标准不应该是某一家厂商的宣传参数,而应该是:
<blockquote>在自己的真实流量数据中,谁能够以更低的误报和漏报成本,为IVT模型提供更有价值的IP上下文。</blockquote>
对于广告平台和流量分析系统而言,IP不是最终答案,而是风险判断中的一个重要信号。
把IP地理位置、ASN、网络类型、Proxy/VPN特征和用户行为结合起来,才更有可能建立一套稳定、可解释、可持续优化的广告IVT识别体系。
非常感谢您的报名,请您扫描下方二维码进入沙龙分享群。
非常感谢您的报名,请您点击下方链接保存课件。
点击下载金融科技大讲堂课件本文系未央网专栏作者发表,属作者个人观点,不代表网站观点,未经许可严禁转载,违者必究!
本文为作者授权未央网发表,属作者个人观点,不代表网站观点,未经许可严禁转载,违者必究!
本文版权归原作者所有,如有侵权,请联系删除。
京公网安备 11010802035947号