当前位置: 首页 > 图灵资讯 > 行业资讯> 如何使用Python检测并过滤爬虫抓取到的重复URL链接?

如何使用Python检测并过滤爬虫抓取到的重复URL链接?

来源:图灵python
时间: 2026-07-14 16:54:59
虽然使用set是直接的,但隐患很大,因为它只匹配字符串,无法识别协议、大小写、参数顺序和其他语义重复;必须首先标准化URL(统一scheme小写、去尾斜杠、排序和重建query、忽略fragment),然后使用set或布隆过滤器去除重量。

set 去重是最直接但有隐患的做法

刚爬完一批 URL,直接丢进 set 看似简单: unique_urls = list(set(raw_urls))。但它会破坏原始顺序,无法处理协议、参数、路径大小写等“逻辑重复”。例如 "https://example.com""http://example.com/"set 实际指向同一资源的是两个元素。

真正需要过滤的是语义重复,而不是字符串重复。在判断重复之前,建议先做标准化:

  • 统一 scheme(全转 https 或保留原 scheme 但是强迫小写)
  • 移除末尾斜杠:url.rstrip("/")
  • 分析并排序查询参数:urllib.parse.urlparse + urllib.parse.parse_qssorted() 后重建 query 字符串
  • 忽略 fragment(#xxx 部分),不影响服务器请求
urllib.parse.urlunparse 标准化 URL 再去重

手动拼接容易出错,推荐使用 urllib.parse 拆卸和组装。关键点是:不要使用 urlparse().geturl(),它不处理参数顺序;必须自行重建 query。

from urllib.parse import urlparse, urlunparse, parse_qs, urlencode
<p>def normalize_url(url):
parsed = urlparse(url)</p><h1>忽略 fragment,清空 params、username、password、port(除非默认)</h1><pre class="brush:php;toolbar:false;"><pre class="brush:php;toolbar:false;">clean_netloc = parsed.netloc.lower()
if parsed.port and parsed.scheme == "http" and parsed.port != 80:
    clean_netloc = f"{parsed.hostname}:{parsed.port}"
elif parsed.port and parsed.scheme == "https" and parsed.port != 443:
    clean_netloc = f"{parsed.hostname}:{parsed.port}"
# 标准化 query:解析 → 排序键 → 重建
query_dict = parse_qs(parsed.query, keep_blank_values=True)
sorted_query = "&".join(
    f"{k}={v[0]}" for k, v in sorted(query_dict.items())
)
# path 去重尾部 /
clean_path = parsed.path.rstrip("/") or "/"
return urlunparse((
    parsed.scheme.lower(),
    clean_netloc,
    clean_path,
    "",  # params 不常用,留空
    sorted_query,
    ""   # fragment 忽略
))</code></pre>

之后再用 set 或 <code>dict.fromkeys() 保序去重:seen = set(); unique = [u for u in urls if normalize_url(u) not in seen and not seen.add(normalize_url(u))](注:这里调用两次 normalize_url,生产环境应缓存结果)。

立即学习“Python免费学习笔记(深入);

大规模抓取时,不要只依赖内存 set,考虑布隆过滤器

当 URL 总量超过100万级,内存紧张或需要跨过进程/重启后仍然去重,set 这是不合适的。此时,使用布隆过滤器(Bloom Filter)节省空间,但误判率很小(新的 URL 将其视为现有)。

Python 3.14.2

Python 3.14.2是Python编程语言于2025年12月5日发布的稳定版本,属于3.14系列的第二次维护更新。该版本包含18个修复项目,重点解决多过程、数据和正则表达模块的回归问题,修复CVE-2025-12084等安全漏洞。这个版本标志着Python发展的一个重要里程碑,即自由线程模式(删除GIL)正式得到官方支持。

下载

推荐 pybloom-live(支持序列化):

  • 安装:pip install pybloom-live
  • 预估总量和误判率的初始化:bloom = BloomFilter(capacity=1000000, error_rate=0.001)
  • 插入前检查:if normalized_url not in bloom: bloom.add(normalized_url); save_url(...)

注:布隆过滤器不能删除元素,也不能保证 100% 准确。如果业务不能容忍漏抓,必须配合持久存储(如 SQLite 的 UNIQUE 约束)做最终验证。

在反爬场景下,URL 重复可能掩盖真实问题

若发现大量重复 URL,不要急于过滤——首先检查爬虫是否被重定向或跳转。例如,访问 /login 总被 302 到 /login?next=/login,参数不断叠加,normalize_url 可能仍然被判定为不同。

建议增加一层测试:

  • 记录超过重定向链长度的重定向链 5 跳跃时中断并报警
  • 重复高频 host + path 组合(如 example.com/api/data),抽样打印原始响应状态码 Location
  • 启用 requests.Session()resolve_redirects=False,控制自己的跳转逻辑

URL 去重只是下游补救,上游请求策略和重定向处理才是根本原因。无论标准化函数有多好,都无法挽救设计混乱的爬行过程。