虽然使用set是直接的,但隐患很大,因为它只匹配字符串,无法识别协议、大小写、参数顺序和其他语义重复;必须首先标准化URL(统一scheme小写、去尾斜杠、排序和重建query、忽略fragment),然后使用set或布隆过滤器去除重量。用
set 去重是最直接但有隐患的做法
刚爬完一批 URL,直接丢进 set 看似简单: unique_urls = list(set(raw_urls))。但它会破坏原始顺序,无法处理协议、参数、路径大小写等“逻辑重复”。例如 "https://example.com" 和 "http://example.com/" 在 set 实际指向同一资源的是两个元素。
真正需要过滤的是语义重复,而不是字符串重复。在判断重复之前,建议先做标准化:
- 统一 scheme(全转
https或保留原 scheme 但是强迫小写) - 移除末尾斜杠:
url.rstrip("/") - 分析并排序查询参数:
urllib.parse.urlparse+urllib.parse.parse_qs→sorted()后重建 query 字符串 - 忽略 fragment(
#xxx部分),不影响服务器请求
urllib.parse.urlunparse 标准化 URL 再去重
手动拼接容易出错,推荐使用 urllib.parse 拆卸和组装。关键点是:不要使用 urlparse().geturl(),它不处理参数顺序;必须自行重建 query。
from urllib.parse import urlparse, urlunparse, parse_qs, urlencode
<p>def normalize_url(url):
parsed = urlparse(url)</p><h1>忽略 fragment,清空 params、username、password、port(除非默认)</h1><pre class="brush:php;toolbar:false;"><pre class="brush:php;toolbar:false;">clean_netloc = parsed.netloc.lower()
if parsed.port and parsed.scheme == "http" and parsed.port != 80:
clean_netloc = f"{parsed.hostname}:{parsed.port}"
elif parsed.port and parsed.scheme == "https" and parsed.port != 443:
clean_netloc = f"{parsed.hostname}:{parsed.port}"
# 标准化 query:解析 → 排序键 → 重建
query_dict = parse_qs(parsed.query, keep_blank_values=True)
sorted_query = "&".join(
f"{k}={v[0]}" for k, v in sorted(query_dict.items())
)
# path 去重尾部 /
clean_path = parsed.path.rstrip("/") or "/"
return urlunparse((
parsed.scheme.lower(),
clean_netloc,
clean_path,
"", # params 不常用,留空
sorted_query,
"" # fragment 忽略
))</code></pre>之后再用 set 或 <code>dict.fromkeys() 保序去重:seen = set(); unique = [u for u in urls if normalize_url(u) not in seen and not seen.add(normalize_url(u))](注:这里调用两次 normalize_url,生产环境应缓存结果)。
立即学习“Python免费学习笔记(深入);
大规模抓取时,不要只依赖内存set,考虑布隆过滤器
当 URL 总量超过100万级,内存紧张或需要跨过进程/重启后仍然去重,set 这是不合适的。此时,使用布隆过滤器(Bloom Filter)节省空间,但误判率很小(新的 URL 将其视为现有)。
Python 3.14.2
Python 3.14.2是Python编程语言于2025年12月5日发布的稳定版本,属于3.14系列的第二次维护更新。该版本包含18个修复项目,重点解决多过程、数据和正则表达模块的回归问题,修复CVE-2025-12084等安全漏洞。这个版本标志着Python发展的一个重要里程碑,即自由线程模式(删除GIL)正式得到官方支持。
下载推荐 pybloom-live(支持序列化):
- 安装:
pip install pybloom-live - 预估总量和误判率的初始化:
bloom = BloomFilter(capacity=1000000, error_rate=0.001) - 插入前检查:
if normalized_url not in bloom: bloom.add(normalized_url); save_url(...)
注:布隆过滤器不能删除元素,也不能保证 100% 准确。如果业务不能容忍漏抓,必须配合持久存储(如 SQLite 的 UNIQUE 约束)做最终验证。
若发现大量重复 URL,不要急于过滤——首先检查爬虫是否被重定向或跳转。例如,访问 /login 总被 302 到 /login?next=/login,参数不断叠加,normalize_url 可能仍然被判定为不同。
建议增加一层测试:
- 记录超过重定向链长度的重定向链 5 跳跃时中断并报警
- 重复高频 host + path 组合(如
example.com/api/data),抽样打印原始响应状态码Location头 - 启用
requests.Session()的resolve_redirects=False,控制自己的跳转逻辑
URL 去重只是下游补救,上游请求策略和重定向处理才是根本原因。无论标准化函数有多好,都无法挽救设计混乱的爬行过程。