当前位置: 首页 > 图灵资讯 > 行业资讯> 高效读取大量 CSV 文件末尾行的实用方法

高效读取大量 CSV 文件末尾行的实用方法

来源:图灵python
时间: 2026-07-10 16:52:05

本文介绍了如何在这里 Python 高效阅读数千所大型中学 CSV 文件的最后 100 为了避免加载整个文件造成的内存和性能瓶颈,核心是使用它 pandas.read_csv 的 skiprows 参数跳过前置线,或结合底层文件操作,实现零内存费用的准确定位。

本文介绍了如何在这里 python 高效阅读数千所大型中学 csv 文件的最后 100 为了避免加载整个文件造成的内存和性能瓶颈,核心是使用它 `pandas.read_csv` 的 `skiprows` 参数跳过前置线,或结合底层文件操作,实现零内存费用的准确定位。

当面对 1000+ 个,每个文件约 10 万行的 CSV 直接使用数据 pd.read_csv(file_path) 加载所有内容不仅耗时,而且耗时(I/O + 分析)还会引起显著的内存压力(尤其是在 Pandas 默认构建完整 DataFrame ).优化的关键在于:只读取必要的数据,跳过无关行。

✅ 推荐方案1:已知行数的时间 —— 使用 skiprows(最简单、高效)

若所有 CSV 文件行数高度一致(如均为) 100,000 行),可直接跳过前 N−100 行:

import pandas as pd

# 假设每个文件都恰到好处 100,000 好吧,只要最后 100 行
df = pd.read_csv(file_path, skiprows=99900, nrows=100)

⚠️ 注意:skiprows=99900 表示跳过前 99,900 行(即保留第 99,901 行起的 100 行);nrows=100 确保读得最多 100 好的,增强鲁棒性。

该方法不需要预扫描文件 Pandas 底层 C 发动机有效地跳过字节流中的行,速度远远超过逐行读取,内存占用仅与目标行数成正比。

Python 3.14.2

Python 3.14.2是Python编程语言于2025年12月5日发布的稳定版本,属于3.14系列的第二次维护更新。该版本包含18个修复项目,重点解决多过程、数据和正则表达模块的回归问题,修复CVE-2025-12084等安全漏洞。这个版本标志着Python发展的一个重要里程碑,即自由线程模式(删除GIL)正式得到官方支持。

下载

✅ 推荐方案二:行数未知时: —— 反向读取(通用稳定)

对于行数不固定或空行/注释 CSV,推荐用 tail 风格的反向扫描(无第三方库):

def read_last_n_lines(filepath, n=100, encoding='utf-8'):
    with open(filepath, 'rb') as f:
        f.seek(0, 2)  # 移动到文件的末尾
        file_size = f.tell()
        if file_size == 0:
            return []
        lines = []
        buffer = b''
        pos = file_size - 1
        while pos >= 0 and len(lines) < n:
            char = f.read(1)
            if char == b'\n' and buffer:
                lines.append(buffer[::-1].decode(encoding))
                buffer = b''
            else:
                buffer += char
            pos -= 1
        if buffer and len(lines) < n:
            lines.append(buffer[::-1].decode(encoding))
        return lines[::-1]  # 恢复正序

# 转为 DataFrame(需处理 CSV 解析逻辑,建议配合 csv 模块)
import csv
from io import StringIO

last_lines = read_last_n_lines(file_path, 100)
csv_str = '\n'.join(last_lines)
df = pd.read_csv(StringIO(csv_str))

? 提示:该方法的本质是“从后到前逐字节扫描” O(k),k 最后所需的字节数与总行数无关,适用于任何大小的文件。

? 关键注意事项
  • 首行是否为 header? 若 CSV 含表头,skiprows 方法需要额外判断:如果跳过行包含 header,则需设置 header=None 并手动指定列名;反向读取方法建议先获取一行样本推断结构。
  • 编码与分隔符:确保 encoding 和 sep 参数与原始文件一致,否则分析可能失败。
  • 内存 vs. 灵活性权衡:skiprows 最快但依赖行数稳定性;反向读取通用性强,适合生产环境部署。
  • 批量处理优化:配合 concurrent.futures.ThreadPoolExecutor 并行处理多个文件可以进一步增加吞吐量(I/O 适用于密集型任务)。

综上所述,根据数据一致性选择策略:行数稳定优先 skiprows;反向阅读是动态场景的首选 + StringIO + pd.read_csv 组合。两者都可以将单个文件的处理时间从秒级降低到毫秒级,完全避免所有加载陷阱。