python读取大型csv文件，降低内存占用，提高程序处理速度

您所在的位置：网站首页 › 提取内存中的文件 › python读取大型csv文件，降低内存占用，提高程序处理速度

python读取大型csv文件，降低内存占用，提高程序处理速度

2024-07-17 14:31:34| 来源: 网络整理| 查看: 265

文章目录简介读取前多少行读取属性列逐块读取整个文件总结参考资料

简介

遇到大型的csv文件时，pandas会把该文件全部加载进内存，从而导致程序运行速度变慢。本文提供了批量读取csv文件、读取属性列的方法，减轻内存占用情况。

import pandas as pd input_file = 'data.csv' 读取前多少行

加载前100000行数据

df = pd.read_csv(input_file, nrows=1e5) df

查看每个字段占用的系统内存的情况

df.info(memory_usage='deep')

设置 memory_usage 的参数为 ‘deep’ 时，深度检查对象中的内存使用情况，包括对象中可能包含的其他对象（如列表、数组或其他数据结构）。若不设置deep参数，memory_usage 只会返回一个对象的基础内存使用情况，这主要基于对象本身的内存占用，而不考虑它可能引用的其他对象。在这里插入图片描述如上图所示，前100000行数据共占用220.MB内存。

查看每列属性的内存占用情况；

item = df.memory_usage(deep=True)

在这里插入图片描述

针对每个属性列的字节数进行求和，使用/ (1024 ** 2)，实现1B到1MB的单位转换。验证了所有属性列的内存占用确实为 220.8MB。

在这里插入图片描述

内存占用从高到低降序排列：

df.memory_usage(deep=True).sort_values(ascending=False)

在这里插入图片描述

读取属性列

可能我们只关心，一整张表中的某几个属性，比如：'企业名称', '经营范围'。那么便无需把整张表加载进内存。

df2 = pd.read_csv(input_file, nrows=1e5, usecols=['企业名称', '经营范围'])

查看一下内存占用

df2.memory_usage(deep=True).sum() / (1024 ** 2)

在这里插入图片描述只读取两个属性列，内存占用只有33MB。

逐块读取整个文件

pd.read_csv(input_file, chunksize=1e3, nrows=1e5)

nrows=1e5: 读取100000条数据；chunksize=1e3: 每一块是1000条数据；

故1e5条数据，应该由100块1e3的数据组成；

# 分批次读取, 每chunksize是一个批次 chunk_dfs = pd.read_csv(input_file, chunksize=1e3, nrows=1e5) v = 0 cnt = 0 # 每个chunk_df 都是 dataframe 类型数据 for chunk_df in chunk_dfs: print(chunk_df.shape) cnt += 1 v += chunk_df.shape[0] print(v, cnt)

在这里插入图片描述上图验证了，总共处理了1e5条数据，分成了100块进行读取。

总结 pd.read_csv(input_file, nrows, usecols, chunksize) nrows: 读取多少行数据；usecols: 读取哪些属性列的数据；chunksize：分块读取，每一块的大小是多少条数据；参考资料推荐 | 如何处理远超电脑内存的csv文件

【本文地址】

公司简介

联系我们

今日新闻

点击排行

实验室常用的仪器、试剂和: 说到实验室常用到的东西，主要就分为仪器、试剂和耗

不用再找了，全球10大实验: 01、赛默飞世尔科技（热电）Thermo Fisher Scientif

三代水柜的量产巅峰T-72坦: 作者：寞寒最近，西边闹腾挺大，本来小寞以为忙完这

通风柜跟实验室通风系统有: 说到通风柜跟实验室通风，不少人都纠结二者到底是不

集消毒杀菌、烘干收纳为一: 厨房是家里细菌较多的地方，潮湿的环境、没有完全密

实验室设备之全钢实验台如: 全钢实验台是实验室家具中较为重要的家具之一，很多

图片新闻

实验室药品柜的特性有哪些: 实验室药品柜是实验室家具的重要组成部分之一，主要

小学科学实验中有哪些教学: 计算机计算器一般打孔器打气筒仪器车显微镜

实验室各种仪器原理动图讲: 1.紫外分光光谱UV分析原理：吸收紫外光能量，引起分

高中化学常见仪器及实验装: 1、可加热仪器：2、计量仪器：（1）仪器A的名称：量

微生物操作主要设备和器具: 今天盘点一下微生物操作主要设备和器具，别嫌我啰嗦

浅谈通风柜使用基本常识: 　众所周知，通风柜功能中最主要的就是排气功能。在

python读取大型csv文件，降低内存占用，提高程序处理速度

python读取大型csv文件，降低内存占用，提高程序处理速度

今日新闻

点击排行

推荐新闻

图片新闻

专题文章