Pandas read_csv 参数详解

news/2024/5/19 0:54:37

前言

在使用 Pandas 进行数据分析和处理时,read_csv 是一个非常常用的函数,用于从 CSV 文件中读取数据并将其转换成 DataFrame 对象。read_csv 函数具有多个参数,可以根据不同的需求进行灵活的配置。本文将详细介绍 read_csv 函数的各个参数及其用法,帮助大家更好地理解和利用这一功能。

常用参数概述

pandas的 read_csv 函数用于读取CSV文件。以下是一些常用参数:

  • filepath_or_buffer: 要读取的文件路径或对象。
  • sep: 字段分隔符,默认为,。
  • delimiter: 字段分隔符,sep的别名。
  • header: 用作列名的行号,默认为0(第一行),如果没有列名则设为None。
  • names: 列名列表,用于结果DataFrame。
  • index_col: 用作索引的列编号或列名。
  • usecols: 返回的列,可以是列名的列表或由列索引组成的列表。
  • dtype: 字典或列表,指定某些列的数据类型。
  • skiprows: 需要忽略的行数(从文件开头算起),或需要跳过的行号列表。
  • nrows: 需要读取的行数(从文件开头算起)。
  • skipfooter: 文件尾部需要忽略的行数。
  • encoding: 文件编码(如'utf-8','latin-1'等)。
  • parse_dates: 将某些列解析为日期。
  • infer_datetime_format: 如果 True 且 parse_dates 未指定,那么将尝试解析日期。
  • iterator: 如果 True,返回 TextFileReader 对象,用于逐块读取文件。
  • chunksize: 每个块的行数,用于逐块读取文件。
  • compression: 压缩格式,例如 'gzip' 或 'xz'

filepath_or_buffer要读取的文件路径或对象

filepath_or_buffer: FilePath | ReadCsvBuffer[bytes] | ReadCsvBuffer[str]可以接收3种类型,文件路径,读取文件的bytes, 读取文件的str。

  • 可以接受任何有效的字符串路径。该字符串可以是 URL。有效的 URL 方案包括 http、ftp、s3、gs 和 file。对于文件 URL,需要主机。本地文件可以是:file://localhost/path/to/table.csv
  • 想传入一个路径对象,pandas 接受任何 Path
  • 类文件对象是指具有 read() 方法的对象,例如文件句柄(例如通过内置 open 函数)或 StringIO

示例如下:


# 读取字符串路径
import pandas
from pathlib import Path# 1.相对路径,或文件绝对路径
df1 = pandas.read_csv('data.csv')
print(df1)# 文件路径对象Path
file_path = Path(__file__).parent.joinpath('data.csv')
df2 = pandas.read_csv(file_path)
print(df2)# 读取url地址
df3 = pandas.read_csv('http://127.0.0.1:8000/static/data.csv')
print(df3)# 读取文件对象with open('data.csv', encoding='utf8') as fp:df4 = pandas.read_csv(fp)print(df4)

sep: 字段分隔符,默认为,

  • sep 字段分隔符,默认为,
  • delimiter(同sep,分隔符)

示例如下:

df1 = pandas.read_csv('data.csv', sep=',')
print(df1)df2 = pandas.read_csv('data.csv', delimiter=',')
print(df2)

header 用作列名的行号

header: 指定哪一行作为列名,默认为0,即第一行,如果没有列名则设为None。
如下数据,没有header

张三,男,22,123@qq.com
李四,男,23,222@qq.com
王五,女,24,233@qq.com
张六,男,22,123@qq.com# 读取示例
df6 = pandas.read_csv('data2.csv', header=None)
print(df6)

names自定义列名

names自定义列名,如果header=None,则可以使用该参数。

df6 = pandas.read_csv('data2.csv',header=None,names=['姓名', '性别', '年龄', '邮箱'])
print(df6)

index_col 用作行索引的列编号或列名

index_col参数在使用pandas的read_csv函数时用于指定哪一列作为DataFrame的索引。
如果设置为None(默认值),CSV文件中的行索引将用作DataFrame的索引。如果设置为某个列的位置(整数)或列名(字符串),则该列将被用作DataFrame的索引。

import pandas as pd# 我们想要将'`email`'列作为DataFrame的索引df8 = pd.read_csv('data.csv', index_col='email')
print(df8)# 或者,如果我们知道'email'列在第4列的位置,也可以这样指定
df9 = pd.read_csv('data.csv', index_col=3)
print(df9)

usecols 读取指定的列

usecols 读取指定的列,可以是列名或列编号。

import pandas as pd# 1.指定列的编号
df10 = pd.read_csv('data.csv', usecols=[0, 1])
print(df10)# 2.指定列的名称
df11 = pd.read_csv('data.csv', usecols=['name', 'sex'])
print(df11)

skiprows 、nrows 和skipfooter

  • skiprows: 需要忽略的行数(从文件开头算起),或需要跳过的行号列表。
  • nrows: 需要读取的行数(从文件开头算起)
  • skipfooter: 文件尾部需要忽略的行数。

示例如下:

# skiprpws忽略的行数
import pandas as pd# 跳过前面2行
df15 = pd.read_csv('data.csv', skiprows=2)
print(df15)# nrows 需要读取的行数import pandas as pd# 读取前面2行
df15 = pd.read_csv('data.csv', nrows=2)
print(df15)# 文件尾部需要忽略的行数import pandas as pd# 忽略文件尾部3行
df15 = pd.read_csv('data.csv', skipfooter=3)
print(df15)

parse_dates 将某些列解析为日期

示例如下:

name,time,date
Bob,21:33:30,2019-10-10
Jerry,21:30:15,2019-10-10
Tom,21:25:30,2019-10-10
Vince,21:20:10,2019-10-10
Hank,21:40:15,2019-10-10import pandas as pd# 1.指定列的编号
df16 = pd.read_csv('data.csv')
print(df16)-------------
# 结果如下:name      time        date
0    Bob  21:33:30  2019-10-10
1  Jerry  21:30:15  2019-10-10
2    Tom  21:25:30  2019-10-10
3  Vince  21:20:10  2019-10-10
4   Hank  21:40:15  2019-10-10

默认读取的date日期是字符串类型,使用parse_dates 参数转成datetime类型。

import pandas as pddf16 = pd.read_csv('ddd.csv')
print(df16.to_dict())   # 'date': {0: '2019-10-10', 1: '2019-10-10',df17 = pd.read_csv('ddd.csv', parse_dates=['date'])
print(df17.to_dict())  # 'date': {0: Timestamp('2019-10-10 00:00:00')

总结

通过本文的介绍,大家应该对 Pandas 中 read_csv 函数的参数有了更全面的了解。在实际应用中,根据数据的特点和处理需求,灵活使用 read_csv 的各种参数,可以更轻松、高效地进行数据读取和预处理,为数据分析和建模提供更好的基础。

本文来自互联网用户投稿,该文观点仅代表作者本人,不代表本站立场。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如若转载,请注明出处:http://www.hjln.cn/news/24798.html

如若内容造成侵权/违法违规/事实不符,请联系我们进行投诉反馈,一经查实,立即删除!

相关文章

(数据科学学习手札160)使用miniforge代替miniconda

本文已收录至我的Github仓库https://github.com/CNFeffery/DataScienceStudyNotes1 简介大家好我是费老师,conda作为Python数据科学领域的常用软件,是对Python环境及相关依赖进行管理的经典工具,通常集成在anaconda或miniconda等产品中供用户日常使用。但长久以来,conda在很…

Caused by: java.lang.ClassNotFoundException: org.junit.runner.manipulation.Filter问题的解决

问题描述问题解决 后来经过查阅资料发现,是这里出现了问题:只需要将JUnit的路径更改到classpath下面就可以啦:问题完美解决!

games101-3 BRDF101

BRDF101 概述 本文基于知乎Maple对brdf的文章,在此基础又收集了一些其它来源的关于brdf的文章,希望能够完全理解记忆相关知识 关于Jakub Boksansky的文章,看的过程中又去搜集了很多其它文章来理解,发现已经超出了我目前的知识厚度,因此只会简单的翻译一下我能理解的部分,…

开源相机管理库Aravis例程学习(四)——multiple-acquisition-signal

本文针对Aravis官方例程中的:02-multiple-acquisition-signal做简单的讲解,并介绍其中部分函数目录简介例程代码函数说明g_main_loop_newg_main_loop_rung_main_loop_quitg_signal_connectarv_stream_set_emit_signalsQ&A回调函数的同步调用与异步调用帧丢失问题 简介 本…

openCV 图像清晰度检测

图像清晰度评价算法有很多种,在空域中,主要思路是考察图像的领域对比度,即相邻像素间的灰度特征的梯度差;在频域中,主要思路是考察图像的频率分量,对焦清晰的图像高频分量较多,对焦模糊的图像低频分量较多。 这里实现3种清晰度评价方法,分别是Tenengrad梯度方法、Lapla…

Linux:VMware切换仅主机模式并配置静态IP

配置网络编辑器 点击“编辑”->“虚拟网络编辑器”没有仅主机模式的话,可以通过“添加网络”进行新增网络配置。更改虚拟机网路模式 右键“创建的虚拟就”->“设置”登录虚拟机配置静态IP 切换目录到“/etc/sysconfig/network-scripts/”修改“if-ens33”文件TYPE=Ether…

日志服务 HarmonyOS NEXT 日志采集最佳实践

背景信息 随着数字化新时代的全面展开以及 5G 与物联网(IoT)技术的迅速普及,操作系统正面临前所未有的变革需求。在这个背景下,华为公司自主研发的鸿蒙操作系统(HarmonyOS)应运而生,旨在满足万物互联时代的多元化设备接入、高效协同和安全可靠运行的需求。 HarmonyOS 不…