Python Pandas 可以处理哪些类型的数据?
如果使用机器学习或数据科学等技术,就必须处理数据。数据是这些技术的基础。实时处理数据是一个非常困难的过程,因为现实世界的数据非常混乱。
使用 Python Pandas 包的主要优势在于它拥有众多处理数据的函数。众所周知,实时数据可以是任何形式,例如字符、整数、浮点值、分类数据等等。
Pandas 最适合处理或操作表格数据,因为它拥有一个 DataFrame 对象,该对象拥有更多函数。 DataFrame 是一种二维数据结构,用于存储表格数据,数据可以是任何格式(整数、字符、浮点数、分类值等等)。
示例
import pandas as pd
data = pd.read_csv('sales_data.csv')
data.dtypes
解释
通过使用 import 关键字,我们导入了 pandas 包,之后使用 read_csv 函数读取 CSV 文件。此处,sales_data.csv 文件是我们的数据文件,该文件包含 10 列,分别命名为客户编号、客户名称、2016、2017、增长百分比、一月单位、月份、日期、年份、活跃用户。
每列包含不同类型的数据。为了单独获取每一列的数据类型,我们使用 dtype 属性。
输出
Customer Number float64 Customer Name object 2016 object 2017 object Percent Growth object Jan Units object Month int64 Day int64 Year int64 Active object dtype: object
上述输出块表示输入数据集 (sales_data.cvs) 的列名和数据类型。其中三列存储整数值,一列存储浮点值,其余六列存储对象数据(纯文本类型)。
示例
df = pd.DataFrame({'datetime': [pd.Timestamp('20190210')],'boolean': True})
print(df)
print() # 用于在输出时提供空格
print(df.dtypes)
解释
上述代码块由两种数据类型创建,即 DateTime 和 boolean 数据类型。通过使用 pd.timestamp,我们创建了日期时间类型的数据。
输出
datetime boolean 0 2019-02-10 True datetime datetime64[ns] boolean bool dtype: object
上面的输出块有两个输出。第一个输出表示数据框对象 df 中存在的数据,第二个输出表示数据框对象每一列的 dtype。
通过这些示例,我们可以了解 Pandas 如何处理数据以及处理哪些类型的数据。

