为什么我们在 Python 中使用 Pandas?
Pandas 一直是数据科学和机器学习中最常用的工具之一,用于数据清理和分析。
Pandas 是处理现实世界中杂乱数据的最佳工具。Pandas 是基于 NumPy 构建的开源 Python 包之一。
使用 Pandas 处理数据非常快速有效,使用 Pandas 的 Series 和 DataFrame 这两个数据结构可以帮助您以各种方式操作数据。
基于 Pandas 的功能,我们可以说 Pandas 是处理数据的最佳工具。它可以处理丢失的数据,清理数据,并且支持多种文件格式。这意味着它可以读取或加载多种格式的数据,例如 CSV、Excel、SQL 等。
让我们举个例子,看看它是如何读取 CSV 数据的。
示例
data = pd.read_csv('world-happiness-report.csv')
print(data.shape)
data.head()
解释
在上面的代码中,变量 data 使用 pandas 包中的 read_csv 函数存储了 CSV 数据,该数据是一份世界幸福感报告(从 Kaggle 数据集下载)。data.shape 用于提供列数和行数。
输出
Country name year Life Ladder Log GDP per capita Social support \ 0 Afghanistan 2008 3.724 7.370 0.451 1 Afghanistan 2009 4.402 7.540 0.552 2 Afghanistan 2010 4.758 7.647 0.539 3 Afghanistan 2011 3.832 7.620 0.521 4 Afghanistan 2012 3.783 7.705 0.521 Healthy life expectancy at birth Freedom to make life choices Generosity \ 50.80 0.718 0.168 51.20 0.679 0.190 51.60 0.600 0.121 51.92 0.496 0.162 52.24 0.531 0.236 Perceptions of corruption Positive affect Negative affect 0.882 0.518 0.258 0.850 0.584 0.237 0.707 0.618 0.275 0.731 0.611 0.267 0.776 0.710 0.268
上述代码块包含全球幸福感报告数据集中排名前 5 行的数据,可以通过 pandas dataframe.head() 函数显示。
还有许多其他功能可以帮助我们处理机器学习和数据科学操作中的大数据。这些功能包括合并和连接数据集、可视化、分组、掩码,并且对于对数据集执行数学运算也非常有帮助。
让我们再举一个例子,看看如何使用 Pandas 创建输出文件。
示例
file = data.to_json('output_file.json')
解释
Data.to_json 是一个 Pandas 函数,用于基于 Pandas DataFrame 对象(数据)创建 JSON 文件。
输出
生成的 JSON 文件将在我们的工作目录中创建,扩展名为 .json,文件名为 output_file(对于我们上面的示例)。
以下是我们需要 Python 的一些原因熊猫。

