Python实现类别变量的独热编码

更新时间：2023年02月17日 15:27:14 作者：疯狂学习GIS

这篇文章主要为大家详细介绍了基于Python下OneHotEncoder与pd.get_dummies两种方法，实现机器学习中最优的编码方法——独热编码的方法，需要的可以参考一下

1 OneHotEncoder

首先导入必要的模块。

import pandas as pd
from sklearn.preprocessing import OneHotEncoder

其中，OneHotEncoder是我们实现独热编码的关键模块。

接下来，导入并显示数据前五行。

test_data_1=pd.read_csv('G:/CropYield/03_DL/00_Data/onehot_test.csv',names=['EVI0610','EVI0626','SoilType'],header=0)
test_data_1.head(5)

关于这里导入数据代码的解释，大家可以查看多变量两两相互关系联合分布图的Python绘制与Python TensorFlow深度学习回归代码：DNNRegressor这两篇文章，这里就不再赘述啦~

数据前五行展示如下图。其中，前两列'EVI0610'与'EVI0626'为数值型连续变量，而'SoilType'为数值型类别变量。我们要做的，也就是将第三列'SoilType'进行独热编码。

接下来，进行独热编码的配置。

ohe=OneHotEncoder(handle_unknown='ignore')
ohe.fit(test_data_1)

在这里，第一行是对独热编码的配置，第二行则是对我们刚刚导入的数据进行独热编码处理。得到一个独热编码配置的输出结果。

接下来，看看独热编码处理后，将我们的数据分成了哪些类别。

ohe.categories_

得到结果如下图。

可以发现，一共有三个array，为什么呢？仔细看可以发现，独热编码是将我们导入的三列数据全部都当作类别变量来处理了。之所以会这样，是因为我们在一开始没有表明哪一列是类别变量，需要进行独热编码；而哪一列不是类别变量，从而不需要进行独热编码。

那么，我们如何实现上述需求，告诉程序我们要对哪一行进行独热编码呢？在老版本的sklearn中，我们可以借助categorical_features=[x]参数来实现这一功能，但是新版本sklearn取消了这一参数。那么此时，一方面，我们可以借助ColumnTransformer来实现这一过程，另一方面，我们可以直接对需要进行转换的列加以处理。后者相对较为容易理解，因此本文对后者进行讲解。

我们将test_data_1中的'SoilType'列作为索引，从而仅仅对该列数据加以独热编码。

ohe_column=pd.DataFrame(ohe.fit_transform(test_data_1[['SoilType']]).toarray())
ohe_column.head(5)

其中，[['SoilType']]表示仅仅对这一列进行处理。得到结果如下图。

可以看到，原来的'SoilType'列现在成为了63列的编码列，那么这样的话，说明我们原先的'SoilType'应该一共是有63个不同的数值。是不是这个样子呢？我们来检查一下。

count=pd.DataFrame(test_data_1['SoilType'].value_counts())
print(count)

得到结果如下。

好的，没有问题：可以看到此结果共有63行，也就是'SoilType'列原本是有63个不同的值的，证明我们的独热编码没有出错。

此时看一下我们的test_data_1数据目前长什么样子。

test_data_1.head(5)

是的，我们仅仅对'SoilType'列做了处理，没有影响到整个初始数据。那么先将原本的'SoilType'列剔除掉。

test_data_1=test_data_1.drop(['SoilType'],axis=1)
test_data_1.head(5)

再将经过独热编码处理后的63列加上。

test_data_1.join(ohe_column)

大功告成！

但是这里还有一个问题，我们经过独热编码所得的列名称是以数字来命名的，非常不方便。因此，有没有什么办法可以在独热编码进行的同时，自动对新生成的列加以重命名呢？

2 pd.get_dummies

pd.get_dummies是一个最好的办法！其具体用法与上述OneHotEncoder类似，因此具体过程就不再赘述啦，大家看代码就可以明白。

首先还是导入与上述内容中一致的初始数据。

test_data_2=pd.read_csv('G:/CropYield/03_DL/00_Data/onehot_test.csv',names=['EVI0610','EVI0626','SoilType'],header=0)
test_data_2.head(5)

进行独热编码并看看结果。

test_data_2_ohe=pd.get_dummies(test_data_2,columns=['SoilType'])
test_data_2_ohe.head(5)

最终结果中，列名称可以说是非常醒目，同时，共有65列数据，自动删除了原本的'SoilType'列，实现了“独热编码”“新列重命名”与“原始列删除”，可谓一举三得，简直是太方便啦~

到此这篇关于Python实现类别变量的独热编码的文章就介绍到这了,更多相关Python独热编码内容请搜索脚本之家以前的文章或继续浏览下面的相关文章希望大家以后多多支持脚本之家！

您可能感兴趣的文章:

python数字图像处理之高级形态学处理
这篇文章主要介绍了python数字图像处理之高级形态学处理，小编觉得挺不错的，现在分享给大家，也给大家做个参考。一起跟随小编过来看看吧
2018-04-04
Python实现的在特定目录下导入模块功能分析
这篇文章主要介绍了Python实现的在特定目录下导入模块功能,结合实例形式分析了Python基于系统函数及import语句实现模块导入的相关操作技巧,需要的朋友可以参考下
2019-02-02
详解查看Python解释器路径的两种方式
这篇文章主要介绍了详解查看Python解释器路径的两种方式，文中通过示例代码介绍的非常详细，对大家的学习或者工作具有一定的参考学习价值，需要的朋友们下面随着小编来一起学习学习吧
2020-10-10
python通过getopt模块如何获取执行的命令参数详解
这篇文章主要给大家介绍了关于python通过getopt模块如何获取执行的命令参数的相关资料，文中通过示例代码介绍的非常详细，对大家的学习或者工作具有一定的参考学习价值，需要的朋友们下面随着小编来一起学习学习吧。
2017-12-12
Tensorflow 2.1完成对MPG回归预测详解
这篇文章主要为大家介绍了Tensorflow 2.1完成对MPG回归预测详解，有需要的朋友可以借鉴参考下，希望能够有所帮助，祝大家多多进步，早日升职加薪
2022-11-11
Python函数可变参数定义及其参数传递方式实例详解
这篇文章主要介绍了Python函数可变参数定义及其参数传递方式,以实例形式较为详细的分析了Python函数参数的使用技巧,需要的朋友可以参考下
2015-05-05
python pandas最常用透视表实现应用案例
透视表是一种可以对数据动态排布并且分类汇总的表格格式,它在数据分析中有着重要的作用和地位,在本文中,我将为你介绍python中如何使用pandas包实现透视表的功能,以及一些常见的应用案例
2024-01-01
深入理解python中的select模块
这篇文章主要介绍了python中select模块的相关资料，Python中的select模块专注于I/O多路复用，提供了select、poll和epoll三个方法，文中还详细的介绍了select和poll，因为poll与select相差不大，所以本文不作介绍，需要的朋友们下面来一起看看吧。
2017-04-04
Django 构建模板form表单的两种方法
这篇文章主要介绍了Django 构建模板form表单的两种方法,文中通过示例代码介绍的非常详细，对大家的学习或者工作具有一定的参考学习价值，需要的朋友们下面随着小编来一起学习学习吧
2020-06-06
Kali Linux安装ipython2 和 ipython3的方法
今天小编就为大家分享一篇Kali Linux安装ipython2 和 ipython3的方法，具有很好的参考价值，希望对大家有所帮助。一起跟随小编过来看看吧
2019-07-07

Python实现类别变量的独热编码

目录

1 OneHotEncoder

2 pd.get_dummies

相关文章

最新评论

大家感兴趣的内容

最近更新的内容

常用在线小工具