Python机器学习库scikit-learn安装与基本使用教程

更新时间：2018年06月25日 09:40:25 作者：Eric Chan

这篇文章主要介绍了Python机器学习库scikit-learn安装与基本使用,较为详细的介绍了机器学习库scikit-learn的功能、原理、基本安装与简单使用方法,需要的朋友可以参考下

本文实例讲述了Python机器学习库scikit-learn安装与基本使用。分享给大家供大家参考，具体如下：

引言

scikit-learn是Python的一个开源机器学习模块，它建立在NumPy，SciPy和matplotlib模块之上能够为用户提供各种机器学习算法接口，可以让用户简单、高效地进行数据挖掘和数据分析。

scikit-learn安装

python 中安装许多模板库之前都有依赖关系,安装 scikit-learn 之前需要以下先决条件:

Python(>= 2.6 or >= 3.3)
NumPy (>= 1.6.1)
SciPy (>= 0.9)

如无意外,下面用 pip 的安装方法可以顺利完成~~

安装 numpy

sudo pip install numpy

安装 scipy

需要先安装 matplotlib ipython ipython-notebook pandas sympy

sudo apt-get install python-matplotlib ipython ipython-notebook
sudo apt-get install python-pandas python-sympy python-nose
sudo pip install scipy

安装 scikit-learn

sudo pip install -U scikit-learn

测试

在 terminal 里面输入

pip list

这个会列出 pip 安装的所有东西,如果里面有 sklearn 这一项,应该就是大功告成了!

或者尝试着将几个模板库导入进来

import numpy
import scipy
import sklearn

加载数据(Data Loading)

本文所使用的数据集为‘今日头条'近期两篇热门新闻“牛！川大学霸寝室5人获16份名校通知书”、“张超凡的最后14天：山西15岁休学少年是如何殒命网吧的”分别500条评论，共1000条评论。

去除停用词后得到了词库大小为3992的词库。因此构建了1000×3992的特征矩阵，以及长度为1000的对应评论所属类别列表

具体爬虫和特征矩阵构建代码

class_result_save.npy 下载 feature_matrix_save.npy下载

import numpy as np
feature_matrix = np.load('dataSet/feature_matrix_save.npy')
class_list = np.load('dataSet/class_result_save.npy')

数据归一化(Data Normalization)

大多数机器学习算法中的梯度方法对于数据的缩放和尺度都是很敏感的，在开始跑算法之前，我们应该进行归一化或者标准化的过程，这使得特征数据缩放到0-1范围中。scikit-learn提供了归一化的方法：

from sklearn import preprocessing
# 归一化（Normalization）
normalized_X = preprocessing.normalize(feature_matrix)
print normalized_X
# 标准化（Standardization）
standardized_X = preprocessing.scale(feature_matrix)
print standardized_X

特征选择(Feature Selection)

在解决一个实际问题的过程中，选择合适的特征或者构建特征的能力特别重要。这成为特征选择或者特征工程。

特征选择时一个很需要创造力的过程，更多的依赖于直觉和专业知识，并且有很多现成的算法来进行特征的选择。

下面的树算法(Tree algorithms)计算特征的信息量：

from sklearn.ensemble import ExtraTreesClassifier
model = ExtraTreesClassifier()
print feature_matrix.shape # 原特征矩阵规模
feature_matrix = model.fit(feature_matrix, class_list).transform(feature_matrix)
print feature_matrix.shape # 特征选择后 特征矩阵的规模

特征提取(Feature Extraction)

用TFIDF算法来计算特征词的权重值是表示当一个词在这篇文档中出现的频率越高，同时在其他文档中出现的次数越少，则表明该词对于表示这篇文档的区分能力越强，所以其权重值就应该越大。

from sklearn.feature_extraction.text import TfidfTransformer
tfidf_transformer = TfidfTransformer()
feature_matrix = tfidf_transformer.fit_transform(feature_matrix).toarray()

朴素贝叶斯(Naive Bayes)

朴素贝叶斯是一个很著名的机器学习算法，主要是根据训练样本的特征来计算各个类别的概率，在多分类问题上用的比较多。

from sklearn import metrics
from sklearn.naive_bayes import GaussianNB
# 构建朴素贝叶斯模型
model = GaussianNB()
model.fit(feature_matrix, class_list)
print model
# 使用测试集进行测试(此处将训练集做测试集)
expected = class_list
predicted = model.predict(feature_matrix)
# 输出测试效果
print metrics.classification_report(expected, predicted)
print metrics.confusion_matrix(expected, predicted)

k近邻(k-Nearest Neighbours)

k近邻算法常常被用作是分类算法一部分，比如可以用它来评估特征，在特征选择上我们可以用到它。

from sklearn import metrics
from sklearn.neighbors import KNeighborsClassifier
# 构建knn模型
model = KNeighborsClassifier()
model.fit(feature_matrix, class_list)
print model
# 使用测试集进行测试(此处将训练集做测试集)
expected = class_list
predicted = model.predict(feature_matrix)
# 输出测试效果
print metrics.classification_report(expected, predicted)
print metrics.confusion_matrix(expected, predicted)

决策树(Decision Tree)

分类与回归树(Classification and Regression Trees ,CART)算法常用于特征含有类别信息的分类或者回归问题，这种方法非常适用于多分类情况。

from sklearn import metrics
from sklearn.tree import DecisionTreeClassifier
# 构建决策数模型
model = DecisionTreeClassifier()
model.fit(feature_matrix, class_list)
print model
# 使用测试集进行测试(此处将训练集做测试集)
expected = class_list
predicted = model.predict(feature_matrix)
# 输出测试效果
print metrics.classification_report(expected, predicted)
print metrics.confusion_matrix(expected, predicted)

更多关于Python相关内容感兴趣的读者可查看本站专题：《Python数学运算技巧总结》、《Python数据结构与算法教程》、《Python函数使用技巧总结》、《Python字符串操作技巧汇总》、《Python入门与进阶经典教程》及《Python文件与目录操作技巧汇总》

希望本文所述对大家Python程序设计有所帮助。

您可能感兴趣的文章:

在cmd中运行.py文件: python的操作步骤
今天小编就为大家分享一篇在cmd中运行.py文件: python的操作步骤，具有很好的参考价值，希望对大家有所帮助。一起跟随小编过来看看吧
2018-05-05
解决python3读取Python2存储的pickle文件问题
今天小编就为大家分享一篇解决python3读取Python2存储的pickle文件问题，具有很好的参考价值。希望对大家有所帮助。一起跟随小编过来看看吧
2018-10-10
TensorFlow2.0矩阵与向量的加减乘实例
今天小编就为大家分享一篇TensorFlow2.0矩阵与向量的加减乘实例，具有很好的参考价值，希望对大家有所帮助。一起跟随小编过来看看吧
2020-02-02
Python轻松实现批量邮件自动化详解
在日常工作和生活中,我们经常需要发送邮件,手动发送邮件不仅繁琐,而且容易出错,下面我们就来看看如何使用Python实现批量邮件自动化操作吧
2025-02-02
Python3中的json模块使用详解
这篇文章主要介绍了Python3中的json模块使用详解，小编觉得挺不错的，现在分享给大家，也给大家做个参考。一起跟随小编过来看看吧
2018-05-05
django如何通过类视图使用装饰器
这篇文章主要介绍了django如何设计装饰器过滤黑名单,文中通过示例代码介绍的非常详细，对大家的学习或者工作具有一定的参考学习价值,需要的朋友可以参考下
2019-07-07
Python使用pymongo模块操作MongoDB的方法示例
这篇文章主要介绍了Python使用pymongo模块操作MongoDB的方法,结合实例形式分析了Python基于pymongo模块连接MongoDB数据库以及增删改查与日志记录相关操作技巧,需要的朋友可以参考下
2018-07-07
Pytorch可视化的几种实现方法
本文主要介绍了Pytorch可视化，主要介绍了3中使用方法，具有一定的参考价值，感兴趣的小伙伴们可以参考一下
2021-06-06
Pyhton中单行和多行注释的使用方法及规范
大家都知道python中的注释有多种，有单行注释，多行注释，批量注释，中文注释也是常用的。python注释也有自己的规范，这篇文章文章中会给大家详细介绍Pyhton中单行和多行注释的使用方法及规范，有需要朋友们可以参考借鉴。
2016-10-10
Python查找字符串中重复字符的多种方法
在处理字符串时,我们经常需要分析字符的频率,找出那些出现次数超过一次的重复字符,这在数据处理、文本分析、密码学等多个领域都有广泛的应用,本文介绍了Python查找字符串中重复字符的多种方法,需要的朋友可以参考下
2024-09-09