机器学习python实战之手写数字识别

更新时间：2017年11月01日 10:51:50 作者：嗜血的草

这篇文章主要为大家详细介绍了机器学习python实战之手写数字识别，具有一定的参考价值，感兴趣的小伙伴们可以参考一下

看了上一篇内容之后，相信对K近邻算法有了一个清晰的认识，今天的内容——手写数字识别是对上一篇内容的延续，这里也是为了自己能更熟练的掌握k-NN算法。

我们有大约2000个训练样本和1000个左右测试样本，训练样本所在的文件夹是trainingDigits，测试样本所在的文件夹是testDigits。文本文件中是0~9的数字，但是是用二值图表示出来的，如图。我们要做的就是使用训练样本训练模型，并用测试样本来检测模型的性能。

首先，我们需要将文本文件中的内容转化为向量，因为图片大小是32*32，所以我们可以将其转化为1*1024的向量。具体代码实现如下：

def img2vector(filename):
  imgVec = zeros((1,1024))
  file = open(filename)
  for i in range(32):
    lines = file.readline()
    for j in range(32):
      imgVec[0,32*i+j] = lines[j]
  return imgVec

实现了图片到向量的转化之后，我们就可以对测试文件中的内容进行识别了。这里的识别我们可以使用上一篇中的自定义函数classify0，这个函数的第一个参数是测试向量，第二个参数是训练数据集，第三个参数是训练集的标签。所以，我们首先需要将训练数据集转化为（1934*1024）的矩阵，1934这里是训练集的组数即trainingDigits目录下的文件数，其对应的标签转化为（1*1934）的向量。之后要编写的代码就是对测试数据集中的每个文本文件进行识别，也就是需要将每个文件都转化成一个（1*1024）的向量，再传入classify0函数的第一个形参。整体代码如下：

def handWriteNumClassTest():
  NumLabels = []
  TrainingDirfile = listdir(r'D:\ipython\num_recognize\trainingDigits')#文件目录
  L = len(TrainingDirfile)  #该目录中有多少文件
  TrainMat = zeros((L,1024))
  for i in range(L):
    file_n = TrainingDirfile[i]
    fileName = file_n.split('.')[0]
    ClassName = int(file_n.split('_')[0])
    NumLabels.append(ClassName)
    TrainMat[i,:] = img2vector(r'D:\ipython\num_recognize\trainingDigits\%s'%file_n)
  TestfileDir = listdir(r'D:\ipython\num_recognize\testDigits')
  error_cnt = 0.0
  M = len(TestfileDir)
  for j in range(M):
    Testfile = TestfileDir[j]
    TestfileName = Testfile.split('.')[0]
    TestClassName = int(Testfile.split('_')[0])
    TestVector = img2vector(r'D:\ipython\num_recognize\testDigits\%s'%Testfile)
    result = classify0(TestVector,TrainMat,NumLabels,3)
    print('the result is %d,the real answer is %d\n'%(result,TestClassName))
    if result!=TestClassName:
      error_cnt+=1
  print('the total num of errors is %f\n'%error_cnt)
  print('the error rate is %f\n'%(error_cnt/float(M)))

这里需要首先导入listdir方法，from os import listdir，它可以列出给定目录的文件名。对于测试的每个文件，如果识别的分类结果跟真实结果不一样，则错误数+1，最终用错误数/测试总数来表示该模型的性能。下面给出结果

这里测试的总共946个项目中，一共有10个出现了错误，出错率为1%，这个性能还是可以接受的。有了上一篇内容的理解，这篇就简单多了吧！

训练数据集和测试集文件下载

以上就是本文的全部内容，希望对大家的学习有所帮助，也希望大家多多支持脚本之家。

您可能感兴趣的文章:

python2.7 安装pip的方法步骤（管用）
这篇文章主要介绍了python2.7 安装pip的方法，文中通过示例代码介绍的非常详细，对大家的学习或者工作具有一定的参考学习价值，需要的朋友们下面随着小编来一起学习学习吧
2019-05-05
Python中pytest命令行实现环境切换
在自动化测试过程中经常需要在不同的环境下进行测试验证，所以写自动化测试代码时需要考虑不同环境切换的情况，本文主要介绍了Python中pytest命令行实现环境切换，感兴趣的可以了解一下
2023-07-07
详解python如何根据参数不同调用不同的类和方法
这篇文章主要为大家详细介绍了在python中如何根据参数不同调用不同的类和方法,文中的示例代码讲解详细,感兴趣的小伙伴可以跟随小编一起学习一下
2024-03-03
djang常用查询SQL语句的使用代码
这篇文章主要介绍了djang常用查询SQL语句的使用代码，文中通过示例代码介绍的非常详细，对大家的学习或者工作具有一定的参考学习价值，需要的朋友们下面随着小编来一起学习学习吧
2019-02-02
Python中的Cookie模块如何使用
在本篇文章中小编给大家整理的是一篇关于Python中的Cookie模块用法的相关知识点文章，需要的朋友们可以参考下。
2020-06-06
PyTorch 中的傅里叶卷积实现示例
这篇文章主要介绍了PyTorch 中的傅里叶卷积实现示例，文中通过示例代码介绍的非常详细，对大家的学习或者工作具有一定的参考学习价值，需要的朋友们下面随着小编来一起学习学习吧
2020-12-12
一文详解NumPy数组迭代与合并
NumPy 数组迭代是访问和处理数组元素的重要方法,它允许您逐个或成组地遍历数组元素,NumPy 提供了多种函数来合并数组,用于将多个数组的内容连接成一个新数组,本文给大家详细介绍了NumPy数组迭代与合并,需要的朋友可以参考下
2024-05-05
Python实现将PowerPoint转为HTML格式
有时我们需要将精心设计的PPT发布到网络上以便于更广泛的访问和分享,本文将介绍如何使用Python将PowerPoint转换为HTML格式,需要的可以参考下
2024-04-04
python 爬虫百度地图的信息界面的实现方法
这篇文章主要介绍了python 爬虫百度地图的界面的实现方法，文中通过示例代码介绍的非常详细，对大家的学习或者工作具有一定的参考学习价值，需要的朋友们下面随着小编来一起学习学习吧
2019-10-10
Python可视化单词统计词频统计中文分词的实现步骤
这篇文章主要介绍了Python可视化单词统计词频统计中文分词，本文给大家介绍的非常详细，对大家的学习或工作具有一定的参考借鉴价值,需要的朋友可以参考下
2022-11-11

机器学习python实战之手写数字识别

相关文章

最新评论

大家感兴趣的内容

最近更新的内容

常用在线小工具