python数据爬下来保存的位置

更新时间：2020年02月17日 11:18:56 作者：十一月的萧邦。

在本篇文章里小编给大家整理的是关于python数据爬下来保存的位置，需要的朋友们可以参考下。

昨天下班后忽然兴起想写一个爬虫抓抓网页上的东西。花了一个钟简单学习了python的基础语法，然后参照网上的例子自己写了个爬虫。

python数据爬下来保存在本地，一般是文件或数据库中，但是文件形式相比要更加简单，如果只是自己写爬虫玩，可以用文件形式来保存数据。

#coding=utf-8
import urllib.request
import re
import os
 
'''
Urllib 模块提供了读取web页面数据的接口，我们可以像读取本地文件一样读取www和ftp上的数据
urlopen 方法用来打开一个url
read方法 用于读取Url上的数据
'''
 
def getHtml(url):
  page = urllib.request.urlopen(url);
  html = page.read();
  return html;
 
def getImg(html):
  imglist = re.findall('img src="(http.*?)"',html
  return imglist
 
html = getHtml("https://www.zhihu.com/question/34378366").decode("utf-8");
imagesUrl = getImg(html);
 
if os.path.exists("D:/imags") == False:
  os.mkdir("D:/imags");
   
count = 0;
for url in imagesUrl:
  print(url)
  if(url.find('.') != -1):
    name = url[url.find('.',len(url) - 5):];
    bytes = urllib.request.urlopen(url);
    f = open("D:/imags/"+str(count)+name, 'wb');
    f.write(bytes.read());
    f.flush();
    f.close();
    count+=1

经测试，基本功能还是可以实现的。花的较多的时间就是正则匹配哪里，因为自己对正则表达式也不是非常熟悉。所以还是花了点时间。

注：上面的程序基于 python 3.5。python3 和 python2 还是有些区别的。我刚开始看基础语法的时候就栽了一些坑里。

以上就是python数据爬下来保存在哪里的详细内容，感谢大家的学习和对脚本之家的支持。

您可能感兴趣的文章:

Python实现GIF动图以及视频卡通化详解
本文主要介绍了如何使用Python中的animegan2-pytorch实现动图以及视频的卡通化效果，文中的代码具有一定的学习价值，需要的朋友可以参考一下
2021-12-12
python实现画五角星和螺旋线的示例
今天小编就为大家分享一篇python实现画五角星和螺旋线的示例，具有很好的参考价值，希望对大家有所帮助。一起跟随小编过来看看吧
2019-01-01
Python入门之三角函数sin()函数实例详解
这篇文章主要介绍了Python入门之三角函数sin()函数实例详解，分享了相关实例，具有一定参考价值，需要的朋友可以了解下。
2017-11-11
详解torch.Tensor的4种乘法
这篇文章主要介绍了详解torch.Tensor的4种乘法，文中通过示例代码介绍的非常详细，对大家的学习或者工作具有一定的参考学习价值，需要的朋友们下面随着小编来一起学习学习吧
2020-09-09
python识别文字(基于tesseract)代码实例
这篇文章主要介绍了python识别文字(基于tesseract)代码实例,文中通过示例代码介绍的非常详细，对大家的学习或者工作具有一定的参考学习价值,需要的朋友可以参考下
2019-08-08
python政策网字体反爬实例(附完整代码)
大家好，本篇文章主要讲的是python政策网字体反爬实例（附完整代码），感兴趣的同学赶快来看一看吧，对你有帮助的话记得收藏一下
2022-01-01
pytorch更新tensor中指定index位置的值scatter_add_问题
这篇文章主要介绍了pytorch更新tensor中指定index位置的值scatter_add_问题，具有很好的参考价值，希望对大家有所帮助。如有错误或未考虑完全的地方，望不吝赐教
2023-06-06
详解Python使用simplejson模块解析JSON的方法
这篇文章主要介绍了Python使用simplejson模块解析JSON的方法,实例代码基于Pyhton2.x版本,文中最后还附了关于simplejson模块的一些性能放面的讨论,需要的朋友可以参考下
2016-03-03
Python Numpy中ndarray的常见操作
这篇文章主要介绍了Python Numpy中ndarray的常见操作，NumPy是Python的一种开源的数值计算扩展，更多详细内容需要的朋友可以参考一下
2022-07-07
Java ExcutorService优雅关闭方式解析
这篇文章主要介绍了Java ExcutorService优雅关闭方式解析,文中通过示例代码介绍的非常详细，对大家的学习或者工作具有一定的参考学习价值,需要的朋友可以参考下
2020-05-05

python数据爬下来保存的位置

相关文章

最新评论

大家感兴趣的内容

最近更新的内容

常用在线小工具