python 爬取免费简历模板网站的示例
更新时间:2020年09月27日 14:58:08 作者:straightup
这篇文章主要介绍了python 爬取免费简历模板网站的示例,帮助大家更好的理解和使用python 爬虫,感兴趣的朋友可以了解下
代码
# 免费的简历模板进行爬取本地保存
# http://sc.chinaz.com/jianli/free.html
# http://sc.chinaz.com/jianli/free_2.html
import requests
from lxml import etree
import os
dirName = './resumeLibs'
if not os.path.exists(dirName):
os.mkdir(dirName)
headers = {
'User-Agent':'Mozilla/5.0 (Windows NT 10.0; Win64; x64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/85.0.4183.83 Safari/537.36'
}
url = 'http://sc.chinaz.com/jianli/free_%d.html'
for page in range(1,2):
if page == 1:
new_url = 'http://sc.chinaz.com/jianli/free.html'
else:
new_url = format(url%page)
page_text = requests.get(url=new_url,headers=headers).text
tree = etree.HTML(page_text)
a_list = tree.xpath('//div[@id="container"]/div/p/a')
for a in a_list:
a_src = a.xpath('./@href')[0]
a_title = a.xpath('./text()')[0]
a_title = a_title.encode('iso-8859-1').decode('utf-8')
# 爬取下载页面
page_text = requests.get(url=a_src,headers=headers).text
tree = etree.HTML(page_text)
dl_src = tree.xpath('//div[@id="down"]/div[2]/ul/li[8]/a/@href')[0]
resume_data = requests.get(url=dl_src,headers=headers).content
resume_name = a_title
resume_path = dirName + '/' + resume_name + '.rar'
with open(resume_path,'wb') as fp:
fp.write(resume_data)
print(resume_name,'下载成功!')
爬取结果


以上就是python 爬取免费简历模板网站的示例的详细内容,更多关于python 爬取网站的资料请关注脚本之家其它相关文章!
相关文章
Python将一个CSV文件里的数据追加到另一个CSV文件的方法
今天小编就为大家分享一篇Python将一个CSV文件里的数据追加到另一个CSV文件的方法,具有很好的参考价值,希望对大家有所帮助。一起跟随小编过来看看吧2018-07-07
Python调用AnythingLLM API使用流输出的实现
本文主要介绍了Python调用AnythingLLM API使用流输出的实现,用于处理长文本或实时交互场景,文中通过示例代码介绍的非常详细,需要的朋友们下面随着小编来一起学习学习吧2025-03-03


最新评论