Python爬取APP下载链接的实现方法

更新时间：2016年09月30日 15:41:25 作者：CaptainXero

这篇文章主要实现的是批量下载安卓APP。显然用手点是不科学的。于是尝试用Python写了一个半自动化的脚本。所谓半自动化，就是把下载链接批量抓取下来，然后一起贴到迅雷里进行下载，这样可以快速批量下载。有需要的朋友们可以一起看看吧。

首先是准备工作

Python 2.7.11：下载python

Pycharm：下载Pycharm

其中python2和python3目前同步发行，我这里使用的是python2作为环境。Pycharm是一款比较高效的Python IDE，但是需要付费。

实现的基本思路

首先我们的目标网站：安卓市场

点击【应用】，进入我们的关键页面：

跳转到应用界面后我们需要关注三个地方，下图红色方框标出：

首先关注地址栏的URL，再关注免费下载按钮，然后关注底端的翻页选项。点击“免费下载”按钮就会立即下载相应的APP，所以我们的思路就是拿到这个点击下载的连接，就可以直接下载APP了。

编写爬虫

第一个需要解决的点：我们怎么拿到上面说的下载链接？这里不得不介绍下浏览器展示网页的基本原理。说简单点，浏览器是一个类似解析器的工具，它得到HTML等代码的时候会按照相应的规则解析渲染，从而我们能够看到页面。

这里我使用的是谷歌浏览器，对着页面右键，点击“检查”，可以看到网页原本的HTML代码：

看到眼花缭乱的HTML代码不用着急，谷歌浏览器的审查元素有一个好用的小功能，可以帮我们定位页面控件对应的HTML代码

位置：

如上图所示，点击上方矩形框中的小箭头，点击页面对应的位置，在右边的HTML代码中就会自动定位并高亮。

接下来我们定位到下载按钮对应的HTML代码：

可以看到按钮对应的代码中，存在相应的下载链接：【/appdown/com.tecent.mm】，加上前缀，完整的下载链接就是 http://apk.hiapk.com/appdown/com.tecent.mm

首先使用python拿到整个页面的HTML，很简单，使用“requests.get(url) ” ，url填入相应网址即可。

接着，在抓取页面关键信息的时候，采取“先抓大、再抓小”的思路。可以看到一个页面有10个APP，在HTML代码中对应10个item：

而每个 li 标签中，又包含各自APP的各个属性（名称、下载链接等）。所以第一步，我们将这10个 li 标签提取出来：

def geteveryapp(self,source):
  everyapp = re.findall('(<li class="list_item".*?</li>)',source,re.S)
  #everyapp2 = re.findall('(<div class="button_bg button_1 right_mt">.*?</div>)',everyapp,re.S)
  return everyapp

这里用到了简单的正则表达式知识

提取 li 标签中的下载链接：

def getinfo(self,eachclass):
  info = {}
  str1 = str(re.search('<a href="(.*?)">', eachclass).group(0))
  app_url = re.search('"(.*?)"', str1).group(1)
  appdown_url = app_url.replace('appinfo', 'appdown')
  info['app_url'] = appdown_url
  print appdown_url
  return info

接下来需要说的难点是翻页，点击下方的翻页按钮后我们可以看到地址栏发生了如下变化：

豁然开朗，我们可以在每次的请求中替换URL中对应的id值实现翻页。

def changepage(self,url,total_page):
  now_page = int(re.search('pi=(\d)', url).group(1))
  page_group = []
  for i in range(now_page,total_page+1):
   link = re.sub('pi=\d','pi=%s'%i,url,re.S)
   page_group.append(link)
  return page_group

爬虫效果

关键位置说完了，我们先看下最后爬虫的效果：

在TXT文件中保存结果如下：

直接复制进迅雷就可以批量高速下载了。

附上全部代码

#-*_coding:utf8-*-
import requests
import re
import sys
reload(sys)
sys.setdefaultencoding("utf-8")

class spider(object):
 def __init__(self):
  print u'开始爬取内容'
 def getsource(self,url):
  html = requests.get(url)
  return html.text

 def changepage(self,url,total_page):
  now_page = int(re.search('pi=(\d)', url).group(1))
  page_group = []
  for i in range(now_page,total_page+1):
   link = re.sub('pi=\d','pi=%s'%i,url,re.S)
   page_group.append(link)
  return page_group

 def geteveryapp(self,source):
  everyapp = re.findall('(<li class="list_item".*?</li>)',source,re.S)
  return everyapp

 def getinfo(self,eachclass):
  info = {}
  str1 = str(re.search('<a href="(.*?)">', eachclass).group(0))
  app_url = re.search('"(.*?)"', str1).group(1)
  appdown_url = app_url.replace('appinfo', 'appdown')
  info['app_url'] = appdown_url
  print appdown_url
  return info

 def saveinfo(self,classinfo):
  f = open('info.txt','a')
  str2 = "http://apk.hiapk.com"
  for each in classinfo:
   f.write(str2)
   f.writelines(each['app_url'] + '\n')
  f.close()

if __name__ == '__main__':

 appinfo = []
 url = 'http://apk.hiapk.com/apps/MediaAndVideo?sort=5&pi=1'
 appurl = spider()
 all_links = appurl.changepage(url, 5)
 for link in all_links:
  print u'正在处理页面' + link
  html = appurl.getsource(link)
  every_app = appurl.geteveryapp(html)
  for each in every_app:
   info = appurl.getinfo(each)
   appinfo.append(info)
 appurl.saveinfo(appinfo)

总结

选取的目标网页相对结构清晰简单，这是一个比较基本的爬虫。代码写的比较乱请见谅，以上就是这篇文章的全部内容了，希望能对大家的学习或者工作带来一定的帮助，如果有问题大家可以留言交流。

您可能感兴趣的文章:

python识别围棋定位棋盘位置
最近需要做一个围棋识别的项目，本文就介绍了棋盘位置定位，文中通过示例代码介绍的非常详细，具有一定的参考价值，感兴趣的小伙伴们可以参考一下
2021-07-07
python 打印直角三角形，等边三角形，菱形，正方形的代码
这篇文章主要介绍了python 打印直角三角形，等边三角形，菱形，正方形的代码,需要的朋友可以参考下
2017-11-11
Python使用socketServer包搭建简易服务器过程详解
这篇文章主要介绍了Python使用socketServer包搭建简易服务器过程详解,文中通过示例代码介绍的非常详细，对大家的学习或者工作具有一定的参考学习价值,需要的朋友可以参考下
2020-06-06
将keras的h5模型转换为tensorflow的pb模型操作
这篇文章主要介绍了将keras的h5模型转换为tensorflow的pb模型操作，具有很好的参考价值，希望对大家有所帮助。一起跟随小编过来看看吧
2020-05-05
selenium执行js并绕过webdriver监测常见方法
这篇文章主要为大家介绍了selenium执行js并绕过webdriver监测常见方法，有需要的朋友可以借鉴参考下，希望能够有所帮助，祝大家多多进步早日升职加薪
2022-04-04
django 控制页面跳转的例子
今天小编就为大家分享一篇django 控制页面跳转的例子，具有很好的参考价值，希望对大家有所帮助。一起跟随小编过来看看吧
2019-08-08
python-OpenCV 实现将数组转换成灰度图和彩图
今天小编就为大家分享一篇python-OpenCV 实现将数组转换成灰度图和彩图，具有很好的参考价值，希望对大家有所帮助。一起跟随小编过来看看吧
2020-01-01
详解Python中where()函数的用法
本篇文章主要介绍了详解Python中where()函数的用法，小编觉得挺不错的，现在分享给大家，也给大家做个参考。一起跟随小编过来看看吧
2018-03-03
Python 解决空列表.append() 输出为None的问题
在本篇文章里小编给大家整理了一篇关于Python 解决空列表.append() 输出为None的问题的相关内容，有兴趣的朋友们可以学习下。
2021-05-05
python self,cls,decorator的理解
在python里面，self, cls 不是关键字，完全可以使用自己写的任意变量代替实现一样的效果
2009-07-07

Python爬取APP下载链接的实现方法

相关文章

最新评论

大家感兴趣的内容

最近更新的内容

常用在线小工具