node.js实现简单爬虫示例详解

 更新时间:2023年04月26日 10:30:07   作者:前端小蜜蜂来也  
这篇文章主要为大家介绍了node.js实现简单爬虫示例详解,有需要的朋友可以借鉴参考下,希望能够有所帮助,祝大家多多进步,早日升职加薪

node.js实现简单爬虫

工具:cheerio

cheerio 是 nodejs 特别为服务端定制的,能够快速灵活的对 JQuery 核心进行实现。它工作于 DOM 模型上,且解析、操作、呈送都很高效。 更多 API 参看: github.com/cheeriojs/c…

我们以慕课网页面为例,爬取每个视频课程的标题和课程对应 id,期望结构如下:

titles = [{
  chapterTitle: chapterTitle,
  id: id
}]

第一步

我们用node写一个请求,获取想要爬虫的网站html,这里以慕课网为例:

var http = require('http')
var url = 'http://www.imooc.com/course/list?c=nodejs'
http.get(url, function(res){
  var html = ''
  res.on('data', function(data){
    html += data
  })
  res.on('end', function(){
    var result = filterHml(html)
    print(result)
  })
}).on('error', function(){
  console.log('获取数据错误!')
})

第二步

我们根据需求来编写过滤HTML的函数,将过滤后的数据打印在控制台。

function filterChapters(html) {
    var $ = cheerio.load(html)
    var chapters = $('.course-card-container')//以类名获取节点元素
    var titles = []
    chapters.each(function (item) {
        var chapter = $(this)
        var chapterTitle = chapter.find('h3').text()
        var id = chapter.find('a').attr('href').split('learn/')[1]
        titles.push({
            chapterTitle: chapterTitle,
            id: id
        })
    })
    return titles
}
function printCourseInfo(courseData){
    courseData.forEach(item => {
        console.log('【' + item.id + '】' + item.chapterTitle + '\n')
    });
}

爬虫结果

【935】Vue+Webpack打造todo应用
【882】基于websocket的火拼俄罗斯(单��版)
【861】基于Websocket的火拼俄罗斯(基础)
【866】前端性能优化-通用的缓存SDK
【773】AC2016腾讯前端技术大会
【728】创业公司的Nodejs工程师
【725】Roundtable前端分享专场
【637】进击Node.js基础(二)
【590】阿里D2前端技术论坛——2015融合
【564】去哪儿前端沙龙分享第三期
【556】慕课网技术沙龙之前端专场
【434】去哪儿前端沙龙分享第二期
【367】Qnext前端交互沙龙
【348】进击Node.js基础(一)
【221】D2前端技术论坛——2014绽放
【197】node建站攻略(二期)——网站升级
【75】node+mongodb 建站攻略(一期)

小结:

node.js使得JavaScript代码能够运行在服务端,从而进行一些操作,node.js的更多用法参看后续文章.

以上就是node.js实现简单爬虫示例详解的详细内容,更多关于node.js简单爬虫的资料请关注脚本之家其它相关文章!

相关文章

  • node.js文件上传重命名以及移动位置的示例代码

    node.js文件上传重命名以及移动位置的示例代码

    本篇文章主要介绍了node.js文件上传重命名以及移动位置的示例代码,小编觉得挺不错的,现在分享给大家,也给大家做个参考。一起跟随小编过来看看吧
    2018-01-01
  • 在Express中提供静态文件的实现方法

    在Express中提供静态文件的实现方法

    这篇文章主要介绍了在Express中提供静态文件的实现方法,将包含静态资源的目录的名称传递给 express.static 中间件函数,以便开始直接提供这些文件,感兴趣的可以了解一下
    2019-10-10
  • Nodejs文件上传、监听上传进度的代码

    Nodejs文件上传、监听上传进度的代码

    这篇文章主要介绍了Nodejs文件上传、监听上传进度,本文通过实例代码给大家详细介绍,对大家的学习或工作具有一定的参考借鉴价值,需要的朋友可以参考下
    2020-03-03
  • 使用nvm和nrm优化node.js工作流的方法

    使用nvm和nrm优化node.js工作流的方法

    这篇文章主要介绍了使用nvm和nrm优化node.js工作流的方法,小编觉得挺不错的,现在分享给大家,也给大家做个参考。一起跟随小编过来看看吧
    2019-01-01
  • Node.js管理工具npm的具体使用

    Node.js管理工具npm的具体使用

    NPM是随同NodeJS一起安装的包管理工具,允许用户从NPM服务器下载别人编写的第三方包到本地使用,本文主要介绍了Node.js管理工具npm的具体使用,感兴趣的可以了解一下
    2023-12-12
  • 解决Mac安装thrift因bison报错的问题

    解决Mac安装thrift因bison报错的问题

    今天小编就为大家分享一篇解决Mac安装thrift因bison报错的问题,具有很好的参考价值,希望对大家有所帮助。一起跟随小编过来看看吧
    2018-05-05
  • 如何在Express4.x中愉快地使用async的方法

    如何在Express4.x中愉快地使用async的方法

    这篇文章主要介绍了如何在Express4.x中愉快地使用async的方法,文中通过示例代码介绍的非常详细,对大家的学习或者工作具有一定的参考学习价值,需要的朋友们下面随着小编来一起学习学习吧
    2020-11-11
  • 基于socket.io和node.js搭建即时通信系统

    基于socket.io和node.js搭建即时通信系统

    socket.IO是一个websocket库,包括了客户端的js和服务器端的nodejs。官方地址:http://socket.io
    2014-07-07
  • node.js实现token身份验证的示例代码

    node.js实现token身份验证的示例代码

    本文主要介绍了node.js实现token身份验证的示例代码,文中通过示例代码介绍的非常详细,具有一定的参考价值,感兴趣的小伙伴们可以参考一下
    2022-02-02
  • node.js到底要不要加分号浅析

    node.js到底要不要加分号浅析

    这篇文章主要给大家介绍了关于node.js到底要不要加分号的相关资料,文中通过示例代码介绍的非常详细,对大家的学习或者工作具有一定的参考学习价值,需要的朋友们下面随着小编来一起学习学习吧
    2018-07-07

最新评论