Java爬取网站源代码和链接代码实例

更新时间：2019年11月20日 10:34:26 作者：念_响

这篇文章主要介绍了Java爬取网站源代码和链接代码实例,文中通过示例代码介绍的非常详细，对大家的学习或者工作具有一定的参考学习价值,需要的朋友可以参考下

1. 网络爬虫是一个自动提取网页的程序，它为搜索引擎从万维网上下载网页，是搜索引擎的重要组成。传统爬虫从一个或若干初始网页的URL开始，获得初始网页上的URL，在抓取网页的过程中，不断从当前页面上抽取新的URL放入队列，直到满足系统的一定停止条件。

所以主要使用递归遍历完成对每个网页内链接的获取和源码的获取，然后剔除重复链接

数据爬取后主要使用txt文件储存，根据网址的路径生成想应文件路径

2.代码

package com.test;

import java.io.*;
import java.net.URL;
import java.net.URLConnection;
import java.text.SimpleDateFormat;
import java.util.Date;
import java.util.regex.Matcher;
import java.util.regex.Pattern;
 
/**
 * java实现爬虫
 */
public class SpiderDemo1 {
 
  //网站主网页链接
  private final static String theURL = "http://www.jyyishu.cn";
  //今日日期，用于标记日志
  private final static String theTIME = new SimpleDateFormat("yyyy-MM-dd").format(new Date());
  //网页链接文件路径
  private final static String theFILE = "L:/html/jy1/" + theTIME + "/URL.txt";
  //网页源码路径
  private final static String thePATH = "L:/html/jy1/" + theTIME + "/code";
  //正则表达式，用于判断是否是一个网址
  private final static String theREGEX= "(http|https)://[\\w+\\.?/?]+\\.[A-Za-z]+";
 
  /**
   * 启动类
   * @param args
   */
  public static void main(String[] args) {
    found();
    System.out.println("网站爬取完成");
  }
 
 
  public static void found() {
    PrintWriter pw = null;
    try{
      //创建文件目录
      File fileDir = new File(thePATH);
      if (!fileDir.exists()) {
        fileDir.mkdirs();
      }
 
      //创建网站网页链接文件
      pw = new PrintWriter(new FileWriter(theFILE),true);
 
      //使用递归遍历网站的每个网页
      spiderURL(theURL, pw);
    } catch (IOException e) {
      e.printStackTrace();
    } finally {
      try {
        if(pw != null) {
          pw.close();
        }
      } catch(Exception e) {
        e.printStackTrace();
      }
    }
  }
 
 
  /**
   * 爬取该网页源码和网页内连接
   * @param url 该网页网址
   * @param tpw 对网站网页网址文件连接的io流
   */
  public static void spiderURL(String url, PrintWriter tpw){
    URL realURL=null;
    URLConnection connection=null;
    BufferedReader br=null;
    PrintWriter pw=null;
    PrintWriter pw1=null;
 
    Pattern pattern=Pattern.compile(theREGEX);
    try{
      realURL=new URL(url);
      connection=realURL.openConnection();
 
      //生成文件夹
      String src = thePATH + url.substring(theURL.length());
      File fileDir = new File(src);
      if (!fileDir.exists()) {
        fileDir.mkdirs();
      }
 
      //生成源代码文件
      pw = new PrintWriter(new FileWriter(src + "/Test.txt"),true);
      pw1 = tpw;
 
      //爬取网页文件
      br=new BufferedReader(new InputStreamReader(connection.getInputStream()));
      String line=null;
      while((line=br.readLine())!=null){
        //把爬取的源码写入文件
        pw.println(line);
        System.out.println("爬取网页" + url + "成功");
        Matcher matcher=pattern.matcher(line);
        //判断是否是一个网址
        while(matcher.find()){
          //判断网址是否以网站主网址为前缀，防止爬到其他网站,并判断是否和原先网址重复
          if(matcher.group().startsWith(theURL) && examine(matcher.group())) {
            //把爬取的网址写入文件
            pw1.println(matcher.group());
            spiderURL(matcher.group(), pw1);
          }
        }
        System.out.println("网页" + url + "内链接爬取完成");
      }
  }catch(Exception e){
    e.printStackTrace();
  }finally {
      try {
        if(br != null) {
          br.close();
        }
        if(pw != null) {
          pw.close();
        }
      } catch (IOException e) {
        e.printStackTrace();
      }
    }
  }
 
 
  /**
   * 判断是否和以储存网址相同
   * @param str 需判断的网址
   * @return 是否重复
   */
  public static boolean examine(String str) {
    BufferedReader br = null;
    String str1;
    try {
      br = new BufferedReader(new FileReader(theFILE));
 
//      //针对该网站无用网页的屏蔽
//      if(str.startsWith("http://www.jyyishu.cn/artnews/")) {
//        return false;
//      }
      
      //循环文件中每一行的网址，判断是否重复，重复则退出
      while((str1 = br.readLine()) != null) {
        if(str.equals(str1)) {
          return false;
        }
      }
    } catch (IOException e) {
      e.printStackTrace();
    } finally {
      try{
        if(br != null) {
          br.close();
        }
      } catch (IOException e) {
        e.printStackTrace();
      }
    }
    return true;
  }
}

2. 爬取后的数据

部分链接：

网页数据：

以上就是本文的全部内容，希望对大家的学习有所帮助，也希望大家多多支持脚本之家。

您可能感兴趣的文章:

SpringBoot静态资源css,js,img配置方案
这篇文章主要介绍了SpringBoot静态资源css,js,img配置方案,下文给大家分享了三种解决方案，需要的朋友可以参考下
2017-07-07
Spring Boot常用注解(经典干货)
Spring Boot是一个快速开发框架，快速的将一些常用的第三方依赖整合,全部采用注解形式，内置Http服务器,最终以Java应用程序进行执行,这篇文章主要介绍了Spring Boot常用注解（绝对经典）,需要的朋友可以参考下
2023-01-01
Java线程休眠_动力节点Java学院整理
sleep() 的作用是让当前线程休眠，即当前线程会从“运行状态”进入到“休眠(阻塞)状态”。下面通过实例代码给大家介绍Java线程休眠的知识，需要的朋友参考下吧
2017-05-05
java8 多个list对象用lambda求差集操作
这篇文章主要介绍了java8 多个list对象用lambda求差集操作，具有很好的参考价值，希望对大家有所帮助。一起跟随小编过来看看吧
2020-09-09
JPA在不写sql的情况下如何实现模糊查询
文章介绍了在项目中实现模糊查询的几种方法,包括使用JPA的API、JPQL、QueryByExample和@Query注解,通过实现Specification接口和定义接口继承JpaRepository,可以方便地进行单字段和多字段的模糊查询,文章还提到了BINARY函数的使用以及查询结果的返回
2024-11-11
解决无法解析javax.servlet的方法
最近在创建一个servlet时,自动生成的代码中出现servlet无法解析的提示,令我无法正常使用servlet里的方法,在对各个步骤进行查看后,发现了问题所在,需要的朋友可以参考下
2021-05-05
Jackson使用示例-Bean、XML、Json之间相互转换
Jackson是一个强大工具,可用于Json、XML、实体之间的相互转换,JacksonXmlElementWrapper用于指定List等集合类,外围标签名,JacksonXmlProperty指定包装标签名,或者指定标签内部属性名,JacksonXmlRootElement指定生成xml根标签的名字,JacksonXmlText指定当前这个值
2024-05-05
MyBatis写入Json字段以及Json字段转对象示例详解
这篇文章主要给大家介绍了关于MyBatis写入Json字段以及Json字段转对象的相关资料,文中通过实例代码介绍的非常详细,对大家的学习或者工作具有一定的参考借鉴价值,需要的朋友可以参考下
2023-07-07
自定义Jackson的ObjectMapper如何实现@ResponseBody的自定义渲染
这篇文章主要介绍了自定义Jackson的ObjectMapper如何实现@ResponseBody的自定义渲染,具有很好的参考价值,希望对大家有所帮助,如有错误或未考虑完全的地方,望不吝赐教
2024-07-07
springboot2.1.7去除json返回字段中为null的字段
这篇文章主要介绍了springboot2.1.7去除json返回字段中为null的字段，文中通过示例代码介绍的非常详细，对大家的学习或者工作具有一定的参考学习价值，需要的朋友们下面随着小编来一起学习学习吧
2020-12-12

Java爬取网站源代码和链接代码实例

相关文章

最新评论

大家感兴趣的内容

最近更新的内容

常用在线小工具