Java利用正则表达式提取数据的方法

更新时间：2016年12月26日 08:47:07 作者：lihui_yy

最近由于项目需求需要提取txt里的数据，之前用C#实现过，由于最近学习了java，所以尝试用java实现下，这篇文章主要介绍了Java利用正则表达式提取数据的方法,需要的朋友可以参考下，下面来一起看看吧。

什么是正则表达式

正则表达式是一种可以用于模式匹配和替换的规范，一个正则表达式就是由普通的字符（例如字符a到z）以及特殊字符（元字符）组成的文字模式，它用以描述在查找文字主体时待匹配的一个或多个字符串。正则表达式作为一个模板，将某个字符模式与所搜索的字符串进行匹配。

Java利用正则表达式提取数据

Java正则表达式的用途很广，之前要用到将一大 3M 的 txt 文本切分成多个小文本，用 C# 写的话很简洁，代码也就二十几行，今天用 Java 写了一下，果然，Java 很罗嗦。

切分文件的代码就不贴了，主要贴一下怎么使用正则表达式将大字符串进行分组：

比如，现在有一个 endlist.txt 文本文件，内容如下：

1300102,北京市
1300103,北京市
1300104,北京市
1300105,北京市
1300106,北京市
1300107,北京市
1300108,北京市
1300109,北京市
1300110,北京市
1300111,北京市
1300112,北京市
1300113,北京市
1300114,北京市
1300115,北京市
1300116,北京市
1300117,北京市
1300118,北京市
1300119,北京市

七位数字代表手机号码的前七位，后面的汉字表示号码归属地。现在我要将这些内容按照 130 131 132... 开头分别写到 130.txt 131.txt 132.txt.....这些文件中。

public static void main(String args[]) {
  File file = null;
  BufferedReader br = null;
  StringBuffer buffer = null;
  String childPath = "src/endlist.txt";
  String data = "";
  try {
   file = new File(childPath);
   buffer = new StringBuffer();
   InputStreamReader isr = new InputStreamReader(new FileInputStream(file), "utf-8");
   br = new BufferedReader(isr);
   int s;
   while ((s = br.read()) != -1) {
    buffer.append((char) s);
   }
   data = buffer.toString();
  } catch (Exception e) {
   e.printStackTrace();
  }
  Map<String, ArrayList<String>> resultMap = new HashMap<String, ArrayList<String>>();
  for (int i = 0; i < 10; i++) {
   resultMap.put("13" + i, new ArrayList<String>());
  }
  Pattern pattern = Pattern.compile("(\\d{3})(\\d{4},[\u4e00-\u9fa5]*\\n)");
  Matcher matcher = pattern.matcher(data); 
  while (matcher.find()) {
   resultMap.get(matcher.group(1)).add(matcher.group(2));
  }
  for (int i = 0; i < 10; i++) {
   if (resultMap.get("13" + i).size() > 0) {
    try {
     File outFile = new File("src/13" + i + ".txt");
     FileOutputStream outputStream = new FileOutputStream(outFile);
     OutputStreamWriter writer = new OutputStreamWriter(outputStream, "utf-8");
     ArrayList<String> tempList = resultMap.get("13" + i);
     for (int j = 0; j < tempList.size(); j++) {
      writer.append(resultMap.get("13" + i).get(j));
     }
     writer.close();
     outputStream.close();
    } catch (Exception e) {
     // TODO Auto-generated catch block
     e.printStackTrace();
    }
   }
  }
 }

第24行使用正则表达式 "(\\d{3})(\\d{4},[\u4e00-\u9fa5]*\\n)" 每个()中的内容为一组，索引从 1 开始，0表示整个表达式。所以这个表达式分为两组，第一组表示3个数字，第二组表示 4个数字加多个汉字加一个换行符。提取时如26-28行所示。

总结

以上就是这篇文章的全部内容了，希望本文的内容对大家的学习或者工作能带来一定的帮助，如果有疑问大家可以留言交流。

您可能感兴趣的文章:

Java计算两个时间相差的秒数怎么算
这篇文章主要介绍了Java计算两个时间相差的秒数,通过实例代码补充介绍了Java 获取两个时间的时间差(时、分、秒)问题,感兴趣的朋友跟随小编一起看看吧
2024-03-03
Java面向对象的封装你了解吗
这篇文章主要为大家详细介绍了Java面向对象的封装，文中示例代码介绍的非常详细，具有一定的参考价值，感兴趣的小伙伴们可以参考一下，希望能够给你带来帮助
2022-03-03
java中的AWT事件处理问题
这篇文章主要介绍了java中的AWT事件处理问题，具有很好的参考价值，希望对大家有所帮助。如有错误或未考虑完全的地方，望不吝赐教
2022-11-11
Zookeeper中如何解决zookeeper.out文件输出位置问题
这篇文章主要介绍了Zookeeper中如何解决zookeeper.out文件输出位置问题，具有很好的参考价值，希望对大家有所帮助。如有错误或未考虑完全的地方，望不吝赐教
2023-04-04
idea Maven 插件 docker-maven-plugin 打包docker镜像上传到远程仓库的过程详解
这篇文章主要介绍了idea Maven插件docker-maven-plugin打包docker镜像上传到远程仓库,本文给大家介绍的非常详细，对大家的学习或工作具有一定的参考借鉴价值，需要的朋友可以参考下
2023-05-05
Java集合之Map接口与实现类详解
这篇文章主要为大家详细介绍了Java集合中的Map接口与实现类，文中的示例代码讲解详细，对我们学习Java有一定的帮助，感兴趣的可以了解一下
2022-12-12
如何在SpringBoot 中使用 Druid 数据库连接池
这篇文章主要介绍了SpringBoot 中使用 Druid 数据库连接池的实现步骤，帮助大家更好的理解和学习使用SpringBoot，感兴趣的朋友可以了解下
2021-03-03
vue+springboot读取git的markdown文件并展示功能
Markdown-it 是一个用于解析和渲染 Markdown 标记语言的 JavaScript 库,使用 Markdown-it,你可以将 Markdown 文本解析为 HTML 输出,并且可以根据需要添加功能、扩展语法或修改解析行为,本文介绍vue+springboot读取git的markdown文件并展示,感兴趣的朋友一起看看吧
2024-01-01
java判断class子类或父类的实例方法
在本篇文章里小编给大家整理的是关于java判断class子类或父类的实例方法，需要的朋友们可以参考学习下。
2020-02-02
java内存分布实现代码
这篇文章主要介绍了浅谈Java内存区域划分和内存分配策略，文中通过示例代码介绍的非常详细，对大家的学习或者工作具有一定的参考学习价值，需要的朋友们下面随着小编来一起学习学习吧
2021-07-07