java正则匹配HTML中a标签里的中文字符示例

更新时间：2017年01月09日 08:50:09 作者：MikanMu

这篇文章主要介绍了java正则匹配HTML中a标签里的中文字符,涉及java中文正则及HTML元素操作技巧,具有一定参考借鉴价值,需要的朋友可以参考下

本文实例讲述了java正则匹配HTML中a标签里的中文字符。分享给大家供大家参考，具体如下：

今天群里一位朋友问到了一个正则表达式的问题，有如下内容：

<a href='www.baidu.comds=id32434#comment'rewr>特432</a>
453543
<a guhll,,l>a1特123你好123吗？</a>
<a href=id=32434#comment'ewrer>特2</a>
<a>标签中的文字</a>

现在要匹配出内容包含中文但标签的属性中不包含comment的<a>标签中的汉字。

解决思路如下：

1、首先匹配出不包括comment的<a>标签；

2、在匹配结果中进行二次匹配出中文；

代码如下：

package com.mmq.regex;
import java.util.regex.Matcher;
import java.util.regex.Pattern;
/**
 * @use 匹配HTML的<a>标签中的中文字符
 * @ProjectName stuff
 * @Author mumaoqiang
 * @FullName com.mmq.regex.MatchChineseCharacters.java
 * @JDK 1.6.0
 * @Version 1.0
 */
public class MatchChineseCharacters {
  /**
   * 根据输入的内容，匹配出包含中文但不包含comment的<a>标签中的中文字符
   * @param source 要匹配的内容
   * @return <a>标签中的中文字符
   */
  public static String matchChineseCharacters(String source) {
    //匹配出包含中文但不包含comment的<a>标签
    String reg = "<a((?!comment).)*?>([^<>]*?[\\u4e00-\\u9fa5]+[^<>]*?)+(?=</a>)";
    Pattern pattern = Pattern.compile(reg);
    Matcher matcher = pattern.matcher(source);
    StringBuilder character = new StringBuilder();
    while(matcher.find()){
      String result = matcher.group();
      System.out.println(result);
      //对结果进行二次正则，匹配出中文字符
      String reg1 = "[\\u4e00-\\u9fa5]+";
      Pattern p1 = Pattern.compile(reg1);
      Matcher m1 = p1.matcher(result);
      while(m1.find()){
        character.append(m1.group());
      }
      //System.out.println(character.toString());
    }
    return character.toString();
  }
  public static void main(String[] args) {
    String result = matchChineseCharacters("<a href='www.baidu.comds=id32434#comment'rewr>特432</a>453543<a guhll,,l>a1特123你好123吗？</a><a href=id=32434#comment'ewrer>特2</a><a>标签中的文字</a>");
    System.out.println(result);
  }
}

输出结果如下：

<a guhll,,l>a1特123你好123吗？
<a>标签中的文字
特你好吗标签中的文字

这里做一下解释：

String reg = "<a((?!comment).)*?>([^<>]*?[\\u4e00-\\u9fa5]+[^<>]*?)+(?=</a>)";

这个匹配内容包含中文但标签的属性中不包含comment的<a>标签的正则中，不能使用向后查找?<=，因为向后查找只能是固定长度的内容，这里<a>标签中属性不确定，所以不能使用；[\\u4e00-\\u9fa5]+匹配中文字符串；而(?=</a>)使用向前查找?=，在结果中不会包含结束标签</a>。

这个问题就这样得到解决了。如果说要匹配指定标签中的指定内容，那么也是很容易改进的了。若有更好的正则，还请留言相互学习。

PS：这里再为大家提供2款非常方便的正则表达式工具供大家参考使用：

JavaScript正则表达式在线测试工具：
http://tools.jb51.net/regex/javascript

正则表达式在线生成工具：
http://tools.jb51.net/regex/create_reg

希望本文所述对大家java程序设计有所帮助。

您可能感兴趣的文章:

mac下idea启动web项目报错java.net.SocketException:socket closed
本文主要介绍了作者在项目启动时遇到的一个问题——无法打开调试端口,经过一系列排查和尝试,最终发现是由于权限问题导致的,作者还分享了如何修改文件权限的方法,并提醒大家不要随意kill掉占用端口的进程
2024-12-12
springmvc限流拦截器的示例代码
本篇文章主要介绍了springmvc限流拦截器的示例代码，小编觉得挺不错的，现在分享给大家，也给大家做个参考。一起跟随小编过来看看吧
2017-12-12
SpringCloud微服务熔断器Hystrix使用详解
这篇文章主要介绍了Spring Cloud Hyxtrix的基本使用,它是Spring Cloud中集成的一个组件，在整个生态中主要为我们提供服务隔离，服务熔断，服务降级功能，本文给大家介绍的非常详细，需要的朋友可以参考下
2022-07-07
Java并发工具类之CountDownLatch详解
这篇文章主要介绍了Java并发工具类之CountDownLatch详解,CountDownLatch可以使一个获多个线程等待其他线程各自执行完毕后再执行,CountDownLatch可以解决那些一个或者多个线程在执行之前必须依赖于某些必要的前提业务先执行的场景,需要的朋友可以参考下
2023-12-12
一文掌握SpringSecurity BCrypt密码加密和解密
BCrypt就是一款加密工具，可以比较方便地实现数据的加密工作。也可以简单理解为它内部自己实现了随机加盐处理，这篇文章主要介绍了SpringSecurity BCrypt密码加密和解密，一文学会使用BCryptPasswordEncoder的方法,需要的朋友可以参考下
2023-04-04
Java中的异常和处理机制实例详解
这篇文章主要介绍了Java中的异常和处理机制,结合实例形式详细分析了Java异常与处理机制的相关概念、原理、用法及操作注意事项,需要的朋友可以参考下
2019-05-05
JavaWeb 实现验证码功能(demo)
在 WEB-APP 中一般应用于：登录、注册、买某票、秒杀等场景，大家都接触过这个验证码操作，今天小编通过实例代码给大家讲解javaweb实现验证码功能，需要的朋友参考下
2017-02-02
Java构建JDBC应用程序的实例操作
在本篇文章里小编给大家整理了一篇关于Java构建JDBC应用程序的实例操作，有兴趣的朋友们可以学习参考下。
2021-03-03
Spring Security验证流程剖析及自定义验证方法
Spring Security是一个能够为基于Spring的企业应用系统提供声明式的安全访问控制解决方案的安全框架。这篇文章主要介绍了Spring Security验证流程剖析及自定义验证方法,需要的朋友可以参考下
2018-03-03
javaweb Servlet开发总结（一）
Servlet是sun公司提供的一门用于开发动态web资源的技术。这篇文章主要介绍了javaweb Servlet开发的第一篇，感兴趣的小伙伴们可以参考一下
2016-05-05

java正则匹配HTML中a标签里的中文字符示例

相关文章

最新评论

大家感兴趣的内容

最近更新的内容

常用在线小工具