elasticsearch如何使用Ngram实现任意位数手机号搜索

更新时间：2024年05月17日 09:35:38 作者：it噩梦

Ngram是一种基于统计语言模型的算法,Ngram基本思想是将文本里面的内容按照字节大小进行滑动窗口操作,形成长度是N的字节片段序列,这篇文章主要介绍了elasticsearch使用Ngram实现任意位数手机号搜索,需要的朋友可以参考下

Ngram自定义分词案例

当对keyword类型的字段进行高亮查询时，若值为123asd456，查询sd4，则高亮结果是＜em＞123asd456＜em＞。那么，有没有办法只对sd4高亮呢？用一句话来概括问题：明明只想查询ID的一部分，但高亮结果是整个ID串，此时应该怎么办？

实战问题拆解

###定义索引
PUT my_index_0602
{
  "mappings": {
    "properties": {
      "phoneNum": {
        "type": "keyword"
      }
    }
  }
}
####批量写入数据
POST my_index_0602/_bulk
{"index":{"_id":1}}
{"phoneNum":"13511112222"}
{"index":{"_id":2}}
{"phoneNum":"13844248474"}
###执行模糊检索和高亮显示
POST my_index_0602/_search
{
  "highlight": {
    "fields": {
      "phoneNum": {}
    }
  },
  "query": {
    "bool": {
      "should": [
        {
          "wildcard": {
            "phoneNum": "*1111*"
          }
        }
      ]
    }
  }
}

高亮检索结果如下。

也就是说，整个字符串都呈现为高亮状态了，没有达到预期。

检索过程中选择使用wildcard是为了解决子串匹配的问题，wildcard的实现逻辑类似于MySQL的like模糊匹配。传统的text标准分词器，包括中文分词器ik、英文分词器english、standard等都不能解决上述子串匹配问题。

而实际业务需求是这样的：一方面要求输入子串能召回全串；另一方面要求检索的子串实现高亮。对此，只能更换一种分词来实现，即Ngram。

Ngram分词器定义

Ngram分词定义

Ngram是一种基于统计语言模型的算法。Ngram基本思想是将文本里面的内容按照字节大小进行滑动窗口操作，形成长度是N的字节片段序列。此时每一个字节片段称为gram。对所有gram的出现频度进行统计，并且按照事先设定好的阈值进行过滤，形成关键gram列表，也就是这个文本的向量特征空间。列表中的每一种gram就是一个特征向量维度。

该模型基于这样一种假设，第N个词的出现只与前面N-1个词相关，而与其他任何词都不相关，整句的概率就是各个词出现概率的乘积。这些概率可以通过直接从语料中统计N个词同时出现的次数得到。常用的是二元的Bi-Gram（二元语法）和三元的Tri-Gram（三元语法）。

Ngram分词示例

以“你今天吃饭了吗“这一中文句子为例，它的Bi-Gram分词结果如下。

Ngram分词应用场景

场景1：文本压缩、检查拼写错误、加速字符串查找、文献语种识别。

场景2：自然语言处理自动化领域得到新的应用。如自动分类、自动索引、超链的自动生成、文献检索、无分隔符语言文本的切分等。

场景3：自然语言的自动分类功能。针对Elasticsearch检索，Ngram针对无分隔符语言文本的分词（比如手机号检索），可提高检索效率（相较于wildcard检索和正则匹配检索来说）

Ngram分词实战

###定义索引
PUT my_index_0603
{
    "settings":{
        "number_of_shards":1,
        "number_of_replicas":0,
        "index.max_ngram_diff" : 10,
        "analysis":{
            "analyzer":{
                "phoneNo_analyzer":{
                    "tokenizer": "phoneNo_analyzer"
                }
            },
            "tokenizer":{
                "phoneNo_analyzer":{
                    "type": "ngram",
                    "min_gram": 4,
                    "max_gram": 11,
                    "token_chars": [
                        "letter","digit"
                    ]
                }
            }
        }
    },
    "mappings":{
        "dynamic":"strict",
        "properties":{
            "phoneNo":{
                "type":"text",
                "analyzer": "phoneNo_analyzer"
            }
        }
    }
}
####批量写入数据
POST my_index_0603/_bulk
{"index":{"_id":1}}
{"phoneNo":"13511112222"}
{"index":{"_id":2}}
{"phoneNo":"13844248474"}
POST my_index_0603/_analyze
{
  "analyzer": "phoneNo_analyzer",
  "text": "13511112222"
}
POST my_index_0603/_search
{
  "highlight": {
    "fields": {
      "phoneNo": {}
    }
  },
  "query": {
    "bool": {
      "should": [
        {
          "match_phrase": {
            "phoneNo": "1111"
          }
        }
      ]
    }
  }
}

到此这篇关于elasticsearch如何使用Ngram实现任意位数手机号搜索的文章就介绍到这了,更多相关elasticsearch任意位数手机号搜索内容请搜索脚本之家以前的文章或继续浏览下面的相关文章希望大家以后多多支持脚本之家！

您可能感兴趣的文章:

微信支付--签名错误问题的解决方法
这篇文章主要介绍了微信支付--签名错误问题，本文给大家介绍的非常详细，具有一定的参考借鉴价值 ,需要的朋友可以参考下
2019-07-07
Iris 环境搭建详细教程(最新版Go&IDEA&IrisV12)
这篇文章主要介绍了Iris 环境搭建(最新版Go&IDEA&IrisV12),本文通过示例图文相结合给大家介绍的非常详细，对大家的学习或工作具有一定的参考借鉴价值，需要的朋友可以参考下
2021-11-11
各种语言常用的一句话判断代码
提供各种语言常用的一句话判断代码：一句话就能判断是不是含有中文、一句话就能判断是不是纯数字、一句话就能判断是不是闰年、一句话就能判断记录分多少页
2013-03-03
idea激活码最新获取方法（idea2020激活码汇总）
针对idea激活码失效的情况，我们给大家带来最新的idea激活码以及相关激活教程，分享最新idea激活参数等信息。
2020-02-02
支付宝小程序向用户发红包的实现方法
这篇文章主要介绍了支付宝小程序向用户发红包的实现方法,本文给大家介绍的非常详细，对大家的学习或工作具有一定的参考借鉴价值，需要的朋友可以参考下
2020-11-11
最新Adobe 2022全新上线 Adobe 2022永久免费使用教程
目前adobe2022的配置要求CPU至少是四核，运行内存至少是16GB，只支持windows10系统，版本号是1809以及更高的版本，下面跟随小编看下最新Adobe 2022全新上线 Adobe 2022永久免费使用教程，感兴趣的朋友一起看看吧
2021-12-12
AIGC与虚拟现实(VR)的结合与应用前景分析
随着AIGC与VR技术的不断进步,两者的结合为教育、娱乐、医疗等领域带来了新机遇,AIGC可以自动生成文本、图像等内容,结合VR技术,为用户提供更加丰富和互动的体验,本文探讨了AIGC与VR的结合方式、应用案例和未来发展趋势
2024-11-11
lambda 表达式导致 Arthas 无法 redefine 的问题
这篇文章主要介绍了lambda 表达式导致 Arthas 无法 redefine 的问题,本文通过图文实例相结合给大家介绍的非常详细，对大家的学习或工作具有一定的参考借鉴价值，需要的朋友可以参考下
2020-06-06
使用Windows自带的IIS服务搭建本地站点并远程访问的操作方法
在Windows系统中实际上集成了建立网站所必须的软件环境,今天就让我们来看看,如何使用Windows自带的网站程序建立网站吧,感兴趣的朋友一起看看吧
2023-12-12
WebStorm安装配置教程
WebStorm 是jetbrains公司旗下一款JavaScript开发工具，这篇文章主要为大家详细介绍了WebStorm安装教程，文中安装步骤非常详细，具有一定的参考价值，感兴趣的小伙伴们可以参考一下
2020-11-11