ES使用热词停用词注意事项

Izellah ·

更新时间:2024-11-13

· 799 次阅读

elasticsearch对无意义的词进行屏蔽——停用词 介绍

在使用elasticsearch进行搜索业务的时候,发现一篇和搜索关键字完全不匹配的文章排在最前面.打开它发现原来是这篇文章含有非常多的"的"这个无意义的词.而我的搜索关键字假设为"历史上的

今天",它可能就被ik_max_word分词后,刚好就有"的"这个词.所以会造成一篇含有很多"的"的文章,即使跟搜索关键字无关,也可能得分很高,排在前面.

那么我们需要做的就是如何对这些无意义的词——停用词进行屏蔽.

解决方案

其实这个问题很好解决,如果你使用ik分词器,其实都为你解决了.但是它默认设置的停用词都是英文的,比如AND,OR等等

那么在哪里配置呢?找到你的es安装插件的文件夹,进入ik分词器的配置文件中,比如我的是

elasticsearch-xxx\plugins\ik\config

打开它发现会有stopword.dic和extra_stopword.dic

打开会发现stopword.dic里面的都为配置的英文停用词,而extra_stopword.dic里面的都为配置的中文停用词

但是我发现在extra_stopword.dic中是有"的"啊.怎么没有效果呢？

原来我们还需要在IKAnalyzer.cfg.xml中进行配置

在这里插入图片描述
如此便配置好了

我们再次搜索就会惊喜的发现,那篇含有无意义的词的文章便搜索不到了.

更新停用词注意事项

想要更新分析器的停用词列表有多种方式，分析器在创建索引时，当集群节点重启时候，或者关闭的索引重新打开的时候。

如果你使用 stopwords 参数以内联方式指定停用词，那么你只能通过关闭索引，更新分析器的配置update index settings API，然后在重新打开索引才能更新停用词。

如果你使用 stopwords_path 参数指定停用词的文件路径，那么更新停用词就简单了。你只需更新文件(在每一个集群节点上)，然后通过两者之中的任何一个操作来强制重新创建分析器:

关闭和重新打开索引 (参考索引的开与关)，
一一重启集群下的每个节点。
当然，更新的停用词不会改变任何已经存在的索引。这些停用词的只适用于新的搜索或更新文档。如果要改变现有的文档，则需要重新索引数据。参加重新索引你的数据。

作者：qq_30502699

停用词

1024 个赞

需要登录后方可回复, 如果你还没有账号请注册新账号

Nginx使用反向代理实现负载均衡过程解析

Opal 2021-03-06

601

python使用jieba实现中文分词去停用词方法示例

Adeline 2020-05-07

907

ES使用热词停用词注意事项

Izellah 2021-01-11

799

文本情感分析：去停用词

Heather 2020-07-25

844

自然语言处理：用paddle对人民日报语料进行分词，停用词，数据清洗和熵计算

Gamila 2021-05-28

712

第2章文本的歧义及其清理（包括，分词，去除停用词，词干提取，词形还原等）

Psyche 2020-08-15

866

python基础之停用词过滤详解

Valentina 2021-12-16

574

我要提问

致谢

帮助他人，成就自己。

人生最大成功就是伸出热情而温暖的双手，尽自己所能去帮助身边的每一个人，只要无私的奉献，就会收获到美好的生活。

1024问感谢每一位朋友的帮助和支持。

软件开发网提供编程的基础软件技术培训教程,软件开发编程实例讲解Go,Node,HTML,CSS,Javascript,Python,Java,Ruby,C,PHP,MySQL等软件开发编程语言以及数据开发的基础知识，也提供大量的软件开发在线实例、从入门到精通就在1024问。

育儿网微养生全球行美食街育儿菜谱大全海南旅游女性养狗百科星座

ES使用热词 停用词注意事项

致谢

ES使用热词停用词注意事项