elasticsearch和analysis-ik的安装使用

2019-04-30 11:23:36

参考地址 elasticsearch和analysis-ik的安装使用

全文搜索和中文分词主要介绍了两组全文搜索加中文分词方案;
TNTSearch+jieba-php这套组合对于博客这类的小项目基本够用了;
但是如果最求性能追求更强大的功能的话;
那更优的选择就非 elasticsearch 莫属了;
elasticsearch 需要 java8 以上;
这里安装最新版的 java10 ;
下载 jdk

wget --no-cookies --no-check-certificate --header "Cookie: gpw_e24=http:%2F%2Fwww.oracle.com%2F; oraclelicense=accept-securebackup-cookie" "http://download.oracle.com/otn-pub/java/jdk/10.0.1+10/fb4372174a714e6b8c52526dc134031e/jdk-10.0.1_linux-x64_bin.rpm"

Bash

Copy

因为版本会一直升级;
如果执行上面这段代码返回了 ERROR 404: Not Found ;
那说明有新版本了;
那就自己去官网复制最新的下载链接;
http://www.oracle.com/technetwork/java/javase/downloads/jdk10-downloads-4416644.html ;


选中 Accept License Agreement 然后在 jdk-10.0.1_linux-x64_bin.rpm 上右键复制链接地址;
替换上面命令中的下载链接;


安装 jdk 注意文件名要跟链接中的保持一直;

sudo rpm -ivh jdk-10.0.1_linux-x64_bin.rpm

Bash

Copy

能查看到版本号则表示安装成功;

java -version

Bash

Copy

下载 elasticsearch ;

wget https://artifacts.elastic.co/downloads/elasticsearch/elasticsearch-6.2.4.rpm

Bash

Copy

安装 elasticsearch ;

sudo rpm -ivh elasticsearch-6.2.4.rpm

Bash

Copy

安装完成后编辑配置项

vim /etc/elasticsearch/elasticsearch.yml

Bash

Copy

去掉下面三行的注释;

bootstrap.memory_lock: truenetwork.host: 192.168.0.1
http.port: 9200

Bash

Copy

然后把 network.host 改成 localhost


启动 elasticsearch ;

sudo systemctl daemon-reloadsudo systemctl enable elasticsearch.servicesudo systemctl start elasticsearch

Bash

Copy

稍等片刻给 elasticsearch 个启动的时间;
因为 elasticsearch 启动的略慢;
后续涉及到重启 elasticsearch 的时候也都记得稍等片刻;

然后查看 9200 端口检查是否成功启动;

netstat -plntu

Bash

Copy


如果半天过后仍然没有启动起来;
可能是内存不够出错;

vim /etc/elasticsearch/jvm.options

Bash

Copy

把内存改为自己服务器内存的一半以下;
比如说这里改为 512M ;


尝试启动;


sudo systemctl restart elasticsearch

Bash

Copy

查看状态是否正常;

curl 'localhost:9200'

Bash

Copy


至此 elasticsearch 算是安装完成了;
但是如果想用来搜索中文;
还需要安装中文分词;
怎么算分词呢?
全文搜索和中文分词 文章中已经简单介绍过了;
这里我们从 elasticsearch 实战一遍;
比如说 白俊遥技术博客 这句话;
elasticsearch内置的分词器对中文相当不友好;
只会一个只一个字的分;

curl -H 'Content-Type: application/json'  -XGET 'localhost:9200/_analyze?pretty' -d '{"text":"白俊遥技术博客"}'

Bash

Copy


所以我们需要一个中文分词器;
这里选择和 elasticsearch 配套的 ik-analyzer ;

安装 ik-analyzer ;

/usr/share/elasticsearch/bin/elasticsearch-plugin install https://github.com/medcl/elasticsearch-analysis-ik/releases/download/v6.2.4/elasticsearch-analysis-ik-6.2.4.zip

Bash

Copy

如果报下面这种错误的话可能是网络不好;

Exception in thread "main" java.net.ConnectException: Connection timed out (Connection timed out)at java.base/jdk.internal.reflect.NativeConstructorAccessorImpl.newInstance0(Native Method)

Bash

Copy

沐浴更衣大念帅白最帅;
再试几次即可;

然后重新启动下服务;

sudo systemctl restart elasticsearch

Bash

Copy

看下 ik-analyzer 的效果;

curl -H 'Content-Type: application/json'  -XGET 'localhost:9200/_analyze?pretty' -d '{"analyzer":"ik_max_word","text":"白俊遥技术博客"}'

Bash

Copy


我们可以看到 技术 和 博客 两个词语已经成功组合到了一起;
然而本博主 白俊遥 的名字被硬生生的拆成了3个字这怎么忍;


还好强大的 analysis-ik 支持自定义词库;
增加自定义词库;

vim /etc/elasticsearch/analysis-ik/IKAnalyzer.cfg.xml

Bash

Copy


增加一个 白俊遥 到词库;


echo '白俊遥' > /etc/elasticsearch/analysis-ik/baijunyao.dic

Bash

Copy

重新启动下服务;

sudo systemctl restart elasticsearch

Bash

Copy

再看下分词效果 ;

curl -H 'Content-Type: application/json'  -XGET 'localhost:9200/_analyze?pretty' -d '{"analyzer":"ik_max_word","text":"白俊遥技术博客"}'

Bash

Copy


  • 2017-09-11 16:35:22

    ngx_http_realip_module使用详解

    网络上关于ngx_http_realip_module的文章千篇一律,全是在说怎么安装,最多贴一个示例配置,却没有说怎么用,为什么这么用,官网文档写得也十分简略,于是就自己探索了一下。

  • 2017-09-11 16:39:43

    基于Nginx dyups模块的站点动态上下线

    在分布式服务下,我们会用nginx做负载均衡, 业务站点访问某服务站点的时候, 统一走nginx, 然后nginx根据一定的轮询策略,将请求路由到后端一台指定的服务器上。

  • 2017-09-13 13:49:21

    Web性能测试:工具之Siege详解

    Siege是一款开源的压力测试工具,设计用于评估WEB应用在压力下的承受能力。可以根据配置对一个WEB站点进行多用户的并发访问,记录每个用户所有请求过程的相应时间,并在一定数量的并发访问下重复进行。siege可以从您选择的预置列表中请求随机的URL。所以siege可用于仿真用户请求负载,而ab则不能。但不要使用siege来执行最高性能基准调校测试,这方面ab就准确很多

  • 2017-09-14 10:18:25

    15分钟成为Git专家

    不管是以前使用过 Git 还是刚开始使用这个神奇的版本控制工具的开发者,阅读了本文以后都会收获颇丰。如果你是应一名有经验的 GIT 使用者,你会更好的理解 checkout -> modify -> commit 这个过程。如果你刚开始使用 Git,本文将给你一个很好的开端。

  • 2017-09-28 16:42:57

    Linux vmstat命令实战详解

    vmstat命令是最常见的Linux/Unix监控工具,可以展现给定时间间隔的服务器的状态值,包括服务器的CPU使用率,内存使用,虚拟内存交换情况,IO读写情况。这个命令是我查看Linux/Unix最喜爱的命令,一个是Linux/Unix都支持,二是相比top,我可以看到整个机器的CPU,内存,IO的使用情况,而不是单单看到各个进程的CPU使用率和内存使用率(使用场景不一样)。

  • 2017-10-13 16:21:29

    Activity的四种launchMode

    launchMode在多个Activity跳转的过程中扮演着重要的角色,它可以决定是否生成新的Activity实例,是否重用已存在的Activity实例,是否和其他Activity实例公用一个task里。这里简单介绍一下task的概念,task是一个具有栈结构的对象,一个task可以管理多个Activity,启动一个应用,也就创建一个与之对应的task。

  • 2017-10-16 16:45:45

    Android开发技巧:Application和Instance

    在开发过程中,我们经常会需要用到一些全局的变量或者全局的“管理者”,例如QQ,需要有一个“全局的管理者“保存好友信息,各个activity即可直接通过该”管理者“来获取和修改某个好友信息,显然,这样的一个好友信息,保存到某一个具体的activity里面,然后依靠activity的intent来传递参数是不合适。我们有两种方法来实现这样一个全局的管理者,一种是使用C++/Java中常用的单例模式,另一种是利用Android的Application类,下面一一阐述。