elasticsearch和analysis-ik的安装使用

2019-04-30 11:23:36

参考地址 elasticsearch和analysis-ik的安装使用

全文搜索和中文分词主要介绍了两组全文搜索加中文分词方案;
TNTSearch+jieba-php这套组合对于博客这类的小项目基本够用了;
但是如果最求性能追求更强大的功能的话;
那更优的选择就非 elasticsearch 莫属了;
elasticsearch 需要 java8 以上;
这里安装最新版的 java10 ;
下载 jdk

wget --no-cookies --no-check-certificate --header "Cookie: gpw_e24=http:%2F%2Fwww.oracle.com%2F; oraclelicense=accept-securebackup-cookie" "http://download.oracle.com/otn-pub/java/jdk/10.0.1+10/fb4372174a714e6b8c52526dc134031e/jdk-10.0.1_linux-x64_bin.rpm"

Bash

Copy

因为版本会一直升级;
如果执行上面这段代码返回了 ERROR 404: Not Found ;
那说明有新版本了;
那就自己去官网复制最新的下载链接;
http://www.oracle.com/technetwork/java/javase/downloads/jdk10-downloads-4416644.html ;


选中 Accept License Agreement 然后在 jdk-10.0.1_linux-x64_bin.rpm 上右键复制链接地址;
替换上面命令中的下载链接;


安装 jdk 注意文件名要跟链接中的保持一直;

sudo rpm -ivh jdk-10.0.1_linux-x64_bin.rpm

Bash

Copy

能查看到版本号则表示安装成功;

java -version

Bash

Copy

下载 elasticsearch ;

wget https://artifacts.elastic.co/downloads/elasticsearch/elasticsearch-6.2.4.rpm

Bash

Copy

安装 elasticsearch ;

sudo rpm -ivh elasticsearch-6.2.4.rpm

Bash

Copy

安装完成后编辑配置项

vim /etc/elasticsearch/elasticsearch.yml

Bash

Copy

去掉下面三行的注释;

bootstrap.memory_lock: truenetwork.host: 192.168.0.1
http.port: 9200

Bash

Copy

然后把 network.host 改成 localhost


启动 elasticsearch ;

sudo systemctl daemon-reloadsudo systemctl enable elasticsearch.servicesudo systemctl start elasticsearch

Bash

Copy

稍等片刻给 elasticsearch 个启动的时间;
因为 elasticsearch 启动的略慢;
后续涉及到重启 elasticsearch 的时候也都记得稍等片刻;

然后查看 9200 端口检查是否成功启动;

netstat -plntu

Bash

Copy


如果半天过后仍然没有启动起来;
可能是内存不够出错;

vim /etc/elasticsearch/jvm.options

Bash

Copy

把内存改为自己服务器内存的一半以下;
比如说这里改为 512M ;


尝试启动;


sudo systemctl restart elasticsearch

Bash

Copy

查看状态是否正常;

curl 'localhost:9200'

Bash

Copy


至此 elasticsearch 算是安装完成了;
但是如果想用来搜索中文;
还需要安装中文分词;
怎么算分词呢?
全文搜索和中文分词 文章中已经简单介绍过了;
这里我们从 elasticsearch 实战一遍;
比如说 白俊遥技术博客 这句话;
elasticsearch内置的分词器对中文相当不友好;
只会一个只一个字的分;

curl -H 'Content-Type: application/json'  -XGET 'localhost:9200/_analyze?pretty' -d '{"text":"白俊遥技术博客"}'

Bash

Copy


所以我们需要一个中文分词器;
这里选择和 elasticsearch 配套的 ik-analyzer ;

安装 ik-analyzer ;

/usr/share/elasticsearch/bin/elasticsearch-plugin install https://github.com/medcl/elasticsearch-analysis-ik/releases/download/v6.2.4/elasticsearch-analysis-ik-6.2.4.zip

Bash

Copy

如果报下面这种错误的话可能是网络不好;

Exception in thread "main" java.net.ConnectException: Connection timed out (Connection timed out)at java.base/jdk.internal.reflect.NativeConstructorAccessorImpl.newInstance0(Native Method)

Bash

Copy

沐浴更衣大念帅白最帅;
再试几次即可;

然后重新启动下服务;

sudo systemctl restart elasticsearch

Bash

Copy

看下 ik-analyzer 的效果;

curl -H 'Content-Type: application/json'  -XGET 'localhost:9200/_analyze?pretty' -d '{"analyzer":"ik_max_word","text":"白俊遥技术博客"}'

Bash

Copy


我们可以看到 技术 和 博客 两个词语已经成功组合到了一起;
然而本博主 白俊遥 的名字被硬生生的拆成了3个字这怎么忍;


还好强大的 analysis-ik 支持自定义词库;
增加自定义词库;

vim /etc/elasticsearch/analysis-ik/IKAnalyzer.cfg.xml

Bash

Copy


增加一个 白俊遥 到词库;


echo '白俊遥' > /etc/elasticsearch/analysis-ik/baijunyao.dic

Bash

Copy

重新启动下服务;

sudo systemctl restart elasticsearch

Bash

Copy

再看下分词效果 ;

curl -H 'Content-Type: application/json'  -XGET 'localhost:9200/_analyze?pretty' -d '{"analyzer":"ik_max_word","text":"白俊遥技术博客"}'

Bash

Copy


  • 2019-08-13 08:56:46

    nuxtjs组合element

    添加elementUI 插件,plugins->ele.js,代码如下

  • 2019-08-13 20:06:42

    修改 Nginx 进程最大可打开文件数(worker_processes和worker_connections)

    worker_processes:操作系统启动多少个工作进程运行Nginx。注意是工作进程,不是有多少个nginx工程。在Nginx运行的时候,会启动两种进程,一种是主进程master process;一种是工作进程worker process。例如我在配置文件中将worker_processes设置为4,启动Nginx后,使用进程查看命令观察名字叫做nginx的进程信息,我会看到如下结果:

  • 2019-08-14 09:01:18

    linux下高并发服务器实现

    在做网络服务的时候tcp并发服务端程序的编写必不可少。tcp并发通常有几种固定的设计模式套路,他们各有优点,也各有应用之处。下面就简单的讨论下这几种模式的差异:

  • 2019-08-14 13:18:59

    Linux系统下CPU使用(load average)梳理

    在平时的运维工作中,当一台服务器的性能出现问题时,通常会去看当前的CPU使用情况,尤其是看下CPU的负载情况(load average)。对一般的系统来说,根据cpu数量去判断。比如有2颗cup的机器。如果平均负载始终在1.2以下,那么基本不会出现cpu不够用的情况。也就是Load平均要小于Cpu的数量。

  • 2019-08-14 14:27:35

    计算密集型和IO密集型

    在进行I/O操作的时候,是将任务交给DMA来处理,请求发出后CPU就不管了,在DMA处理完后通过中断通知CPU处理完成了。I/O操作消耗的cpu时间很少.

  • 2019-08-14 14:29:12

    浅谈nodejs和php

    现在,Web开发公司和开发人员可以选择多种技术栈来构建Web应用程序。早期网络发展,不同的技术被用于前端和后端开发。但是,随着Node.js的发布,布局发生了变化,因为它允许开发人员使用 JavaScript 编写后端代码。这最终催生了MEAN(MongoDB + Express +AngularJS + NodeJS )堆栈 web 开发框架,从前端到后端甚至是数据库(MongoDB -JSON)都使用 JavaScript。在 Node.js 之前,Web 开发通常是在 PHP 的帮助下完成的,因为它很容易与 HTML 集成,帮助开发人员立即构建动态网站。在这篇文章中,我们将比较 Node.js 和 PHP,看哪一个最适合当前的行业需求。

  • 2019-08-15 13:32:18

    Node.js是如何解决服务器高性能瓶颈问题的

    在Java、PHP或者.net等服务器端语言中,会为每一个客户端连接创建一个新的线程。而每个线程需要耗费大约2MB内存。也就是说,理论上,一个8GB内存的服务器可以同时连接的最大用户数为4000个左右。要让Web应用程序支持更多的用户,就需要增加服务器的数量,而Web应用程序的硬件成本当然就上升了。

  • 2019-08-15 13:33:53

    nodejs的10个性能优化技巧

    在我接触JavaScript(无论浏览器还是NodeJS)的时间里,总是遇到有朋友有多线程的需求。而在NodeJS方面,有朋友甚至直接说到,NodeJS是单线程的,无法很好的利用多核CPU。那么我们在使用过程中,就要非常注意性能优化了