郑州风铃科贸 發表於 2023-8-21 00:00:00

织梦DedeCMS v5.7全文检索使用说明(sphinx)

<p sizcache="2" sizset="150">
        官方网站:<font color="#2970a6">http://www.sphinxsearch.com/</font><br>
        官方文档:<font color="#2970a6">http://www.sphinxsearch.com/docs/</font><br>
        中文支持:<font color="#2970a6">http://www.coreseek.cn/</font><br>
        中文使用手册下载:<font color="#2970a6">http://www.coreseek.cn/uploads/pdf/sphinx_doc_zhcn_0.9.pdf</font><br>
        中文在线手册:<font color="#2970a6">http://www.coreseek.cn/docs/coreseek_3.2-sphinx_0.9.9.html</font></p>
<p sizcache="2" sizset="155">
        <strong>1.Windows下安装Sphinx</strong><br><strong>1.1.开始前的准备工作</strong><br>
        先从<font color="#2970a6">http://www.coreseek.cn/products/ft_down/</font>下载Coreseek 3.2.13,这里我们就以Windows环境为例:<br>
        下载后直接解压coreseek-3.2.13-win32.zip,我们这里假设解压到:D:\coreseek-3.2.13-win32.这里我们需要简单了解几个目录:</p>
<p>
        API接口目录,其中包括了php,python,ruby等操作实例,其中test_coreseek.php是一个不错的中文检索的例子.</p>
<p>
        应用程序目录,其中包含以下几个文件<br>
            * indexer: 用于创建全文索引;<br>
            * search: 一个简单的命令行(CLI) 的测试程序,用于测试全文索引;<br>
            * searchd: 一个守护进程,其他软件可以通过这个守护进程进行全文检索;<br>
            * sphinxapi: 一系列searchd 的客户端API 库,用于流行的Web脚本开发语言(PHP, Python, Perl, Ruby, Java).<br>
            * spelldump: 一个简单的命令行工具,用于从 ispell 或 MySpell (OpenOffice内置绑定) 格式的字典中提取词条。当使用 wordforms 时可用这些词条对索引进行定制.<br>
            * indextool: 工具程序,用来转储关于索引的多项调试信息。 此工具是从版本Coreseek 3.1(Sphinx 0.9.9-rc2)开始加入的。<br>
            * mmseg: 工具程序和库,Coreseek用于提供中文分词和词典处理。</p>
<p>
        sphinx配置目录<br>
        sphinx变量&amp;索引&amp;日志存放目录</p>
<p sizcache="2" sizset="156">
        <strong>1.2.创建配置文件</strong><br>
        由于<span sizcache="2" sizset="156">DedeCms</span>使用的是mysql,所以我们需要来配置一个mysql的sphinx<span sizcache="2" sizset="157">模板</span>配置,可以复制csft_mysql.conf改名为:csft_dedecmsv57.conf,例如我们这里仅做文章的全文检索,我们需要做如下配置:<br>
        先在<span sizcache="2" sizset="158">DedeCMS</span>中创建一个统计表,方法可以在DedeCMS后台[系统]-&gt;中执行下列代码:<br>
        CREATE TABLE `dede_sphinx` (<br>
            `countid` int(11) unsigned NOT NULL,<br>
            `maxaid` int(11) unsigned NOT NULL,<br>
            PRIMARY KEY (`countid`)<br>
        ) ENGINE=MyISAM DEFAULT CHARSET=gbk<br>
        这是一个sphinx内容统计表,为了适合数据量较大的情况下分批生成索引而使用的.<br>
        创建完数据表后,我们对sphinx的配置文件,即csft_dedecmsv57.conf修改,内容如下,其中包含注释:<br>
        --------------------------------------------------------------------------------------------</p>
<p>
        #源定义<br>
        source mysql<br>
        {<br>
            type                    = mysql</p>
<p>
            # 数据库服务器基本配置信息<br>
            sql_host                = 192.168.0.103<br>
            sql_user                = dedev57<br>
            sql_pass                = dedecms<br>
            sql_db                  = dedecmsv57gbk<br>
            sql_port                = 3306<br>
            <br>
            # 设定编码,这里我们是gbk编码,如果是utf-8,可以设置:<br>
            # sql_query_pre            = SET NAMES utf8<br>
            sql_query_pre            = SET NAMES gbk<br>
            <br>
            # 数据检索增量<br>
            sql_range_step = 1000<br>
            <br>
            #当前最新文档id数<br>
            sql_query_pre = REPLACE INTO dede_sphinx SELECT 1, MAX(id) FROM dede_archives<br>
            <br>
            #检索条件<br>
            sql_query               = SELECT ARC.id,ARC.typeid,ARC.typeid2,ARC.sortrank,ARC.flag,ARC.channel,ARC.ismake,ARC.arcrank,ARC.click,ARC.title,ARC.shorttitle,ARC.color,ARC.writer,ARC.source,ARC.litpic,ARC.pubdate,ARC.senddate,ARC.mtype,ARC.description,ARC.badpost,ARC.goodpost,ARC.scores,ARC.lastpost,ARC.keywords,ARC.mid,ART.body FROM dede_archives AS ARC LEFT JOIN dede_addonarticle AS ART ON ARC.id = ART.aid WHERE ARC.id&gt;=$start AND ARC.id&lt;=$end #sql_query第一列id需为整数<br>
            #title、body作为字符串/文本字段,被全文索引<br>
            <br>
            # 获取当前最大检索id<br>
            sql_query_range  = SELECT 1,maxaid FROM dede_sphinx WHERE countid=1</p>
<p>
                                                    <br>
            sql_attr_uint             = typeid            #从SQL读取到的值必须为整数<br>
            sql_attr_uint            = typeid2<br>
            sql_attr_uint            = channel<br>
            sql_attr_uint            = click<br>
            sql_attr_uint            = badpost<br>
            sql_attr_uint            = goodpost<br>
            sql_attr_uint            = scores<br>
            sql_attr_uint            = mid<br>
            sql_attr_timestamp  = pubdate    #从SQL读取到的值必须为整数,作为时间属性<br>
            sql_attr_timestamp  = senddate<br>
            sql_attr_timestamp  = lastpost</p>
<p>
            #命令行查询时,从数据库读取原始数据信息<br>
            sql_query_info            = SELECT ARC.*,ART.body FROM dede_archives AS ARC LEFT JOIN dede_addonarticle AS ART ON ARC.id = ART.aid WHERE ARC.id=$id  <br>
        }</p>
<p>
        source delta<br>
        {<br>
            type                    = mysql</p>
<p>
            # 数据库服务器基本配置信息<br>
            sql_host                = 192.168.0.103<br>
            sql_user                = dedev57<br>
            sql_pass                = dedecms<br>
            sql_db                  = dedecmsv57gbk<br>
            sql_port                = 3306<br>
            sql_query_pre            = SET NAMES gbk</p>
<p>
            # 增量索引,从最大id开始<br>
            sql_query = SELECT ARC.id,ARC.typeid,ARC.typeid2,ARC.sortrank,ARC.flag,ARC.channel,ARC.ismake,ARC.arcrank,ARC.click,ARC.title,ARC.shorttitle,ARC.color,ARC.writer,ARC.source,ARC.litpic,ARC.pubdate,ARC.senddate,ARC.mtype,ARC.description,ARC.badpost,ARC.goodpost,ARC.scores,ARC.lastpost,ARC.keywords,ARC.mid,ART.body FROM dede_archives AS ARC LEFT JOIN dede_addonarticle AS ART ON ARC.id = ART.aid WHERE ARC.id &gt; ( SELECT maxaid FROM dede_sphinx WHERE countid=1 )<br>
            #从SQL读取到的值必须为整数<br>
            <br>
            sql_query_post = REPLACE INTO dede_sphinx SELECT 1, MAX(id) FROM dede_archives<br>
            <br>
            sql_attr_uint             = typeid            <br>
            sql_attr_uint            = typeid2<br>
            sql_attr_uint            = channel<br>
            sql_attr_uint            = click<br>
            sql_attr_uint            = badpost<br>
            sql_attr_uint            = goodpost<br>
            sql_attr_uint            = scores<br>
            sql_attr_uint            = mid<br>
            sql_attr_timestamp  = pubdate    #从SQL读取到的值必须为整数,作为时间属性<br>
            sql_attr_timestamp  = senddate<br>
            sql_attr_timestamp  = lastpost</p>
<p>
            #命令行查询时,从数据库读取原始数据信息<br>
            sql_query_info            = SELECT ARC.*,ART.body FROM dede_archives AS ARC LEFT JOIN dede_addonarticle AS ART ON ARC.id = ART.aid WHERE ARC.id=$id  <br>
        }</p>
<p>
        #index定义<br>
        index mysql<br>
        {<br>
            source            = mysql             #对应的source名称<br>
            path            = D:/coreseek-3.2.13-win32/var/data/mysql<br>
            docinfo            = extern<br>
            mlock            = 0<br>
            morphology        = none<br>
            min_word_len        = 1<br>
            html_strip                = 0<br>
            #charset_dictpath = /usr/local/mmseg3/etc/    #BSD、Linux环境下设置,/符号结尾<br>
            charset_dictpath = D:/coreseek-3.2.13-win32/etc/                        #Windows环境下设置,/符号结尾<br>
            charset_type        = zh_cn.gbk<br>
        }</p>
<p>
        index delta : mysql<br>
        {<br>
            min_word_len        = 1<br>
            source = delta<br>
            path            = D:/coreseek-3.2.13-win32/var/data/delta.new<br>
        }</p>
<p>
        #全局index定义<br>
        indexer<br>
        {<br>
            mem_limit            = 128M<br>
        }</p>
<p>
        #searchd服务定义<br>
        searchd<br>
        {<br>
            listen                  =   9312<br>
            read_timeout        = 5<br>
            max_children        = 30<br>
            max_matches            = 1000<br>
            seamless_rotate        = 0<br>
            preopen_indexes        = 0<br>
            unlink_old            = 1<br>
            pid_file = D:/coreseek-3.2.13-win32/var/log/searchd_mysql.pid<br>
            log = D:/coreseek-3.2.13-win32/var/log/searchd_mysql.log<br>
            query_log = D:/coreseek-3.2.13-win32/var/log/query_mysql.log<br>
        }</p>
<p>
        -------------------------------------------------------------------------------------------------------</p>
<p>
        <strong>1.3.建立索引</strong><br>
        配置完成后,我们要先建立索引,在开始菜单中打开[运行],输入"cmd",确认后打开命令行.输入下列代码:</p>
<p>
        d:&amp;cd D:\coreseek-3.2.13-win32\bin</p>
<p>
        先切换到sphinx的bin目录,然后再执行:</p>
<p>
        indexer.exe -c D:\coreseek-3.2.13-win32\etc\csft_dedecmsv57.conf mysql --rotate</p>
<p>
        这个时候sphinx开始构建索引,如果数据量比较大,这个时间可能比较长,需要耐心等待(如图1).</p>
<p>
        <br><img style="max-width:100%!important;height:auto!important;"title="织梦DedeCMS v5.7全文检索使用说明(sphinx)" alt="织梦DedeCMS v5.7全文检索使用说明(sphinx)" border="0" src="https://zhuji.jb51.net/uploads/img/20230519/c343ee5a4b66a0df4409b7731821c056.jpg"></p>
<p>
        然后再创建下增量索引,使用下列命令:<br>
        indexer.exe -c D:\coreseek-3.2.13-win32\etc\csft_dedecmsv57.conf delta --rotate</p>
<p>
        <strong>1.4.测试检索是否正常</strong><br>
        建立完索引之后我们来检测下是否能够正常搜索到匹配内容,可以继续在cmd中输入下列命令:</p>
<p>
        search.exe -c D:\coreseek-3.2.13-win32\etc\csft_dedecmsv57.conf dedecms</p>
<p>
        如果能够正常返回数据(如图2),则说明已经成功建立索引.</p>
<p>
        <br><img style="max-width:100%!important;height:auto!important;"title="织梦DedeCMS v5.7全文检索使用说明(sphinx)" alt="织梦DedeCMS v5.7全文检索使用说明(sphinx)" border="0" src="https://zhuji.jb51.net/uploads/img/20230519/9d7f7ce8b374d3fed7f67d0d11506d92.jpg"></p>
<p>
        <strong>2.结合DedeCMS程序使用sphinx</strong><br><strong>2.1.开启sphinx服务</strong><br>
        在上面的步骤中我们已经成功生成了索引,接下来为了能够使用客户端调用则需要开启sphinx服务.<br>
        可以直接在cmd中执行:<br>
        searchd.exe -c D:\coreseek-3.2.13-win32\etc\csft_dedecmsv57.conf<br>
        这样我们就开启了sphinx服务(如图3),我们可以写一个简单的例子进行测试:</p>
<p>
        <br><img style="max-width:100%!important;height:auto!important;"title="织梦DedeCMS v5.7全文检索使用说明(sphinx)" alt="织梦DedeCMS v5.7全文检索使用说明(sphinx)" border="0" src="https://zhuji.jb51.net/uploads/img/20230519/90c40f65c2627575dff238d28d248a67.jpg"></p>
<p>
        sphinx_test.php<br>
        --------------------------------------------------------------------------------------------------------<br>
        &lt;?php<br>
        set_time_limit(0);<br>
        require_once (dirname(__FILE__) . "/include/common.inc.php");<br>
        $sphinx = new SphinxClient;</p>
<p>
        $mode = SPH_MATCH_ANY;            //匹配模式<br>
        $host = "localhost";            //服务ip<br>
        $port = 9312;    //服务端口<br>
                <br>
        $sphinx-&gt;SetServer($host, $port);<br>
        $sphinx-&gt;SetArrayResult(true);<br>
        $sphinx-&gt;SetMatchMode($mode);</p>
<p sizcache="2" sizset="159">
        $res = $sphinx-&gt;Query('<span sizcache="2" sizset="159"><font color="#2970a6">织梦</font></span>内容管理系统');</p>
<p>
        //var_dump($sphinx);<br>
        //var_dump($res);<br>
        $total = count($res['matches']);<br>
        for($i=0; $i &lt; $total; $i++)<br>
        {<br>
            var_dump($res['matches'][$i]);<br>
        }</p>
<p>
        -----------------------------------------------------------------------------------------------------<br>
        执行sphinx_test.php,可以看到已经能够正常通信,并且返回了内容.</p>
<p>
        <br></p>
<p>
        <strong>2.2.创建一个DedeSphinx服务</strong><br>
        上面我们通过searchd.exe开启了服务,但不好的是,我们关闭了cmd窗口就不能继续访问了,解决办法如下:<br>
        同样切换到bin目录下,执行:</p>
<p>
        searchd.exe --install -c D:\coreseek-3.2.13-win32\etc\csft_dedecmsv57.conf --servicename DedeSphinx<br>
        这样就在系统中成功创建了一个DedeSphinx服务,无需再打开窗口(如图5).</p>
<p>
        <br><img style="max-width:100%!important;height:auto!important;"title="织梦DedeCMS v5.7全文检索使用说明(sphinx)" alt="织梦DedeCMS v5.7全文检索使用说明(sphinx)" border="0" src="https://zhuji.jb51.net/uploads/img/20230519/f799f6db77edba23d1051dec9198cf04.jpg"></p>
<p>
        <strong>3.更新与维护</strong><br>
        对于全文检索的索引,我们是需要不定期生成的,如果是数据量比较小,直接使用上述生成索引的命令重建就可以,如果数据量比较大,我们则需要定义的更新全文索引.</p>
<p>
        如果内容更新比较频繁,下列的命令需要每分钟被执行一次(可以创建一个脚本,使用windows计划任务定期执行)</p>
<p>
        生成增量索引:</p>
<p>
        indexer.exe -c D:\coreseek-3.2.13-win32\etc\csft_dedecmsv57.conf delta --rotate</p>
<p>
        当然每一天都需要将增量索引合并到主索引mysql中去,需要执行:</p>
<p>
        indexer.exe -c D:\coreseek-3.2.13-win32\etc\csft_dedecmsv57.conf --merge mysql delta --rotate</p>
頁: [1]
查看完整版本: 织梦DedeCMS v5.7全文检索使用说明(sphinx)