solr系统query检索词特殊字符的处理

solr是基于 lucence开发的应用,如果query中带有非法字符串,结果很可能是检索出所有内容或者直接报错,所以你对用户的输入必须要先做处理。输入星号,能够检索出所有内容;输入加号,则会报错。

官方的处理办法(Java,因为solr是java开发的):

[java]  view plain  copy
  在CODE上查看代码片 派生到我的代码片
  1. https://svn.apache.org/repos/asf/lucene/dev/trunk/solr/solrj/src/java/org/apache/solr/client/solrj/util/ClientUtils.java  
  2.   
  3. public static String escapeQueryChars(String s) {  
  4.     StringBuilder sb = new StringBuilder();  
  5.     for (int i = 0; i < s.length(); i++) {  
  6.       char c = s.charAt(i);  
  7.       // These characters are part of the query syntax and must be escaped  
  8.       if (c == '\\' || c == '+' || c == '-' || c == '!'  || c == '(' || c == ')' || c == ':'  
  9.         || c == '^' || c == '[' || c == ']' || c == '\"' || c == '{' || c == '}' || c == '~'  
  10.         || c == '*' || c == '?' || c == '|' || c == '&'  || c == ';' || c == '/'  
  11.         || Character.isWhitespace(c)) {  
  12.         sb.append('\\');  
  13.       }  
  14.       sb.append(c);  
  15.     }  
  16.     return sb.toString();  
  17.   }  

翻译的php版本(利用preg_replace函数进行正则替换):

[php]  view plain  copy
  在CODE上查看代码片 派生到我的代码片
  1. static public function escape($value)  
  2. {  
  3.     //list taken from http://lucene.apache.org/java/docs/queryparsersyntax.html#Escaping%20Special%20Characters  
  4.     $pattern = '/(\+|-|&|\||!| | |\{|}|\[|]|\^|"|~|\*|\?|:|;|~|\/)/';  
  5.     $replace = '\\\$1';  
  6.   
  7.    return preg_replace($pattern$replace$value);  
  8. }  

翻译后的python版本:

[python]  view plain  copy
  在CODE上查看代码片 派生到我的代码片
  1. import re  
  2. def escape_solr(word):  
  3.     return re.sub('(\\\|\+|-|&|\|\||!| | |\{|}|\[|]|\^|"|~|\*|\?|:|;|/|\~)','\\\1', word )  

Solr在搜索的时候的做法是,将特殊字符移除掉,可以通过下面的方法
queryStr.replaceAll("\\pP|\\pS","");

评论
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值