今天在群里问别人怎么提取文本,也没有具体告诉我用什么,只是说用htmlParser就可提取,查了查API,发现有个类很不错,两句话搞定哈。
import org.htmlparser.Parser;
import org.htmlparser.visitors.TextExtractingVisitor;
public class Test {
public static void main(String[] args) throws Exception {
String sss = "<div class='title'>商品详细说明:</div><p style='word-break: break-all'>ESTEE LAUDER Perfectly Clean Splash Away Foaming Cleanser<br />为中性/混合性肌肤度身订制的清洁产品。 <br />";
Parser parser = new Parser(sss);
TextExtractingVisitor visitor = new TextExtractingVisitor();
parser.visitAllNodesWith(visitor);
System.out.println(visitor.getExtractedText());
}
}
如果解析出现问题,可以在文件之间加入div标签。如:<div>+sss+</div>
根据测试,此方式必须得有div标签才不会报错,可以先添加然后解析的时候自动就没了。
大家还有其它方式解析,可以一起讨论:
具体可参考:www.gegeyigui.com 就有相关应用。