利用正则表达式获取网页中多处重复出现的标签数据

最新推荐文章于 2023-02-11 17:31:52 发布

JamesZhao1987

最新推荐文章于 2023-02-11 17:31:52 发布

阅读量767

点赞数

分类专栏： javaSE基础文章标签：利用正则表达式获取网页中多处重复出现的标签数据

版权声明：本文为博主原创文章，遵循 CC 4.0 BY-SA 版权协议，转载请附上原文出处链接和本声明。

本文链接：https://blog.csdn.net/JamesZhao1987/article/details/84156232

版权

javaSE基础专栏收录该内容

19 篇文章 0 订阅

订阅专栏

public static void main(String[] args) {
String regex = "<p style=\"TEXT-INDENT: 2em\">(.*?)</p>";
String html = "<p style=\"TEXT-INDENT: 2em\">ttt</p>yyyyyfafdasf<p style=\"TEXT-INDENT: 2em\">bbb</p>";
Pattern pattern = Pattern.compile(regex);
Matcher match = pattern.matcher(html);
StringBuffer buffer = new StringBuffer();
while(match.find()){
buffer.append(match.group(1));
buffer.append("\n");
}
System.out.println(buffer.toString());
}
说明:想要抓取网页中想要的文本，而每段文本都是存放在<p style=\"TEXT-INDENT: 2em\">开头和</p>结尾的标签中，所以我们想要的获取的是ttt和bbb，(.*?)表示一个分组，并且使用的是非贪婪的模式，即获取最小的匹配内容，match.find()返回的是是否找到匹配的内容，match.group(1)表示取出其中的文本内容

关注

0
点赞
踩
0

收藏

觉得还不错? 一键收藏
0
评论
利用正则表达式获取网页中多处重复出现的标签数据

public static void main(String[] args) { String regex = "(.*?)"; String html = "tttyyyyyfafdasfbbb"; Pattern pattern = Pattern.compile(regex); Matcher match = pattern.matcher(html)...
复制链接

扫一扫

专栏目录

评论

被折叠的条评论为什么被折叠?

到【灌水乐园】发言

查看更多评论

添加红包

成就一亿技术人!

hope_wisdom

发出的红包

实付元

使用余额支付

点击重新获取

扫码支付

钱包余额 0

抵扣说明：

1.余额是钱包充值的虚拟货币，按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载，可以购买VIP、付费专栏及课程。