php 正则表达式 匹配 html标签,使用正则表达式和php匹配未关闭的html标签

您可能没有意识到这一点,但DOMDocument可以帮助您修复HTML.

$html = "

Hello world

It's 7Am where I live

";

libxml_use_internal_errors(true);

$dom = new DOMDocument();

$dom->loadHTML('' . $html . '',LIBXML_HTML_NOIMPLIED | LIBXML_HTML_NODEFDTD);

$xpath = new DOMXPath($dom);

foreach( $xpath->query('//*[not(node())]') as $node ) {

$node->parentNode->removeChild($node);

}

echo substr($dom->saveHTML(),6,-8);

结果:< div>< h2> Hello world< / h2>< p>我住的地方是7Am< / p>< / div>

请注意,基于XPath的空节点清理是必要的,因为DOM包含空< h2>< / h2>,< p>< / p>和< div>< / div>将HTML加载到DOM后的标记.

< root>在开头添加元素以确保我们获得根元素.之后,我们可以使用substr进行后处理.

LIBXML_HTML_NOIMPLIED | LIBXML_HTML_NODEFDTD标志是必需的,因此没有DTD和其他垃圾没有添加到DOM.

评论
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值