经常扒别人网站文章的坑们;
我是指那种批量式采集的压根不看内容的;
少不了都会用到删除html标签的函数;
这里介绍3种不同用途上的方法;
$str='<div><p>这里是p标签</p><img src="" alt="这里是img标签"><a href="">这里是a标签</a><br></div>';
1:删除全部或者保留指定html标签
php自带的函数strip_tags即可满足要求,
使用方法:
strip_tags(string,allow);
string:需要处理的字符串;
allow:需要保留的指定标签,可以写多个;
echo strip_tags($str,'<p><a>');
//输出:<p>这里是p标签</p><a href="">这里是a标签</a>
此函数的优点是简单粗暴;
但是缺点也很明显;
如果有一大堆标签;
而我只是想删除指定的某一个;
那要写很多需要保留的标签;
所以有了第二个方法;
2:删除指定的html标签
使用方法:strip_html_tags($tags,$str);
$tags:需要删除的标签(数组格式)
$str:需要处理的字符串;
function strip_html_tags($tags,$str){
$html=array();
foreach ($tags as $tag) {
$html[]="/(<(?:\/".$tag."|".$tag.")[^>]*>)/i";
}
$data=preg_replace($html, '', $str);
return $data;
}
echo strip_html_tags(array('p','img'),$str);
//输出:<div>这里是p标签<a href="">这里是a标签</a><br></div>;
3:删除标签和标签的内容
使用方法:strip_html_tags($tags,$str);
$tags:需要删除的标签(数组格式)
$str:需要处理的字符串;
function strip_html_tags($tags,$str){
$html=array();
foreach ($tags as $tag) {
$html[]='/<'.$tag.'.*?>[\s|\S]*?<\/'.$tag.'>/';
$html[]='/<'.$tag.'.*?>/';
}
$data=preg_replace($html,'',$str);
return $data;
}
echo strip_html_tags(array('a','img'),$str);
//输出<div><p>这里是p标签</p><br></div>
很多网站文章里面会带上网站名和链接;
比如<a href="http://www.baijunyao.com">白俊遥博客</a>;
这个函数就是专治这种;
别拿这个函数采集本站啊;
不然保证不打死你;
4:终极函数,删除指定标签;删除或者保留标签内的内容;
使用方法:strip_html_tags($tags,$str,$content);
$tags:需要删除的标签(数组格式)
$str:需要处理的字符串;
$ontent:是否删除标签内的内容 0保留内容 1不保留内容
/**
* 删除指定标签
*
* @param array $tags 删除的标签 数组形式
* @param string $str html字符串
* @param bool $content true保留标签的内容text
* @return mixed
*/
function stripHtmlTags($tags, $str, $content = true)
{
$html = [];
// 是否保留标签内的text字符
if($content){
foreach ($tags as $tag) {
$html[] = '/(<' . $tag . '.*?>(.|\n)*?<\/' . $tag . '>)/is';
}
}else{
foreach ($tags as $tag) {
$html[] = "/(<(?:\/" . $tag . "|" . $tag . ")[^>]*>)/is";
}
}
$data = preg_replace($html, '', $str);
return $data;
}
//输出<div><p>这里是p标签</p><img src="" alt="这里是img标签"><br></div>;
前面扯了那么多;
其实最后这个函数才是干货;
一口气搞定各种标签删除的疑难杂症不费劲;
别看下面这张截图了;
无非带点颜色好看;
我主要是拿来凑图当文章封面的;
本文为白俊遥原创文章,转载无需和我联系,但请注明来自白俊遥博客https://baijunyao.com 欢迎捐赠赞赏加入组织创建QQ群及捐赠渠道
Lee :
2018-11-14 15:32:42 回复
风清扬 :
2018-11-14 15:34:36 回复
爱拼才会赢 :白教主 你好 谢谢你的blog模板 http://studys.top/ 本网底部有你的连接 辛苦了
2018-06-15 23:25:13 回复
吴伟祥 :至此,全部看完!修成正果!现在去下载一个tp3.2.3跟模版来开工 了!
2017-01-07 16:05:15 回复
Tekin :老兄,你这个函数这样写会不会更好一些? function strip_html_tags($tags,$str,$is_hold=false){ $html=array(); foreach ($tags as $tag) { if($is_hold){ $html[]='/([\s|\S]*?)/'; }else{ $html[]="/(]*>)/i"; } } $data=preg_replace($html, '', $str); return $data; }
2016-12-07 09:39:39 回复
云淡风晴 :多谢优化;已更改;
2016-12-11 22:16:51 回复
丑小鸭_2012 :这个好
2016-11-07 16:27:39 回复
′ Soulmate :好像只有第一个和第四个与你的输出相同,其它两个运行都是空唉
2016-10-27 21:24:49 回复
云淡风晴 :好吧return 被我吃了;对我当年没有严谨的检查表示惭愧;已经加上了;多谢反馈;
2016-10-28 00:10:06 回复
花无不缺你一个 :请教:例子3 好像有点问题 无法 删除 这种自闭合标签吧 另外 有的网站 写成 都无法正常匹配的
2016-10-09 14:18:23 回复
云淡风晴 :已纠正;多谢反馈;
2016-10-11 23:21:13 回复
南城阿牛 :大哥,我安装了你的博客项目,发现后台登陆界面验证码图裂了,firebug显示载入指定url失败,我看了路径是这样的:http://api.share.baidu.com/s.gif?l=http://localhost/index.php/Admin/Login/login
2016-07-12 14:33:48 回复
云淡风晴 :你的php没有开启gd库吧?而且正常的验证码图片路径应该是这样的:/index.php/Admin/Login/showVerify
2016-07-12 14:41:45 回复
南城阿牛 :解决了,刚才我贴错了,其实/index.php/Admin/Login/showVerify这个路径是对的,我刚才是用的php5.6版本,现在切换成5.5了就可以正常显示了
2016-07-12 14:50:56 回复
{"name":"路人黄"} :请先登陆后回复评论
2016-09-20 15:04:44 回复
一见之如平生欢 :是登陆页面编码带bom的原因 LoginController.class.php BOM found, automatically removed可以看见这篇文章 http://www.thinkphp.cn/topic/9753.html
2016-09-24 15:11:33 回复
最新评论