总结php删除html标签和标签内的内容的方法


经常扒别人网站文章的坑们;我是指那种批量式采集的压根不看内容的,少不了都会用到删除html标签的函数;这里介绍3种不同用途上的方法;

$str='<div><p>这里是p标签</p><img src="" alt="这里是img标签"><a href="">这里是a标签</a><br></div>';

1:删除全部或者保留指定html标签

    php自带的函数strip_tags即可满足要求,

    使用方法:strip_tags(string,allow);

              string:需要处理的字符串;

              allow:需要保留的指定标签,可以写多个;

echo strip_tags($str,'<p><a>');
       
//输出:<p>这里是p标签</p><a href="">这里是a标签</a>

    此函数的优点是简单粗暴,但是缺点也很明显;如果有一大堆标签;而我只是想删除指定的某一个;那要写很多需要保留的标签;        所以有了第二个方法;

2:删除指定的html标签

    使用方法:strip_html_tags($tags,$str);

              $tags:需要删除的标签(数组格式)

              $str:需要处理的字符串;

    function strip_html_tags($tags,$str){ 
        $html=array();
        foreach ($tags as $tag) {
            $html[]="/(<(?:\/".$tag."|".$tag.")[^>]*>)/i";
        }
        $data=preg_replace($html, '', $str); 
        return $data;
    } 
    echo strip_html_tags(array('p','img'),$str);
   //输出:<div>这里是p标签<a href="">这里是a标签</a><br></div>;

3:删除标签和标签的内容

    使用方法:strip_html_tags($tags,$str);

              $tags:需要删除的标签(数组格式)

              $str:需要处理的字符串;

function strip_html_tags($tags,$str){ 
    $html=array();
    foreach ($tags as $tag) {
        $html[]='/<'.$tag.'.*?>[\s|\S]*?<\/'.$tag.'>/';
        $html[]='/<'.$tag.'.*?>/';
    }
    $data=preg_replace($html,'',$str);
    return $data;
} 
echo strip_html_tags(array('a','img'),$str);
//输出<div><p>这里是p标签</p><br></div>

    很多网站文章里面会带上网站名和链接,比如<a href="http://www.baijunyao.com">白俊遥博客</a>;这个函数就是专治这种; 别拿这个函数采集本站啊;不然保证不打死你;

4:终极函数,删除指定标签;删除或者保留标签内的内容;

    使用方法:strip_html_tags($tags,$str,$content);

              $tags:需要删除的标签(数组格式)

              $str:需要处理的字符串;

              $ontent:是否删除标签内的内容 0保留内容 1不保留内容

    /**
     * 删除指定的标签和内容
     * @param array  $tags 需要删除的标签数组
     * @param string $str 数据源
     * @param boole  $content 是否删除标签内的内容 默认为false保留内容  true不保留内容
     * @return string
     */
    function strip_html_tags($tags,$str,$content=false){
        if($content){
            $html=array();
            foreach ($tags as $tag) {
                $html[]='/(<'.$tag.'.*?>[\s|\S]*?<\/'.$tag.'>)/';
            }
            $data=preg_replace($html,'',$str);
        }else{
            $html=array();
            foreach ($tags as $tag) {
                $html[]="/(<(?:\/".$tag."|".$tag.")[^>]*>)/i";
            }
            $data=preg_replace($html, '', $str);
        }
        return $data;
    }
    echo strip_html_tags(array('a'),$str,1);
   //输出<div><p>这里是p标签</p><img src="" alt="这里是img标签"><br></div>;


前面扯了那么多;其实最后这个函数才是干货;一口气搞定各种标签删除的疑难杂症不费劲;

别看下面这张截图了;无非带点颜色好看,我主要是拿来凑图当文章封面的;

白俊遥博客


白俊遥博客
请先登陆后发表评论
  • 最新评论
  • 总共5条评论
白俊遥博客

Tekin:老兄,你这个函数这样写会不会更好一些? function strip_html_tags($tags,$str,$is_hold=false){        $html=array();        foreach ($tags as $tag) {                if($is_hold){                $html[]='/(<'.$tag.'.*?>[\s|\S]*?<\/'.$tag.'>)/';                 }else{                    $html[]="/(<(?:\/".$tag."|".$tag.")[^>]*>)/i";                 }            }        $data=preg_replace($html, '', $str);        return $data;    }

2016-12-07 09:39:39 回复

白俊遥博客

丑小鸭_2012:这个好

2016-11-07 16:27:39 回复

白俊遥博客

′ Soulmate:好像只有第一个和第四个与你的输出相同,其它两个运行都是空唉

2016-10-27 21:24:49 回复

白俊遥博客
  • 云淡风晴 回复 ′ Soulmate:好吧return 被我吃了;对我当年没有严谨的检查表示惭愧;已经加上了;多谢反馈;
  • 2016-10-28 00:10:06 回复
白俊遥博客

花无不缺你一个:请教:例子3 好像有点问题 无法 删除 <img src="" > 这种自闭合标签吧 另外 有的网站 写成<img src="" /> 都无法正常匹配的

2016-10-09 14:18:23 回复

白俊遥博客
  • 云淡风晴 回复 花无不缺你一个:已纠正;多谢反馈;
  • 2016-10-11 23:21:13 回复
白俊遥博客

南城阿牛:大哥,我安装了你的博客项目,发现后台登陆界面验证码图裂了,firebug显示载入指定url失败,我看了路径是这样的:http://api.share.baidu.com/s.gif?l=http://localhost/index.php/Admin/Login/login

2016-07-12 14:33:48 回复

白俊遥博客
  • 云淡风晴 回复 南城阿牛:你的php没有开启gd库吧?而且正常的验证码图片路径应该是这样的:/index.php/Admin/Login/showVerify
  • 2016-07-12 14:41:45 回复
白俊遥博客
  • 南城阿牛 回复 云淡风晴:解决了,刚才我贴错了,其实/index.php/Admin/Login/showVerify这个路径是对的,我刚才是用的php5.6版本,现在切换成5.5了就可以正常显示了
  • 2016-07-12 14:50:56 回复
白俊遥博客
  • {"name":"路人黄"} 回复 南城阿牛:请先登陆后回复评论
  • 2016-09-20 15:04:44 回复
白俊遥博客
  • 一见之如平生欢 回复 南城阿牛:是登陆页面编码带bom的原因 LoginController.class.php BOM found, automatically removed可以看见这篇文章 http://www.thinkphp.cn/topic/9753.html
  • 2016-09-24 15:11:33 回复