萬盛學電腦網

浏覽器 windows 10 wps office 殺毒軟件 數據庫 excel教程 文件管理 word教程 網頁制作 裝機必備軟件 linux教程

萬盛學電腦網 >> 網頁制作 >> 腳本Html教程 >> 正則表達式刪除指定的HTML 標簽

正則表達式刪除指定的HTML 標簽

抓取某網頁的數據後(比如描述),如果照原樣顯示的話,可能會因為它裡面包含沒有閉合的HTML標簽而打亂了格式,也可能它裡面用了比較讓人 "費解" 的HTML標簽,把預訂的格式攪亂. 如果全盤刪除裡面的 HTML 標簽,可能會造成閱讀上的困難(比如 a, img 這些標簽), 最好是刪除一部分,保留一部分.

　　正則表達式裡,判斷包含某些字符串是非常容易理解的,但是如何判斷不包含某些字符串 (是字符串,不是字符,是某些,不是某個) 確實是個費解的事.

　　<(?!((/?s?li)|(/?s?ul)|(/?s?a)|(/?s?img)|(/?s?br)|(/?s?span)|(/?s?b)))[^>]+>

　　這個正則是判斷HTML標簽不包含 li / ul / a / img / br / span / b 的,就上面的要求來說,是要刪除除這裡列出的HTML標簽,這也是我摸索了很長時間才搞出來的.

　　(?!exp) 匹配後面跟的不是exp的位置

　　/?s? 我一開始試著把它寫到最前面的 < 後面,但是測試失敗了.

　　下面是一個簡單的函數,把要保留的TAG串起來,生成一個正則表達式,然後把不需要的TAG刪除...

　　private static string RemoveSpecifyHtml(string ctx) {

　　string[] holdTags = { "a", "img", "br", "strong", "b", "span" };//要保留的 tag

　　// <(?!((/?s?li)|(/?s?ul)|(/?s?a)|(/?s?img)|(/?s?br)|(/?s?span)|(/?s?b)))[^>]+>

　　string regStr = string.Format(@"<(?!((/?s?{0})))[^>]+>", string.Join(@")|(/?s?", holdTags));

　　Regex reg = new Regex(regStr, RegexOptions.Compiled | RegexOptions.Multiline | RegexOptions.IgnoreCase);

　　return reg.Replace(ctx, "");

　　}

　　----------------------------

　　修正:

　　上面的正則,如果保留了 li , 實際運行會發現 link 也給保留下來了, 保留 a 會把 addr 也給保留下來, 解決辦法就是加 b 斷言.

　　<(?!((/?s?lib)|(/?s?ul)|(/?s?ab)|(/?s?imgb)|(/?s?brb)|(/?s?spanb)|(/?s?bb)))[^>]+>

　　private static string RemoveSpecifyHtml(string ctx) {

　　string[] holdTags = { "a", "img", "br", "strong", "b", "span", "li" };//保留的 tag

　　string regStr = string.Format(@"<(?!((/?s?{0})))[^>]+>", string.Join(@"b)|(/?s?", holdTags));

　　Regex reg = new Regex(regStr, RegexOptions.Compiled | RegexOptions.Multiline | RegexOptions.IgnoreCase);

　　return reg.Replace(ctx, "");

　　}

上一頁:html 可輸入下拉菜單的實現方法
下一頁:html文件打開出錯怎麼辦

萬盛學電腦網

萬盛學電腦網 >> 網頁制作 >> 腳本Html教程 >> 正則表達式刪除指定的HTML 標簽

正則表達式刪除指定的HTML 標簽

腳本Html教程排行

程序編程推薦

熱門文章

相關文章

圖片文章

如何做好一個網站Banner？

FACEBOOK產品總監：聊聊資深設計師經歷過的瓶頸期

Android 桌面Widget開發要點解析(時間日期Widget)

增強iOS應用程序性能的技巧

萬盛學電腦網 | 設為首頁 | 加入收藏