[正则表达式] 可以解析HTML/XHTML页面的所有元素和结构的Regular Expression！ - Laser.NET

公告

[正则表达式] 可以解析HTML/XHTML页面的所有元素和结构的Regular Expression！

哈哈，继昨天的那个正则表达式之后又写了一个更长的Regular Expression，全长527，是用于查找出所有的XHTML/HTML的标记外面的所有空格，并将之转换为 的。希望这个能够解决dudu提的一个cnblogs的bug：）即使不能解决问题也算是对System.Text.RegularExpression.Regex的一个练笔了：）

(?:(?:\<(?:Style)(?:\s+(?:[\w-]+)(?:=(?:[^\s\>\<]*|\"[\s\S]*?\"|\'[\s\S]*?\'))?)*\s*(?:/)?\>)(?:[\s\S]*?)(?:\</(?:Style)\>))|(?:(?:\<(?:script)(?:\s+(?:[\w-]+)(?:=(?:[^\s\>\<]*|\"[\s\S]*?\"|\'[\s\S]*?\'))?)*\s*(?:/)?\>)(?:[\s\S]*?)(?:\</(?:script)\>))|(?:\<!(?:[\w-]+)(?:\s+(?:[\w-]+|\"[\s\S]*?\"|\'[\s\S]*?\'))*\s*\>)|(?:\<!--[\s\S]*?--\>)|(?:\<(?:[\w-]+)(?:\s+(?:[\w-]+)(?:=(?:[^\s\>\<]*|\"[\s\S]*?\"|\'[\s\S]*?\'))?)*\s*(?:/)?\>)|(?:\</(?:[\w-]+)\>)|(?:\<!\[CDATA\[(?:[\s\S]*?)\]\]\>)|(?:(?:(?<blank>[ ]+)|[^ \<\>])+)

这个正则表达式虽然很长，但可不是我用手code出来的哦，是我写的程序产生的，代码如下：）

public static string ReplaceSpace(string content)

{

string tag = @"(?:[\w-:]+)";

string attribute = @"(?:[\w-:]+)(?:=(?:[^\s\>\<]*|\""[\s\S]*?\""|\'[\s\S]*?\'))?";

string name = @"(?:[\w-:]+)";

string argument = @"(?:[\w-:]+|\""[\s\S]*?\""|\'[\s\S]*?\')";

string beginningTag = @"(?:\<" + tag + @"(?:\s+" +attribute + @")*\s*(?:/)?\>)";

string endingTag = @"(?:\</" + tag + @"\>)";

string xmlComment = @"(?:\<!--[\s\S]*?--\>)";

string xmlDirective = @"(?:\<!" +name + @"(?:\s+" +argument + @")*\s*\>)";

string xmlCData = @"(?:\<!\[CDATA\[(?:[\s\S]*?)\]\]\>)";

string styleBlock = @"(?:(?:\<(?:Style)(?:\s+" +attribute + @")*\s*(?:/)?\>)(?:[\s\S]*?)(?:\</(?:Style)\>))";

string scriptBlock = @"(?:(?:\<(?:script)(?:\s+" +attribute + @")*\s*(?:/)?\>)(?:[\s\S]*?)(?:\</(?:script)\>))";

string xmlLiteral = @"(?:(?:(?<blank>[ ]+)|[^ \<\>])+)";

Regex r = new Regex(pattern, RegexOptions.IgnoreCase | RegexOptions.Compiled);

MatchCollection mc = r.Matches(content);

StringBuilder sb = new StringBuilder(content.Length + 1024);

foreach (Match m in mc)

{

if (m.Groups["blank"].Captures.Count > 0)

{

sb.Append(m.Value.Replace(" ", " "));

}

else

{

sb.Append(m.Value);

}

return sb.ToString();

}

最后，再给个更长的（全长765）正则表达式，这个算是我写的最长的正则表达式了。其实上面给出的第一个Regex是下面这个的一个专用于捕获blank的简化版本。
虽然长，但很有用，可以解析出整个XHTML/HTML页面的所有元素和结构来：）解析后的内容都分别保存在named groups中了，可以通过match.Groups["name"];来提取，比如match.Groups["tag"];match.Groups["attribute"];match.Groups["Style_Block";match.Groups["XML_Comment"];等，感兴趣的不妨试一试就知道了：）

(?#Copyright 2005, by Laser Lu.)(?<Style_Block>(?<begin>\<(?<tag>style)(?:\s+(?<attribute>[\w-:]+)(?:=(?<value>[^\s\>\<]*|\"[\s\S]*?\"|\'[\s\S]*?\'))?)*\s*(?:/)?\>)(?<body>[\s\S]*?)(?<end>\</\k<tag>\>))|(?<Script_Block>(?<begin>\<(?<tag>script)(?:\s+(?<attribute>[\w-:]+)(?:=(?<value>[^\s\>\<]*|\"[\s\S]*?\"|\'[\s\S]*?\'))?)*\s*(?:/)?\>)(?<body>[\s\S]*?)(?<end>\</\k<tag>\>))|(?<XML_Directive>\<!(?<name>[\w-:]+)(?:\s+(?<argument>[\w-:]+|\"[\s\S]*?\"|\'[\s\S]*?\'))*\s*\>)|(?<XML_Comment>\，<!XML指令>，<![CDATA[ ... ]]>，标记或指令的标识符支持[a-zA-Z0-9_-:]；
3。支持name=value和单独一个name的attribute，能够识别出""或''包括的属性值；
4。针对<style></style>和<script></script>标记包含的内容进行特殊处理，也就是所有的CSS和Script代码将原封不动的作为整体捕获。

posted on 2005-04-21 12:16 Laser.NET 阅读(14472) 评论(41) 收藏举报

刷新页面返回顶部