【发布时间】:2015-05-14 16:54:05
【问题描述】:
我需要从 html 文档中检索一些信息,因为获取 json 或 xml 的 Web 服务还没有准备好。我正在使用 c# 并使用正则表达式从 html 字符串中获取我需要的数据。我已经设法从整个 html 字符串中获取我想要使用的 div,但现在我无法获取第一个 span 标签之间的信息。 我试图检索 ; 之间的数据和第一个结束跨度标签,但我真正想要的是第一个跨度标签之间的内容。
这是我到目前为止写的正则表达式,但它不起作用:
".*;(?<Content>(\r|\n|.)*)</span>"
我也试过了,但也没有用:
"<span class=""type"">(?<Content>(\r|\n|.)*)</span>"
这是我要从中检索数据的 div:
<div class="main">ABASASDFÓ 18/06/2014 17:38h Blabla Balbal <span class="type">15.80€ </span>+1.94 % +0.30€ | HOME <SPAN class="type2">11,398.70</span> +0.65 % +74.10</div>
编辑:我不能使用 Htmlagilitypack,因为我的客户不希望我们使用任何外部库。我也听说过使用 XmlReader,但我不确定 html 的结构是否会相应地匹配 xml。
【问题讨论】:
-
正则表达式和 HTML? Hm。无论如何,你的括号不匹配。
-
大声笑,对不起,伙计。我有点困。我更新了我的正则表达式,但问题始终如一-.-仍然无法正常工作:(
-
与论坛网站不同,我们不使用“谢谢”、“感谢任何帮助”或Stack Overflow 上的签名。请参阅“Should 'Hi', 'thanks,' taglines, and salutations be removed from posts?。顺便说一句,这是“提前致谢”,而不是“致谢”。
标签: c# html regex xml-parsing