【问题标题】:Retrieving and parsing data from mywebsearch (search engine)从 mywebsearch(搜索引擎)检索和解析数据
【发布时间】:2018-09-14 22:33:06
【问题描述】:

我一直在尝试制作一个允许我输入关键字并让它自动执行此操作的工具:

int.search.mywebsearch.com/mywebsearch/GGweb.jhtml?searchfor=Keyword

然后,抓取页面上的所有 URL。

但是,当我转到 regexxr 或 regex101 时,似乎 url 不存在,我无法使用正则表达式来获取它。如何使用WebClient.downloadstring(url) 抓取无法下载的内容?

代码:

WebClient wc = new WebClient();
foreach(string s in Keywords)
{
    string url = wc.DownloadString("https://int.search.mywebsearch.com/mywebsearch/GGmain.jhtml?&searchfor=" + s);
    MatchCollection mc = Regex.Matches(url, @""); // Didn't write any regex yet
}

【问题讨论】:

  • 你是说你无法找出从 HTML 中获取 URL 的正则表达式吗?
  • 可以,其他搜索引擎一切正常,不知道为什么这个引擎不行
  • 我不清楚你说的什么不起作用。您的问题显示您正在下载搜索结果。您是说下载不起作用还是您正在下载但找不到 URL?如果这些都不起作用,预期与实际的行为是什么?

标签: c# .net webclient


【解决方案1】:

使用这个正则表达式:

<a[^>]+href\s?=\s?"([^"]+)"[^>]?>

工作DEMO

【讨论】:

    猜你喜欢
    • 1970-01-01
    • 1970-01-01
    • 2011-10-15
    • 2011-06-06
    • 2017-07-23
    • 1970-01-01
    • 1970-01-01
    • 2023-03-21
    • 2012-01-31
    相关资源
    最近更新 更多