【发布时间】:2020-08-09 11:01:29
【问题描述】:
我一直在尝试从某个网站抓取一些数据,但我的代码似乎没有按预期运行。它只是没有让我获得 html 页面。
public Scraper()
{
BGWorker.DoWork += GetHtml;
BGWorker.RunWorkerAsync();
}
static void GetHtml(object sender, DoWorkEventArgs e)
{
System.Threading.Thread.Sleep(1);
Console.WriteLine("Downloading Data...");
ScrapingBrowser _ScrapingBrowser = new ScrapingBrowser();
WebPage webPage = _ScrapingBrowser.NavigateToPage(new Uri("https://www.goodwebsite.com"));
Console.WriteLine(webPage.Html);
Console.WriteLine("Got the Data");
}
【问题讨论】:
-
那是带给你什么?根据您的问题,恐怕我们真的无话可说
-
您看到任何消息了吗?有什么错误吗?
-
只是一个建议;我会使用另一个库 (github.com/hardkoded/puppeteer-sharp) 来进行网络抓取或 Selenium。它简单、通用、最新并且有大量示例。还有大量的 Selenium 示例和文章。
-
你使用的是来自scrapysharp:github.com/rflechner/ScrapySharp的
ScrapingBrowser吗? -
https://www.goodwebsite.com似乎已经死了,它重定向到park.above.com或ww38.qfind.net。您是否要抓取这些网站?或者你想抓取https://www.goodwebsite.com,这似乎是一个存根?另外,您能否明确说明您使用的ScrapingBrowser来自哪个 nuget 或其他库?
标签: c# web screen-scraping