【问题标题】:Parse text from website without class and id从没有类和 id 的网站解析文本
【发布时间】:2020-08-20 14:11:01
【问题描述】:

我可以解析网站,如果它缺少类和 id。 xpath 也不起作用,或者我做错了什么。 我想获取有关游戏的信息 - 系统要求、数据和其他信息。我怎样才能做到这一点,使输出看起来像在描述中?

我的完整代码 - https://github.com/FreedomEssence/Torrent-Ighruha_Parser/blob/master/__init__.py

【问题讨论】:

  • 请将链接发布到您要抓取的网站。我们不是魔术师
  • @Chase,你可以在他的github代码中找到

标签: python parsing beautifulsoup lxml


【解决方案1】:

您可以使用 css 选择器#dle-content > div:nth-child(3) 来定位此元素。

divtext = soup.select('#dle-content > div:nth-child(3)')[0].text

输出-

'\nДата обновления: 2019Жанр: Action, Tank, 3D, Online-onlyРазработчик: Wargaming.netИздательство в России: Wargaming.netТип издания: ЛицензияЯзык интерфейса: РусскийЯзык озвучки: РусскийТаблетка: Не требуетсяСистемные требования:Операционная система:  XP / Vista / 7 / 8 / 10Процессор: Pentium 4 2,4 GHzОперативная память: 4 ГбВидеокарта: 512 Mb - 1024 Mb / nVIDIA / ATI Radeon®Звуковая карта: Звуковое устройство DirectX® 9.0сСвободное место на жестком диске: 16 Гб\n \n\n   \n\n\n'

【讨论】:

  • 还有一个问题)我怎样才能将这个...文本排序到正常视图中?
  • @FreedomEssence 您可以使用正则表达式来解析结果文本并提取您需要的信息。我自己会在回答中这样做,但我既不懂语言,也不知道您要提取哪些确切的片段。
猜你喜欢
  • 1970-01-01
  • 2012-02-12
  • 1970-01-01
  • 1970-01-01
  • 1970-01-01
  • 2016-07-18
  • 1970-01-01
  • 2016-01-19
  • 2017-04-03
相关资源
最近更新 更多