【发布时间】:2018-12-18 06:06:19
【问题描述】:
我想从页面中提取单独的内容描述,我可以使用 attribute 中指定的 class 或 id 来完成。但是.. 如果在 html tag 中没有指定 class 或 id 属性,我不知道如何获取元素。
喜欢这个截图:
<div class="cat_box_desc">
<h3>Status:</h3>
on-going <br>
<h3>Genres:</h3>
<br>
<h3>Description:</h3>
<div align="justify">
<p> Information</p>
<p>Type: TV</p>
<p>Episodes: Unknown</p>
<p>Status: Currently Airing</p>
<p>Aired: Oct 7, 2013 to ?</p>
<p>Producers: Sunrise, TV Tokyo, Sotsu Agency</p>
<p>Genres: Mecha</p>
<p>Duration: 25 min. per episode</p>
<p>Synopsis:</p>
<p>Gundam Build Fighter adalah sebuah pertarungan simulasi Gundam. Unit Gundam dirangkai dari model plastiknya. Tokoh utamanya adalah seorang anak laki-laki yang bernama Iori Sei. Sei memiliki kemampuan merangkai Gundam yang hebat, namun dia tak
memiliki kemampuan untuk mengendalikan gundam yang ia rangkai saat melakukan Gunpla Battle. Namun satu hari dia bertemu dengan seorang pencuri roti misterius, yang memberinya sebuah batu permata.</p>
</div><br>
<div style="padding-left: 560px; padding-bottom:20px;" class="spacebook">
<div class="fb-like" data-href="http://animeindo.video/category/gundam-build-fighter/" data-width="450" data-layout="box_count" data-show-faces="false" data-send="false"></div>
</div>
</div>
我可以在class="cat_box_desc"里面抓取数据,但是我会得到里面的所有数据,我不想要它,我想分离数据。
我不知道像上面截图那样分开数据有status、genre、description、information 和 H1 和 P 标签中的其他内容,因为上面没有指定 class 或 id。
那么如何在 Beautifulsoup4.. 中做到这一点呢?
【问题讨论】:
标签: python web-scraping beautifulsoup