【问题标题】:How to get a clean YouTube transcript如何获得干净的 YouTube 成绩单
【发布时间】:2019-02-12 10:29:33
【问题描述】:

我正在尝试获取视频字幕数据,因为我正在使用 downsub。

如果不将其带到记事本并根据需要执行替换过程,我无法想出获得干净的字幕,没有 HTML 标记和时间戳。

这很麻烦,我想使用 python 自动化清理过程。

https://colab.research.google.com/drive/1bbgbjbGF9bjzz3FISMfycSW4iHCj3pxk

我正在寻找一个非常简单的解决方案,任何人只要具备 Python 的基本知识就可以理解。如果需要,我愿意使用 API,但如果这需要很长时间,如果快速完成手动清洁仍然只需要几分钟。不过自动化会很好;会减轻头痛。考虑到这一点,请提出一个好的解决方案。

【问题讨论】:

  • 如果它足够简单,您可以手动替换记事本中的 html 内容,您是否可以自动进行替换?比如html_string.replace('<div>', ''))
  • 顺便说一句,链接需要访问权限
  • @Zulfiqaar:谢谢,我更新了分享:colab.research.google.com/drive/…
  • 如何获得干净的 youtube 成绩单? “获取 youtube 成绩单,然后清理它”。如何清理 youtube 成绩单?是html吗?使用 html 解析器。例如美丽汤。它是需要简单替换的非常简单的文本吗?好吧,编写进行替换的代码。 “请替我做?”我们不能。
  • @ParitoshSingh 解析器,已注明。

标签: python youtube timestamp data-cleaning subtitle


【解决方案1】:

已经对替换进行了一些更改,但应该这样做:

import requests

down_url = "https://downsub.com/index.php?title=5+Am+Club+by+Robin+Sharma+%7C%7C+Review%2C+Takeaways+and+Discussion&url=ujcNaH9TaDy8U56iM_1ZReCKk1h83rjIvE7i146GYHUNIwZwKM02q9oUSieWkZ47Tw2OOJgFBvlU0he-sxkGIASxRnTcdMwE1QrZ3CAsyI5gLS6A0ovxFMmFJx5EAC5wtwexy0R1vzZfNdt6dBse3H-vOhq8xnqL-LdhSbiePZ5E_KEYrYuFzPvF2JpEARuCOA6XlqQQzV7iooSEObb9AejBkNj_uHhNnO0RVJ0E-pVAJjWLdjUnIdXGPkJUsd5Ceg5qeTVKjtBQhWyf6qCuwE_BAezDSDAF6DgLCFRnwc2Uc9onnorwYncvzIge1soln3FnkifpyHiPB3cK0h0f5yMUy-DJHervcQXQEHdUf-npkCzRgeba283yoN7orAovE0iaIihvFMectGYKT27eXLdrLdQQ3sUcWFqRB6SjZ8g"

data = requests.get(down_url).text


clean = ['<font color="#CCCCCC">',
         '<font color="#E5E5E5">',
         '<font color="#EEE">',
         '</font>',
         0,1,2,3,4,5,6,7,8,9,
         '::, --> ::,',]


for s in clean:
    data = data.replace(str(s), '')

data = data.replace('\n\n\n\n', '\n')

print(data)

【讨论】:

  • 这工作:) 谢谢。我已经更新了笔记本。
  • 没问题 - 这是我第一次听说 downsub,以后可能对我也有用!
猜你喜欢
  • 1970-01-01
  • 2019-09-27
  • 2016-09-09
  • 2021-12-04
  • 2012-11-27
  • 1970-01-01
  • 2020-12-16
  • 2010-11-05
  • 1970-01-01
相关资源
最近更新 更多