【发布时间】:2013-08-27 16:07:10
【问题描述】:
我一直在网上搜索,发现 CNN 和 NPR 等媒体提供了访问其成绩单的链接。要获得它们需要编写一些不太方便的爬虫之类的东西。原因是我试图在我的自然语言处理项目中使用一些电视节目、采访、广播、电影的成绩单作为训练数据。所以我想知道网络上是否有任何免费的集合或数据库,以便我可以一次下载所有这些,而无需自己编写爬虫?
【问题讨论】:
-
嗨,开尔文!请让我们知道您已经完成了什么样的研究。另外,请注意这里 (stackoverflow.com/help/dont-ask) 允许提出一些主观问题,但他们应该“邀请分享经验而不是意见”和“坚持以事实和参考资料支持意见”另请参阅此处的指南 #1 ( blog.stackoverflow.com/2010/09/good-subjective-bad-subjective) 征求建议。我礼貌地不同意@ThomasJungblut,因为这不是征求建议的地方。它应该只是以一种知情和信息丰富的方式。
-
@ThomasJungblut 那么您如何看待这些问题:stackoverflow.com/questions/3340810/… stackoverflow.com/questions/4251768/twitter-public-dataset 与其试图在这里放置无用和消极的 cmets,不如专注于帮助人们完成有用的事情。
-
@ThomasJungblut 有很多关于 SO 的 NLP 相关主题,拥有一个好的语料库是开发过程的重要组成部分。问题不在于推荐“最佳”语料库,而在于找到适合您任务的语料库 - 没有主观性。
标签: machine-learning nlp speech-recognition