【发布时间】:2014-11-03 15:24:26
【问题描述】:
我想编写一个应用程序,搜索 Google 的 Ngram 数据,以返回过去比现在更流行的单词和短语,在任意年份范围内,以任意百分比计算。
理想情况下,我希望能够找到这些单词和短语,而无需预先指定它们。谁能帮我想出一种方法来使用下载的 Ngrams 数据副本?
【问题讨论】:
标签: google-api n-gram
我想编写一个应用程序,搜索 Google 的 Ngram 数据,以返回过去比现在更流行的单词和短语,在任意年份范围内,以任意百分比计算。
理想情况下,我希望能够找到这些单词和短语,而无需预先指定它们。谁能帮我想出一种方法来使用下载的 Ngrams 数据副本?
【问题讨论】:
标签: google-api n-gram
下载一些 n-gram 后的第一步是将它们转储到 SQLite3 database。例如,我获取了1-grams starting with the letter 't'
要将它们转储到 SQLite,请运行命令 sqlite3 1grams.db
sqlite> create table t1grams (ngram text, year integer, match_count integer, volume_count integer);
sqlite> .separator "\t"
sqlite> .import googlebooks-eng-all-1gram-20120701-t t1grams
第二步是选择年份范围,称它们为YEAR_START 和YEAR_END,以及你的百分比,称它为PERCENT_THRESHOLD。
您的问题归结为一个查询,您选择那些ngrams 使得match_count 在YEAR_END 比YEAR_START 少PERCENT_THRESHOLD%。
【讨论】: