【发布时间】:2010-11-29 22:27:03
【问题描述】:
我需要人们常用名字的列表,例如“Bill”、“Gordon”、“Jane”等。是否有许多已知名字的免费列表,而不是我必须输入它们?例如,我可以用程序轻松解析以填充数组的东西?
我不担心:
- 知道一个名字是男性还是女性(或两者兼有)
- 如果数据集有一大堆误报
- 如果上面没有名字,显然没有这样的数据集是完整的。
- 如果有“重复”,即我不在乎数据集是否将“Bill”、“William”和“Billy”列为不同的名称。我宁愿拥有更多的数据而不是更少的数据
- 我不在乎知道这个名字的受欢迎程度
我知道Wikipedia 有一个list of most popular given names,但这都是在一个HTML 页面中,并且使用了可怕的wiki 语法。有没有更好的方法来获取一些这样的示例数据,而无需筛选维基百科?
【问题讨论】:
标签: dataset