【问题标题】:Plain, computer parseable lists of common first names?普通的、计算机可解析的常见名字列表?
【发布时间】:2010-11-29 22:27:03
【问题描述】:

我需要人们常用名字的列表,例如“Bill”、“Gordon”、“Jane”等。是否有许多已知名字的免费列表,而不是我必须输入它们?例如,我可以用程序轻松解析以填充数组的东西?

我不担心:

  • 知道一个名字是男性还是女性(或两者兼有)
  • 如果数据集有一大堆误报
  • 如果上面没有名字,显然没有这样的数据集是完整的。
  • 如果有“重复”,即我不在乎数据集是否将“Bill”、“William”和“Billy”列为不同的名称。我宁愿拥有更多的数据而不是更少的数据
  • 我不在乎知道这个名字的受欢迎程度

我知道Wikipedia 有一个list of most popular given names,但这都是在一个HTML 页面中,并且使用了可怕的wiki 语法。有没有更好的方法来获取一些这样的示例数据,而无需筛选维基百科?

【问题讨论】:

    标签: dataset


    【解决方案1】:

    我想这应该足以让你开始了。

    【讨论】:

      【解决方案2】:

      Social Security Administration - Beyond the Top 1000 Names Data Files

      以上是美国使用的名字的完整列表。 zip 文件包含按出生年份的 CSV 格式的国家和州级数据。它包括出现次数(最少 5 次)和性别。例如,2010 年的国家档案包括 33,838 个婴儿名字。

      【讨论】:

        【解决方案3】:

        您可以轻松地使用 Wikipedia API (http://en.wikipedia.org/w/api.php) 来检索特定类别中的页面列表,看起来像 Category:Given names 是您想要开始的东西。

        http://en.wikipedia.org/w/api.php?action=query&list=categorymembers&cmnamespace=0&cmlimit=500&cmtitle=Category:Given_names
        

        此 URL 的部分结果如下所示:

          <cm pageid="5797824" ns="0" title="Abdou" />
          <cm pageid="5797863" ns="0" title="Abdu" />
          <cm pageid="859035" ns="0" title="Abdul Aziz" />
          <cm pageid="6504818" ns="0" title="Abdul Qadir" />
        

        查看API并选择合适的格式和查询参数,以及校验类别。

        附: 顺便说一句,您链接到的页面中的 wiki 文本包含使用正则表达式易于提取的形式的名称......以及呈现的 HTML 页面中的链接标题已附加 “(name)”到名称本身。

        【讨论】:

        • 查询中的 cmlimit i>选项最大(500)允许未经授权的用户,并且可以将其上升到5000项。无论如何,使用 cmcontinue i>选项来检索块的所有结果块... span>
        猜你喜欢
        • 1970-01-01
        • 1970-01-01
        • 2021-04-21
        • 2015-02-18
        • 2021-12-04
        • 1970-01-01
        • 1970-01-01
        • 1970-01-01
        • 1970-01-01
        相关资源
        最近更新 更多