【问题标题】:Classify pdf files upon their name根据名称对 pdf 文件进行分类
【发布时间】:2015-08-29 00:23:49
【问题描述】:

我有 pdf 文件列表(它们的名称),例如

  1. Financial_Statement_Q1_2015_En 属于季度报告。
  2. Financial_Statement_Yealy_2015 属于非季度报告。

我需要根据季度报告和非季度报告对 pdf 的名称进行分类。 请告诉我方法,我怎样才能使用适当的工具来完成这项任务。

【问题讨论】:

  • 你知道哪些语言,如果你使用约定,你可以通过解析文件名来实现几乎所有语言
  • 我知道 c++,java,php。
  • @johnny ,我需要训练数据集吗??
  • Java 可能更适合这个。您只想提取目录中的所有 pdf 文件名并对其进行迭代,如果名称包含 Q1、Q2、Q3、Q4,则按季度创建两个列表,而不是按季度创建两个列表,否则将其放入非季度跨度>
  • 所有文件名的结构都像你给出的例子吗?

标签: weka text-classification


【解决方案1】:

当您的文件像示例中一样公开命名时,简单的模式匹配就可以正常工作。

这是一些伪代码:

if "_Q\d_" in filename:
  print filename " belongs to quarterly reports"
else:
  print filename " does not belong to quarterly reports"

【讨论】:

    猜你喜欢
    • 2018-03-16
    • 1970-01-01
    • 2017-06-18
    • 1970-01-01
    • 2016-01-30
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    相关资源
    最近更新 更多