【发布时间】:2010-02-17 17:10:57
【问题描述】:
自动计算 .doc 或 .docx 文件中的字符和/或单词的可靠方法是什么?
唯一真正的要求是相当准确和相当可靠的计数。
它需要处理包含拉丁文字以外的其他内容的文档,因此在大多数情况下计算字符就足够了。
计数不一定要与 Word 相匹配,但越接近越好。
由于有大量不同的应用程序可以生成 .doc 文件,因此无法对任何内容进行计数是可以的,但这种情况需要可捕获,因此我们知道计数可能不准确。对于所有其他情况,计数必须在至少 99% 的时间内达到至少 99% 的准确率。
我对所涉及的技术持开放态度,但可以在 *NIX 命令行上运行的技术将是非常受欢迎的。
有没有合理的解决方案?
【问题讨论】:
-
如果你能算上 wvSummary(linux.die.net/man/1/wvsummary) 最后一次被 Word 保存(或者至少是保存 Word 元数据的程序),你可以使用 wvSummary(linux.die.net/man/1/wvsummary)。
-
@Matthew 不幸的是,依赖文件本身中的元数据实在是太不可靠了。 :)
-
您能否在网络中某处的 Windows 机器上安装 word 并仅使用 Word 本身(通过一些 COM 或 VBA)来获得准确的计数?
-
@Peter 我也在考虑这个选项,但这是我最后的选择。我们现在的 Windows 基础架构绝对为零,所以这将是一项艰巨的任务。
标签: ms-word ms-office word-count charactercount