【发布时间】:2019-05-31 02:12:26
【问题描述】:
我试图从 pdf 文档中提取具有罗马索引的小节。
例如这是文档的一部分,
\n1.1\n \n范围\n \n此 PTS 指定了\n \n要求\n以及分类、验证的建议\n\n功能\nions。\n \n范围包括以下内容:\n \ni。 \n \n半\n-\n定量 SIL 分类\n \nii.\n \n虚假行程分析\n \niii.\n \n概率和架构 SIL 验证\n \niv.\n \n建议\n \n针对 SIL 差距关闭'
我想要的只有下面:
此 PTS 指定了\n\n分类、验证的要求\n和建议\n\n功能\nions。\n\n范围包括以下内容:\n\ni。\n\n半\n-\n定量 SIL 分类\n \nii.\n \n虚假行程分析\n \niii.\n \n概率和架构 SIL 验证\n \niv.\n \n建议\n \n用于 SIL 差距缩小
我需要罗马索引之前的句子以及罗马索引中的内容。
不过,也有像下面这样的情况
3.1.3\n \n做\nc\说明\n \n必需\n \nT\nh\ne\n \nl\nat\ne\ns\nt\n \n问题\n \nof\n \nt \nh\ne\n \nf\no\nllo\nw\ni\nng\n \ndocume\nn\nts\n \nshall\n \nbe\n \nav\na\nilab\nl\ne\n \nto \n \nthe\n \nte\na\nm\n \np\ne\nrf\no\nrm\ni\nng\n \nt\nh\ne \nc\nl\nass\ni\nf\ni\ncati \no\nn:\n \ni.\n \n强制性参考文件\n \na)\n \n因果矩阵 (CEM)\n \nb)\n \n管道和仪表图 (P&ID) 或过程和实用程序工程\n流程图 (PEFS)\n \nc)\n \nHAZOP 报告\n \nd)\n \nIPF 可靠性数据\n \nii.\n \n其他参考文件\n \na)\n \n工艺流程图(PFD) 或 Process Fl\now Scheme (PFS)\n \nb)\n \n工厂布局图\n \nc)\n \n过程保护流程图 (PSFS)\n \nd)\n \n控制说明\n \ne)\n \n联锁/ ESD逻辑图\n \nf)\n \n设备布局图\n \ng)\n \n维护和检查数据\n \nh)\n \n工厂历史数据\n \n \ nT\nh\ne\n \nl\ni\ns\nt\n \na\nb\no\nve\n \nis\n \nn\no\nt\n \ne\nx\nh\na\nu\恩斯蒂\nv\ne。任何\n \not\nh\ne\nr\n \ndo\nc\nu\nm\ne\nn\nt\ns\n/ \nd\nr\na\nw\nin\ng\ns\n \nreq \nu\nir\ne\nd\n \nf\no\nr\n \nt\nhe \nc\nom\np\nletion\n \no\nf the\n \nIPF\n \ns\nt\nu\ nd\ny\n \ns\nh\na\nll\n \nbe\n \nf\nu\nr\nn\完成\n \nas\n \na\nn\nd\n \nw\nhen\n \ nre\nq\nui\nr\ne\nd\n.\n \n
我已将 pdf 转换为原始文本,并成功提取了文档的一部分。
regx = re.compile( '\.\n \n.+?:\n \n',re.DOTALL)
find = str(txt)
indexhead.append((regx.findall(find)))
以上代码只能提取标题,不能同时提取罗马索引
。\n \n范围包括以下内容:\n \n
我正在尝试根据模式进行提取,但我想一些条件规则可能会有所帮助。
【问题讨论】:
标签: python regex text regex-lookarounds data-processing