【问题标题】:Taking CSV Field and Extracting Links to Separate Python-DocX Paragraphs获取 CSV 字段并提取链接以分隔 Python-DocX 段落
【发布时间】:2017-11-22 18:00:03
【问题描述】:

我正在开发一个 Python 项目,该项目采用 CSV 输出文件并重新格式化数据并使用 Python-DocX 将其放入 Word 文档中。到目前为止一切都很好,但是在同一个字段中使用多个超链接会导致所有链接都指向集合中的第一个链接。

目前这是导致问题的代码:

        p7 = document.add_paragraph()
        hyperlink = add_hyperlink(p7, row['See Also'], str(row['See Also']))

如您所见,空白段落已初始化,然后将超链接分配给它。 row['See Also'] 是包含我需要使用的链接的行。有些条目包含一个链接,有些则包含很多。

这个 (https://github.com/python-openxml/python-docx/issues/74) 是根据 Python-Docx 的文档化方法添加超链接的函数:

def add_hyperlink(paragraph, url, text):
    # This gets access to the document.xml.rels file and gets a new relation id value
    part = paragraph.part
    r_id = part.relate_to(
        url, docx.opc.constants.RELATIONSHIP_TYPE.HYPERLINK,
        is_external=True
    )

    # Create the w:hyperlink tag and add needed values
    hyperlink = docx.oxml.shared.OxmlElement('w:hyperlink')
    hyperlink.set(docx.oxml.shared.qn('r:id'), r_id, )

    # Create a w:r element
    new_run = docx.oxml.shared.OxmlElement('w:r')

    # Create a new w:rPr element
    rPr = docx.oxml.shared.OxmlElement('w:rPr')

    # Join all the xml elements together add add the required text to the w:r element
    new_run.append(rPr)
    new_run.text = text
    hyperlink.append(new_run)

    paragraph._p.append(hyperlink)

    return hyperlink

我想这样做的方法是使用 for 循环遍历字段中的每个超链接并将它们分配给每个段落,这样超链接应该可以正常工作。我尝试了以下方法,但这只会创建 1000 个无法正常工作的链接。

for x in row['See Also']:
    p = document.add_paragraph()
    hyperlink = add_hyperlink(p, row['See Also'], row['See Also'])

我目前正在测试一个非常小的 CSV 文件,其中只有两组数据,如下所示:

https://www.openssl.org/blog/blog/2016/08/24/sweet32/

这当然不会导致任何问题,并且超链接按预期工作,但是以下会导致所有链接指向第一个地址。

https://downloads.avaya.com/elmodocs2/security/ASA-2006-217.htm
http://www.kb.cert.org/vuls/id/JARL-5ZQR4D
http://www-01.ibm.com/support/docview.wss?uid=isg1IY55949
http://www-01.ibm.com/support/docview.wss?uid=isg1IY55950
http://www-01.ibm.com/support/docview.wss?uid=isg1IY62006
http://www.juniper.net/support/security/alerts/niscc-236929.txt
http://technet.microsoft.com/en-us/security/bulletin/ms05-019
http://technet.microsoft.com/en-us/security/bulletin/ms06-064
http://www.kb.cert.org/vuls/id/JARL-5YGQ9G
http://www.kb.cert.org/vuls/id/JARL-5ZQR7H
http://www.kb.cert.org/vuls/id/JARL-5YGQAJ
http://www.nessus.org/u?cf64c2ca
https://isc.sans.edu/diary.html?date=2004-04-20

修复可能非常简单,如果能提供任何有关此问题的帮助,我们将不胜感激。

【问题讨论】:

    标签: python csv python-docx


    【解决方案1】:

    您没有提供足够的上下文代码来显示细节,但我怀疑您的问题出在这条线上:

    for x in row['See Also']:
    

    如果你运行:

    for x in row['See Also']:
        print x
    

    我想你会得到:

    h
    t
    t
    p
    s
    :
    ...
    

    如您所见,在 for 循环中使用字符串值作为可迭代对象会迭代字符串的字符。

    我认为你需要的是这样的:

    for row in csv_rows:
        p = document.add_paragraph()
        hyperlink = add_hyperlink(p, row['See Also'], row['See Also'])
    

    【讨论】:

    • 您建议的方法与我目前使用的方法相同,目前我使用该方法从它作为输入的 CSV 文件中发布多行。问题似乎是因为 See Also 行在某些情况下是多行的,所以它将第一项应用为列表中所有后续链接的超链接。
    • 我现在已经解决了这个问题,代码如下:for row in csv_rows: links = row['See Also'].split("\n") for item in links: p = document .add_paragraph() 超链接 = add_hyperlink(p, item, item)
    【解决方案2】:

    解决了这个问题,下面的代码解决了这个问题:

    for row in csv_rows:
            links = row['See Also'].split("\n")
            for item in links:
                p = document.add_paragraph()
                hyperlink = add_hyperlink(p, item, item)
    

    这会将“另见”行的每一行拆分为一个列表,然后遍历该列表,将每个项目变成一个超链接。

    【讨论】:

      猜你喜欢
      • 2015-05-28
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      • 2011-01-17
      • 1970-01-01
      相关资源
      最近更新 更多