使用python lxml循环问题进行文本提取

时间:2013-06-05 10:56:49

标签: python xml python-2.7 lxml elementtree

这是我的xml文件的一部分..

- <a:p>
    - <a:pPr lvl="2">
        - <a:spcBef>
              <a:spcPts val="200" /> 
          </a:spcBef>
     </a:pPr>
    - <a:r>
          <a:rPr lang="en-US" sz="1400" dirty="0" smtClean="0" /> 
          <a:t>The</a:t> 
     </a:r>
    - <a:r>
         <a:rPr lang="en-US" sz="1400" dirty="0" /> 
         <a:t>world</a:t> 
      </a:r>
     - <a:r>
          <a:rPr lang="en-US" sz="1400" dirty="0" smtClean="0" /> 
          <a:t>is small</a:t> 
      </a:r>
  </a:p>
    - <a:p>
    - <a:pPr lvl="2">
        - <a:spcBef>
              <a:spcPts val="200" /> 
          </a:spcBef>
     </a:pPr>
    - <a:r>
          <a:rPr lang="en-US" sz="1400" dirty="0" smtClean="0" b="0" /> 
          <a:t>The</a:t> 
     </a:r>
    - <a:r>
         <a:rPr lang="en-US" sz="1400" dirty="0" b="0" /> 
         <a:t>world</a:t> 
      </a:r>
     - <a:r>
          <a:rPr lang="en-US" sz="1400" dirty="0" smtClean="0" b="0" /> 
          <a:t>is too big</a:t> 
      </a:r>
  </a:p>

我已经使用lxml编写了一个代码来提取文本。但是,由于句子被分成两行,我想加入这两行来形成像The world is small...这样的单句。所以在这里我写了一个代码:

path4 = file.xpath('/p:sld/p:cSld/p:spTree/p:sp/p:txBody/a:p/a:r/a:rPr', namespaces={'p':'http://schemas.openxmlformats.org/presentationml/2006/main',
                'a':'http://schemas.openxmlformats.org/drawingml/2006/main'})
    if path5:
        for a in path4:  
            if a.get('sz') == '1400' and a.xpath('node()') == [] and a.get('b') != '0':
                b = a.getparent()
                c = b.getparent()
                d = c.xpath('./a:r/a:t/text()' , namespaces {'p':'http://schemas.openxmlformats.org/presentationml/2006/main', 'a':'http://schemas.openxmlformats.org/drawingml/2006/main'})
                print ''.join(d)
             elif a.get('sz') == '1400' and a.xpath('node()') == [] and a.get('b') == '0':
                b = a.getparent()
                c = b.getparent()
                d = c.xpath('./a:r/a:t/text()' , namespaces {'p':'http://schemas.openxmlformats.org/presentationml/2006/main', 'a':'http://schemas.openxmlformats.org/drawingml/2006/main'})
                print ''.join(d)

我得到了输出:

The world is samll...
The world is small...
The world is small...

预期产出:

the world is small...

有什么建议吗?

1 个答案:

答案 0 :(得分:1)

您正在为循环中找到的每个a:rPr创建句子。

以下是您应该做的事情的示例:

test.xml

<body xmlns:a="http://schemas.openxmlformats.org/drawingml/2006/main"
      xmlns:p="http://schemas.openxmlformats.org/presentationml/2006/main">
    <a:p>
        -
        <a:pPr lvl="2">
            -
            <a:spcBef>
                <a:spcPts val="200"/>
            </a:spcBef>
        </a:pPr>
        -
        <a:r>
            <a:rPr lang="en-US" sz="1400" dirty="0" smtClean="0"/>
            <a:t>The</a:t>
        </a:r>
        -
        <a:r>
            <a:rPr lang="en-US" sz="1400" dirty="0"/>
            <a:t>world</a:t>
        </a:r>
        -
        <a:r>
            <a:rPr lang="en-US" sz="1400" dirty="0" smtClean="0"/>
            <a:t>is small</a:t>
        </a:r>
    </a:p>
    <a:p>
        -
        <a:pPr lvl="2">
            -
            <a:spcBef>
                <a:spcPts val="200"/>
            </a:spcBef>
        </a:pPr>
        -
        <a:r>
            <a:rPr lang="en-US" sz="1400" dirty="0" smtClean="0" b="0"/>
            <a:t>The</a:t>
        </a:r>
        -
        <a:r>
            <a:rPr lang="en-US" sz="1400" dirty="0" b="0"/>
            <a:t>world</a:t>
        </a:r>
        -
        <a:r>
            <a:rPr lang="en-US" sz="1400" dirty="0" smtClean="0" b="0"/>
            <a:t>is too big</a:t>
        </a:r>
    </a:p>
</body>

test.py

from lxml import etree


tree = etree.parse('test.xml')
NAMESPACES = {'p': 'http://schemas.openxmlformats.org/presentationml/2006/main',
              'a': 'http://schemas.openxmlformats.org/drawingml/2006/main'}

path = tree.xpath('/body/a:p', namespaces=NAMESPACES)

for outer_item in path:
    parts = []
    for item in outer_item.xpath('./a:r/a:rPr', namespaces=NAMESPACES):
        parts.append(item.getparent().xpath('./a:t/text()', namespaces=NAMESPACES)[0])

    print " ".join(parts)

输出:

  

世界很小

     

世界太大了

因此,只需循环a:p项并将文本解压缩到parts,然后在处理每个a:p后打印它。为清楚起见,我删除了if语句。

希望有所帮助。