Python:为什么Xpath似乎只处理这棵树中的第一个元素?

时间:2011-10-27 20:43:30

标签: python html xpath

假设我有这个:

<!DOCTYPE HTML PUBLIC "-//W3C//DTD HTML 4.01 Transitional//EN">
<HTML LANG="ja">
<HEAD>
<META http-equiv="Content-Type" content="text/html; charset=Shift_JIS">
<META name="GENERATOR" content="snanail Version 2.18">
<TITLE>-www.example.org-</TITLE>

<STYLE type="text/css">
<!--
H1.TITLE {
font-size : 10 pt;
font-family : "Arial";
color : #FFFFFF;
}
-->
</STYLE>

</HEAD>
<BODY>
<CENTER>
<TABLE BORDER="0" CELLSPACING="1" CELLPADDING="6" ALIGN="CENTER">
<TR>
  <TD WIDTH="100">
    <TABLE ALIGN="CENTER" CELLPADDING="4" CELLSPACING="1">
      <TR>
        <TD HEIGHT="100" WIDTH= "68" ALIGN="CENTER" VALIGN="MIDDLE">
          <A HREF="001.html" TARGET="_blank"><IMG SRC="001_thumb.png" WIDTH="56" HEIGHT="80" ALT="001_thumb.png" BORDER="0"></A>
        </TD>
      </TR>
      <TR>
        <TD HEIGHT="40" ALIGN="CENTER" VALIGN="MIDDLE">
          <FONT SIZE="2" COLOR="#FFFFFF">001.jpg</FONT><BR>
          <FONT SIZE="2" COLOR="#FFFFFF">300 x 300 (806 KB)</FONT><BR>
        </TD>
      </TR>
    </TABLE>
  </TD>
  <TD WIDTH="100">
    <TABLE ALIGN="CENTER" CELLPADDING="4" CELLSPACING="1">
      <TR>
        <TD HEIGHT="100" WIDTH= "68" ALIGN="CENTER" VALIGN="MIDDLE">
          <A HREF="002.html" TARGET="_blank"><IMG SRC="002_thumb.png" WIDTH="56" HEIGHT="80" ALT="002_thumb.png" BORDER="0"></A>
        </TD>
      </TR>
      <TR>
        <TD HEIGHT="40" ALIGN="CENTER" VALIGN="MIDDLE">
          <FONT SIZE="2" COLOR="#FFFFFF">002.jpg</FONT><BR>
          <FONT SIZE="2" COLOR="#FFFFFF">300 x 300 (627 KB)</FONT><BR>
        </TD>
      </TR>
    </TABLE>
  </TD>
</TR>
</TABLE>
</CENTER>
</HTML>

我想找到页面中的所有网址,然后执行:

tree = lxml.html.parse('example.html')
links = tree.xpath('//a/@href')

然而我只得到第一个(001.html)。这是为什么?我尝试使用getroot()后手动迭代树,似乎只有第一个第一个url的表是可见的。我不明白。

编辑:我再次使用我发布的示例进行了测试,它实际上有效,经过一些测试后,似乎我删除了头部,它的工作原理......也许其中有些东西打破了解析器?我不知道。我想解决此问题的最佳方法是搜索文件并删除<head></head>之间的任何内容?由于解析没有按预期工作,我无法解析它。所以我已将头部添加到示例中以便它打破。

2 个答案:

答案 0 :(得分:1)

使用示例html文件和此脚本:

from lxml import etree

parser = etree.HTMLParser(encoding='utf8')
tree = etree.parse('source.html', parser)
print tree.xpath('//a/@href')

给出:

['001.html', '002.html']

答案 1 :(得分:0)

您是否尝试将文档声明为XHTML?

示例开头的doctype告诉您正在使用HTML,这不是有效的XML,因此xml解析器可能会在doctype之后停止处理输入。请记住,XPath需要有效的XML输入才能工作。

因此,如果您使用XHTML doctype,则XML解析器将不再中断doctype,并完整地解析输入。