如何使用Simple HTML DOM来解决这个问题

时间:2011-09-19 02:23:23

标签: php screen-scraping simple-html-dom

我正在尝试使用简单的html dom从一个看起来像这样的文件中提取元素。

  • 该文件有几个看起来相同class=sometable的表。
  • 每张桌子都有一些<tr class=sometr>
  • 然后在每个tr中,我有th有标题,有一个td有一个类别。

我要提取的是所有表格中所有表格行的所有标题class=title及其对应的类别编号class=category。我已将文件加载到$html中。有人能告诉我之后我应该找到什么吗?我甚至试过了$collection = $html->find('tr');并对收藏品做了一个vardump但什么都没有,所以看起来我选择不对。

<table class="sometable">
  <tbody>
    <tr class="sometr">
      <th><a class="title">Table 1 Title1</a></th>
      <td class="category" id="categ-113"></td>
      <td class="somename">Table 1 Title 1 name</td>
    </tr>
    <tr></tr>
    <tr></tr>                           
  </tbody>
</table>

<table class="sometable">
</table>

<table class="sometable">
</table>

1 个答案:

答案 0 :(得分:2)

我已经测试了this并且它有效

$tables = $dom->find('table[@class="sometable"]');

foreach($tables as $table)
{
    $titles = $table->find('a[@class="title"]');
    foreach($titles as $title)
    {
        echo "Link title = " . $title ."<br />";
    }

    $categories = $table->find('td[@class="category"]');
    foreach($categories as $category)
    {
        echo "Category id = " . $category->id ."<br />";
    }

    $titles2 = $table->find('td[@class="somename"]');
    foreach($titles2 as $title2)
    {
        echo "Title2 = " . $title2 ."<br />";
    }

}