在单个HtmlNodeCollection c#

时间:2018-09-13 09:13:53

标签: c# web-scraping html-agility-pack

我需要使用HTML Agility Pack从所有表中检索所有tr

HTML:

<section class="content-section" id="more">
    <div class="row">
        <div class="col-xs-6"></div>
        <div class="col-xs-6">
            <h2>Specs</h2>
            <div>
                <div>
                    <table>
                        <thead>
                            <tr><th colspan="2"> test</th></tr>
                        </thead>
                        <tbody>                         
                            <tr><td>2</td><td>b</td></tr>
                            <tr><td>1</td><td>a</td></tr>
                        </tbody>
                    </table>                                    
                    <table>
                        <tbody>
                            <tr><td>3</td><td>c</td></tr>
                            <tr><td>4</td><td>d</td></tr>               
                        </tbody>
                    </table>
                </div>              
            </div>
        </div>      
    </div>  
</section>

C#:

HtmlNodeCollection featuresNode = document.DocumentNode.SelectNodes("//*[@id='more']/div/div[2]/div/div[1]/table/tbody/tr");

我只能获取第一个表tr,而不能获取tr中的所有两个表HtmlNodeCollection

1 个答案:

答案 0 :(得分:2)

要获取所有tr个节点,包括thead中的一个,请将您的XPath更新为:

"//*[@id='more']/div/div[2]/div/div[1]/table//tr"

这个简化的XPath也应该起作用:

"//*[@id='more']//tr"

如果您只需要tr中的tbody,请使用:

"//*[@id='more']//tbody//tr"

或从tr中排除thead,使用:

"//*[@id='more']//tr[not(ancestor::thead)]"