仅从XML元素中提取实体编码的HTML中的文本

时间:2015-03-21 12:38:05

标签: java android xml xml-parsing

我正在研究XML解析Android应用程序,但我遇到了问题。我要解析的页面有一个元素<description>,其中有时会出现不需要的实体编码的HTML。这是结构:

<description>&lt;img src="http://images.website.it/thumbs/images/2014/12/16/asd_crop_upscale_q85.jpg" alt="Post img " style="float:left;margin-right:10px"/&gt; Lorem ipsum...</description>

我想要的是Lorem ipsum...部分,而且标签<description>中没有编码的HTML。这是doInBackground

AsyncTask部分
@Override
         protected Void doInBackground(Void... args) {
           Element e = null;
           XMLParser parser = new XMLParser();
           String xml = parser.getXmlFromUrl(URL); // getting XML
           Document doc = parser.getDomElement(xml); // getting DOM element
           NodeList nl = doc.getElementsByTagName(KEY_ITEM);

           // looping through all item nodes <item>
           for (int i = 0; i < nl.getLength(); i++) {
               // creating new HashMap
               HashMap<String, String> map = new HashMap<String, String>();
               e = (Element) nl.item(i);
               // adding each child node to HashMap key => value
               map.put(KEY_TITLE, parser.getValue(e, KEY_TITLE));
               map.put(KEY_DESC, parser.getValue(e, KEY_DESC));
               map.put(KEY_DATE, parser.getValue(e, KEY_DATE));
               map.put(KEY_LINK, parser.getValue(e, KEY_LINK));

               String descriptionElementContent = KEY_DESC;
               textOnly = removeEntityEncodedHtmlTags(descriptionElementContent);

               // adding HashList to ArrayList
               menuItems.add(map);
           }
           System.out.println("prova3");
           for (int c = 0; c < nl.getLength(); c++) {
               e = (Element) nl.item(c);
               titoli[c] = parser.getValue(e, KEY_TITLE); // name child value
               descrizioni[c] = parser.getValue(e, textOnly);
               date[c] = parser.getValue(e, KEY_DATE);
               links[c] = parser.getValue(e, KEY_LINK);
           }
           return null;
       }

       public String removeEntityEncodedHtmlTags(String rawString) {
           Matcher tagMatcher = ENTITY_ENCODED_HTML_TAG.matcher(rawString);
           return tagMatcher.replaceAll("").trim();
       }

        @Override
          protected void onPostExecute(Void s) {
            adapter = new SimpleAdapter(getActivity(), menuItems, R.layout.post_list_item, 
                    new String[] 
                             { KEY_TITLE,
                                textOnly,
                                KEY_DATE

                              }, new int[] 
                                      {
                                        R.id.title,
                                        R.id.description, 
                                        R.id.date
                                    });

            System.out.println("prova5");
            listView.setAdapter(adapter);
            pDialog.dismiss();          
        }

这是我第一次解析XML,所以我不知道如何做到这一点。

顺便说一句,这是我的XMLParser课程:

public class XMLParser {

    // constructor
    public XMLParser() {

    }

    /**
     * Getting XML from URL making HTTP request
     *
     * @param url string
     */
    public String getXmlFromUrl(String url) {
        String xml = null;

        try {
            // defaultHttpClient
            DefaultHttpClient httpClient = new DefaultHttpClient();
            HttpPost httpPost = new HttpPost(url);

            HttpResponse httpResponse = httpClient.execute(httpPost);
            HttpEntity httpEntity = httpResponse.getEntity();
            xml = EntityUtils.toString(httpEntity);

        } catch (UnsupportedEncodingException e) {
            e.printStackTrace();
        } catch (ClientProtocolException e) {
            e.printStackTrace();
        } catch (IOException e) {
            e.printStackTrace();
        }
        // return XML
        return xml;
    }

    /**
     * Getting XML DOM element
     *
     * @param XML string
     */
    public Document getDomElement(String xml) {
        Document doc = null;
        DocumentBuilderFactory dbf = DocumentBuilderFactory.newInstance();
        try {

            DocumentBuilder db = dbf.newDocumentBuilder();

            InputSource is = new InputSource();
            is.setCharacterStream(new StringReader(xml));
            doc = db.parse(is);

        } catch (ParserConfigurationException e) {
            Log.e("Error: ", e.getMessage());
            return null;
        } catch (SAXException e) {
            Log.e("Error: ", e.getMessage());
            return null;
        } catch (IOException e) {
            Log.e("Error: ", e.getMessage());
            return null;
        }

        return doc;
    }

    /**
     * Getting node value
     *
     * @param elem element
     */
    public final String getElementValue(Node elem) {
        Node child;
        if (elem != null) {
            if (elem.hasChildNodes()) {
                for (child = elem.getFirstChild(); child != null;
                        child = child.getNextSibling()) {
                    if (child.getNodeType() == Node.TEXT_NODE) {
                        return child.getNodeValue();
                    }
                }
            }
        }
        return "";
    }

    /**
     * Getting node value
     *
     * @param Element node
     * @param key string
     */
    public String getValue(Element item, String str) {
        NodeList n = item.getElementsByTagName(str);
        return this.getElementValue(n.item(0));
    }
}

我用新的doInBackground方法编辑了我的任务。什么都没有改变

1 个答案:

答案 0 :(得分:0)

如果要放弃在description元素中找到的所有实体编码的HTML,则可以使用正则表达式查找所有编码的HTML标记并用空字符串替换它们,然后修剪生成的字符串摆脱不必要的前导和尾随空格。

您可以仅使用String.replaceAll(String regex, String replacement) method来执行此操作,但如果您不止一次这样做,那么只需创建一个Pattern对象,然后使用该对象即可每一次。这避免了Java运行时不得不多次编译相同的正则表达式。

我已经测试了这段代码,它可以解决你问题中的示例XML:

private static final Pattern ENTITY_ENCODED_HTML_TAG =
        Pattern.compile("&lt;.*?&gt;");

public static void main(String[] args) {
    String descriptionElementContent =
            "&lt;img src=\"http://images.website.it/thumbs/images/2014/12/16/asd_crop_upscale_q85.jpg\" alt=\"Post img \" style=\"float:left;margin-right:10px\"/&gt; Lorem ipsum... &lt;br /&gt;";
    String textOnly = removeEntityEncodedHtmlTags(
            descriptionElementContent);
    System.out.println(textOnly);       
}

public static String removeEntityEncodedHtmlTags(String rawString) {
    Matcher tagMatcher = ENTITY_ENCODED_HTML_TAG.matcher(rawString);
    return tagMatcher.replaceAll("").trim();
}

只需使用您自己的main元素循环替换上述代码中的description方法。

正则表达式模式&lt;.*?&gt;表示&#34;匹配序列&lt;,然后匹配任何内容,直到第一次出现&gt;&#34;。此模式用于实例化一个静态Pattern对象,可以使用该对象(一遍又一遍)为传递给方法的每个原始字符串创建一个Matcher对象。然后Matcher.replaceAll方法只用一个空字符串替换找到的每个匹配项(在该原始字符串中),以便从结果中删除它,只保留文本。