我正在研究XML解析Android应用程序,但我遇到了问题。我要解析的页面有一个元素<description>
,其中有时会出现不需要的实体编码的HTML。这是结构:
<description><img src="http://images.website.it/thumbs/images/2014/12/16/asd_crop_upscale_q85.jpg" alt="Post img " style="float:left;margin-right:10px"/> Lorem ipsum...</description>
我想要的是Lorem ipsum...
部分,而且标签<description>
中没有编码的HTML。这是doInBackground
AsyncTask
部分
@Override
protected Void doInBackground(Void... args) {
Element e = null;
XMLParser parser = new XMLParser();
String xml = parser.getXmlFromUrl(URL); // getting XML
Document doc = parser.getDomElement(xml); // getting DOM element
NodeList nl = doc.getElementsByTagName(KEY_ITEM);
// looping through all item nodes <item>
for (int i = 0; i < nl.getLength(); i++) {
// creating new HashMap
HashMap<String, String> map = new HashMap<String, String>();
e = (Element) nl.item(i);
// adding each child node to HashMap key => value
map.put(KEY_TITLE, parser.getValue(e, KEY_TITLE));
map.put(KEY_DESC, parser.getValue(e, KEY_DESC));
map.put(KEY_DATE, parser.getValue(e, KEY_DATE));
map.put(KEY_LINK, parser.getValue(e, KEY_LINK));
String descriptionElementContent = KEY_DESC;
textOnly = removeEntityEncodedHtmlTags(descriptionElementContent);
// adding HashList to ArrayList
menuItems.add(map);
}
System.out.println("prova3");
for (int c = 0; c < nl.getLength(); c++) {
e = (Element) nl.item(c);
titoli[c] = parser.getValue(e, KEY_TITLE); // name child value
descrizioni[c] = parser.getValue(e, textOnly);
date[c] = parser.getValue(e, KEY_DATE);
links[c] = parser.getValue(e, KEY_LINK);
}
return null;
}
public String removeEntityEncodedHtmlTags(String rawString) {
Matcher tagMatcher = ENTITY_ENCODED_HTML_TAG.matcher(rawString);
return tagMatcher.replaceAll("").trim();
}
@Override
protected void onPostExecute(Void s) {
adapter = new SimpleAdapter(getActivity(), menuItems, R.layout.post_list_item,
new String[]
{ KEY_TITLE,
textOnly,
KEY_DATE
}, new int[]
{
R.id.title,
R.id.description,
R.id.date
});
System.out.println("prova5");
listView.setAdapter(adapter);
pDialog.dismiss();
}
这是我第一次解析XML,所以我不知道如何做到这一点。
顺便说一句,这是我的XMLParser
课程:
public class XMLParser {
// constructor
public XMLParser() {
}
/**
* Getting XML from URL making HTTP request
*
* @param url string
*/
public String getXmlFromUrl(String url) {
String xml = null;
try {
// defaultHttpClient
DefaultHttpClient httpClient = new DefaultHttpClient();
HttpPost httpPost = new HttpPost(url);
HttpResponse httpResponse = httpClient.execute(httpPost);
HttpEntity httpEntity = httpResponse.getEntity();
xml = EntityUtils.toString(httpEntity);
} catch (UnsupportedEncodingException e) {
e.printStackTrace();
} catch (ClientProtocolException e) {
e.printStackTrace();
} catch (IOException e) {
e.printStackTrace();
}
// return XML
return xml;
}
/**
* Getting XML DOM element
*
* @param XML string
*/
public Document getDomElement(String xml) {
Document doc = null;
DocumentBuilderFactory dbf = DocumentBuilderFactory.newInstance();
try {
DocumentBuilder db = dbf.newDocumentBuilder();
InputSource is = new InputSource();
is.setCharacterStream(new StringReader(xml));
doc = db.parse(is);
} catch (ParserConfigurationException e) {
Log.e("Error: ", e.getMessage());
return null;
} catch (SAXException e) {
Log.e("Error: ", e.getMessage());
return null;
} catch (IOException e) {
Log.e("Error: ", e.getMessage());
return null;
}
return doc;
}
/**
* Getting node value
*
* @param elem element
*/
public final String getElementValue(Node elem) {
Node child;
if (elem != null) {
if (elem.hasChildNodes()) {
for (child = elem.getFirstChild(); child != null;
child = child.getNextSibling()) {
if (child.getNodeType() == Node.TEXT_NODE) {
return child.getNodeValue();
}
}
}
}
return "";
}
/**
* Getting node value
*
* @param Element node
* @param key string
*/
public String getValue(Element item, String str) {
NodeList n = item.getElementsByTagName(str);
return this.getElementValue(n.item(0));
}
}
我用新的doInBackground
方法编辑了我的任务。什么都没有改变
答案 0 :(得分:0)
如果要放弃在description
元素中找到的所有实体编码的HTML,则可以使用正则表达式查找所有编码的HTML标记并用空字符串替换它们,然后修剪生成的字符串摆脱不必要的前导和尾随空格。
您可以仅使用String.replaceAll(String regex, String replacement)
method来执行此操作,但如果您不止一次这样做,那么只需创建一个Pattern
对象,然后使用该对象即可每一次。这避免了Java运行时不得不多次编译相同的正则表达式。
我已经测试了这段代码,它可以解决你问题中的示例XML:
private static final Pattern ENTITY_ENCODED_HTML_TAG =
Pattern.compile("<.*?>");
public static void main(String[] args) {
String descriptionElementContent =
"<img src=\"http://images.website.it/thumbs/images/2014/12/16/asd_crop_upscale_q85.jpg\" alt=\"Post img \" style=\"float:left;margin-right:10px\"/> Lorem ipsum... <br />";
String textOnly = removeEntityEncodedHtmlTags(
descriptionElementContent);
System.out.println(textOnly);
}
public static String removeEntityEncodedHtmlTags(String rawString) {
Matcher tagMatcher = ENTITY_ENCODED_HTML_TAG.matcher(rawString);
return tagMatcher.replaceAll("").trim();
}
只需使用您自己的main
元素循环替换上述代码中的description
方法。
正则表达式模式<.*?>
表示&#34;匹配序列<
,然后匹配任何内容,直到第一次出现>
&#34;。此模式用于实例化一个静态Pattern
对象,可以使用该对象(一遍又一遍)为传递给方法的每个原始字符串创建一个Matcher
对象。然后Matcher.replaceAll
方法只用一个空字符串替换找到的每个匹配项(在该原始字符串中),以便从结果中删除它,只保留文本。