我列出了一些带有变音字符的比利时城市:(Liège,Quiévrain,Franière等)我希望将这些特殊字符转换为与包含大写相同名称的列表进行比较,但没有变音符号(LIEGE,QUIEVRAIN,FRANIERE)
我首先尝试做的是使用大写:
LIEGE.contentEqual(Liège.toUpperCase())
但这不合适,因为Liège
的大写字母为LIÈGE
而非LIEGE
。
我有一些复杂的想法,比如替换每个角色,但这听起来很愚蠢而且过程很长。
关于如何以聪明的方式做到这一点的任何想法?
答案 0 :(得分:14)
从Java 6开始,您可以使用java.text.Normalizer:
public String unaccent(String s) {
String normalized = Normalizer.normalize(s, Normalizer.Form.NFD);
return normalized.replaceAll("[^\\p{ASCII}]", "");
}
请注意,在Java 5中还有一个sun.text.Normalizer
,但强烈建议不要使用它,因为它是Sun专有API的一部分,并已在Java 6中删除。
答案 1 :(得分:8)
在Java中查看此方法
private static final String PLAIN_ASCII = "AaEeIiOoUu" // grave
+ "AaEeIiOoUuYy" // acute
+ "AaEeIiOoUuYy" // circumflex
+ "AaOoNn" // tilde
+ "AaEeIiOoUuYy" // umlaut
+ "Aa" // ring
+ "Cc" // cedilla
+ "OoUu" // double acute
;
private static final String UNICODE = "\u00C0\u00E0\u00C8\u00E8\u00CC\u00EC\u00D2\u00F2\u00D9\u00F9"
+ "\u00C1\u00E1\u00C9\u00E9\u00CD\u00ED\u00D3\u00F3\u00DA\u00FA\u00DD\u00FD"
+ "\u00C2\u00E2\u00CA\u00EA\u00CE\u00EE\u00D4\u00F4\u00DB\u00FB\u0176\u0177"
+ "\u00C3\u00E3\u00D5\u00F5\u00D1\u00F1"
+ "\u00C4\u00E4\u00CB\u00EB\u00CF\u00EF\u00D6\u00F6\u00DC\u00FC\u0178\u00FF"
+ "\u00C5\u00E5" + "\u00C7\u00E7" + "\u0150\u0151\u0170\u0171";
/**
* remove accented from a string and replace with ascii equivalent
*/
public static String removeAccents(String s) {
if (s == null)
return null;
StringBuilder sb = new StringBuilder(s.length());
int n = s.length();
int pos = -1;
char c;
boolean found = false;
for (int i = 0; i < n; i++) {
pos = -1;
c = s.charAt(i);
pos = (c <= 126) ? -1 : UNICODE.indexOf(c);
if (pos > -1) {
found = true;
sb.append(PLAIN_ASCII.charAt(pos));
} else {
sb.append(c);
}
}
if (!found) {
return s;
} else {
return sb.toString();
}
}
答案 2 :(得分:6)
这是迄今为止我发现的最简单的解决方案,它在我们的应用程序中运行良好。
Normalizer.normalize(string, Normalizer.Form.NFD).replaceAll("\\p{InCombiningDiacriticalMarks}+", "");
但我不知道Android平台上是否有Normalizer。
答案 3 :(得分:3)
如果你仍然需要Android API 8或更低版本(Android 2.2,Java 1.5),你没有Normalizer类,这里是我的代码,我认为修改比Pentium10更好:
public class StringAccentRemover {
@SuppressWarnings("serial")
private static final HashMap<Character, Character> accents = new HashMap<Character, Character>(){
{
put('Ą', 'A');
put('Ę', 'E');
put('Ć', 'C');
put('Ł', 'L');
put('Ń', 'N');
put('Ó', 'O');
put('Ś', 'S');
put('Ż', 'Z');
put('Ź', 'Z');
put('ą', 'a');
put('ę', 'e');
put('ć', 'c');
put('ł', 'l');
put('ń', 'n');
put('ó', 'o');
put('ś', 's');
put('ż', 'z');
put('ź', 'z');
}
};
/**
* remove accented from a string and replace with ascii equivalent
*/
public static String removeAccents(String s) {
char[] result = s.toCharArray();
for(int i=0; i<result.length; i++) {
Character replacement = accents.get(result[i]);
if (replacement!=null) result[i] = replacement;
}
return new String(result);
}
}
答案 4 :(得分:1)
Collator类是一种很好的方法(参见相应的javadoc)。这是一个显示如何使用它的单元测试:
import static org.junit.Assert.assertEquals;
import java.text.Collator;
import java.util.Locale;
import org.junit.Test;
public class CollatorTest {
@Test public void liege() throws Exception {
Collator compareOperator = Collator.getInstance(Locale.FRENCH);
compareOperator.setStrength(Collator.PRIMARY);
assertEquals(0, compareOperator.compare("Liege", "Liege")); // no accent
assertEquals(0, compareOperator.compare("Liège", "Liege")); // with accent
assertEquals(0, compareOperator.compare("LIEGE", "Liege")); // case insensitive
assertEquals(0, compareOperator.compare("LIEGE", "Liège")); // case insensitive with accent
assertEquals(1, compareOperator.compare("Liege", "Bruxelles"));
assertEquals(-1, compareOperator.compare("Bruxelles", "Liege"));
}
}
编辑: 很抱歉看到我的回答无法满足您的需求;也许是因为我把它作为单元测试?这对你好吗?我个人觉得它更好,因为它短并且它使用SDK(不需要更换字符串)
Collator compareOperator = Collator.getInstance(Locale.FRENCH);
compareOperator.setStrength(Collator.PRIMARY);
if (compareOperator.compare("Liège", "Liege") == 0) {
// if we are here, then it's the "same" String
}
希望这会有所帮助
答案 5 :(得分:0)
由于Froyo或之前的Android版本不支持课程Normalizer,因此我合并了this和this(我都投了票),并对其进行了优化,获得了几个辅助方法。方法 unaccentify 只是将变音字符转换为普通字符,而方法 slugify 会为输入字符串生成一个slug。希望它对某人有用。这是源代码:
import java.util.Arrays;
import java.util.Locale;
import java.util.regex.Pattern;
public class SlugFroyo {
private static final Pattern STRANGE = Pattern.compile("[^a-zA-Z0-9-]");
private static final Pattern WHITESPACE = Pattern.compile("[\\s]");
private static final String DIACRITIC_CHARS = "\u00C0\u00E0\u00C8\u00E8\u00CC\u00EC\u00D2\u00F2\u00D9\u00F9"
+ "\u00C1\u00E1\u00C9\u00E9\u00CD\u00ED\u00D3\u00F3\u00DA\u00FA\u00DD\u00FD"
+ "\u00C2\u00E2\u00CA\u00EA\u00CE\u00EE\u00D4\u00F4\u00DB\u00FB\u0176\u0177"
+ "\u00C3\u00E3\u00D5\u00F5\u00D1\u00F1"
+ "\u00C4\u00E4\u00CB\u00EB\u00CF\u00EF\u00D6\u00F6\u00DC\u00FC\u0178\u00FF"
+ "\u00C5\u00E5" + "\u00C7\u00E7" + "\u0150\u0151\u0170\u0171";
private static final String PLAIN_CHARS = "AaEeIiOoUu" // grave
+ "AaEeIiOoUuYy" // acute
+ "AaEeIiOoUuYy" // circumflex
+ "AaOoNn" // tilde
+ "AaEeIiOoUuYy" // umlaut
+ "Aa" // ring
+ "Cc" // cedilla
+ "OoUu"; // double acute
private static char[] lookup = new char[0x180];
static {
Arrays.fill(lookup, (char) 0);
for (int i = 0; i < DIACRITIC_CHARS.length(); i++)
lookup[DIACRITIC_CHARS.charAt(i)] = PLAIN_CHARS.charAt(i);
}
public static String slugify(String s) {
String nowhitespace = WHITESPACE.matcher(s).replaceAll("-");
String unaccented = unaccentify(nowhitespace);
String slug = STRANGE.matcher(unaccented).replaceAll("");
return slug.toLowerCase(Locale.ENGLISH);
}
public static String unaccentify(String s) {
StringBuilder sb = new StringBuilder(s);
for (int i = 0; i < sb.length(); i++) {
char c = sb.charAt(i);
if (c > 126 && c < lookup.length) {
char replacement = lookup[c];
if (replacement > 0)
sb.setCharAt(i, replacement);
}
}
return sb.toString();
}
}
答案 6 :(得分:0)
我不知道它是否可以在Android上使用,但是在JVM上,您应该不在项目中重新实现它并重用已有的代码:只需使用org.apache.commons.lang3.StringUtils#stripAccents
答案 7 :(得分:0)
对于那些寻求干净的Java解决方案的人,请使用apache commons:
StringUtils.stripAccents("Liège").toUpperCase();
这将返回
LIEGE