将字符串转换为字符数组-多字节

时间:2019-04-21 10:53:33

标签: php regex unicode split multibyte-characters

假设在2019年,每个不是UNICODE安全的解决方案都是错误的。在PHP中将字符串转换为UNICODE字符数组的最佳方法是什么?

显然,这意味着使用大括号语法以及使用str_split来访问字节是错误的:

$arr = str_split($text);

来自示例输入,例如:

$string = '先éé€‍ ‍❤️‍';

我希望:

array(16) {


[0]=>
  string(3) "先"
  [1]=>
  string(2) "é"
  [2]=>
  string(1) "e"
  [3]=>
  string(2) "́"
  [4]=>
  string(3) "€"
  [5]=>
  string(4) ""
  [6]=>
  string(4) ""
  [7]=>
  string(4) ""
  [8]=>
  string(3) "‍"
  [9]=>
  string(1) " "
  [10]=>
  string(4) ""
  [11]=>
  string(3) "‍"
  [12]=>
  string(3) "❤"
  [13]=>
  string(3) "️"
  [14]=>
  string(3) "‍"
  [15]=>
  string(4) ""
}

2 个答案:

答案 0 :(得分:2)

只需使用PREG_SPLIT_NO_EMPTY标志传递一个空模式。 否则,您可以使用\X(unicode点)和\K(重新启动全字符串匹配)来编写模式。为了完整性,我将提供一个mb_split()调用和一个preg_match_all()调用。

代码:(Demo

$string='先秦兩漢';
var_export(preg_split('~~u', $string, 0, PREG_SPLIT_NO_EMPTY));
echo "\n---\n";
var_export(preg_split('~\X\K~u', $string, 0, PREG_SPLIT_NO_EMPTY));
echo "\n---\n";
var_export(preg_split('~\X\K(?!$)~u', $string));
echo "\n---\n";
var_export(mb_split('\X\K(?!$)', $string));
echo "\n---\n";
var_export(preg_match_all('~\X~u', $string, $out) ? $out[0] : []);

所有产品:

array (
  0 => '先',
  1 => '秦',
  2 => '兩',
  3 => '漢',
)

来自https://www.regular-expressions.info/unicode.html

  

如何匹配单个Unicode字形

     

在Perl,PCRE,PHP,Boost,Ruby 2.0,Java 9和Just Great Software应用程序中,匹配单个字形(无论是作为单个代码点编码,还是使用组合标记编码为多个代码点)都很容易:只需使用\ X。

     

您可以将\ X视为点的Unicode版本。但是,有一个区别:\ X总是匹配换行符,而点不匹配换行符,除非您启用了点匹配换行符匹配模式。


更新,DHarman使我注意到mb_str_split()现在可以从PHP7.4中获得。

新功能的默认length参数为1,因此在这种情况下可以省略length参数。

https://wiki.php.net/rfc/mb_str_split

Dharman的演示:https://3v4l.org/M85Fi/rfc#output

答案 1 :(得分:1)

这对我有用,它将unicode字符串分解为字符数组:

//
// split at all position not after the start: ^
// and not before the end: $, with unicode modifier
// u (PCRE_UTF8).
//
$arr = preg_split("/(?<!^)(?!$)/u", $text);

例如:

<?php
//
$text = "堆栈溢出";

$arr = preg_split("/(?<!^)(?!$)/u", $text);

echo '<html lang="fr">
<head>
<meta http-equiv="content-type" content="text/html; charset=UTF-8" />
</head>
<body>
';

print_r($arr);

echo '</body>
</html>
';
?>

在浏览器中,它产生以下内容:

Array ( [0] => 堆 [1] => 栈 [2] => 溢 [3] => 出 )