Perl:将(高)十进制NCR转换为UTF-8

时间:2015-03-19 13:08:59

标签: regex perl utf-8 decimal ncr

我有这个字符串(十进制NCR):日本の鍼灸とは

它代表日文日本の鍼灸とは

但我需要(UTF-8):%E6%97%A5%E6%9C%AC%E3%81%AE%E9%8D%BC%E7%81%B8%E3%81%A8%E3%81%AF

对于第一个字符:日%E6%97%A5

这个网站做到了,但我如何在Perl中获得这个? (如果可能在单个正则表达式中使用s/\&\#([0-9]+);/uc('%'.unpack("H2", pack("c", $1)))/eg;。)

http://www.endmemo.com/unicode/unicodeconverter.php

此外,我需要将其从UTF-8再次转换回十进制NCR

我现在已经半天打过这个半天了,非常感谢任何帮助!

2 个答案:

答案 0 :(得分:3)

你叫什么" UTF-8"实际上是URL编码。


HTML实体(日)⇒文本()⇒URI组件(%E6%97%A5):

use HTML::Entities qw( decode_entities );
use URI::Escape    qw( uri_escape_utf8 );

my $text = decode_entities($html);
my $uri_component = uri_escape_utf8($text);

URI组件(%E6%97%A5)⇒文本()⇒HTML实体(日):

use Encode         qw( decode_utf8 );
use HTML::Entities qw( encode_entities );
use URI::Escape    qw( uri_unescape );

my $text = decode_utf8(uri_unescape($uri_component));
my $html = encode_entities($text);

答案 1 :(得分:0)

#!/usr/bin/perl
use strict;
use warnings;

use Test::More tests => 2;
use Encode qw{ encode decode };

my $in = '日本の鍼灸とは'; # 日本の鍼灸とは
my $out = '%E6%97%A5%E6%9C%AC%E3%81%AE%E9%8D%BC%E7%81%B8%E3%81%A8%E3%81%AF';

(my $utf = $in) =~ s/&#(.*?);/chr $1/ge;

my $r = join q(), map { sprintf '%%%2X', ord } split //, encode('utf8', $utf);
is($r, $out);

(my $s = $r) =~ s/%(..)/chr hex $1/ge;
$s = decode('utf8', $s);
$s = join q(), map '&#' . ord . ';', split //, $s;
is($s, $in);