Question

我在一个页面上有一个表单：

<form method="POST" accept-charset="UTF-8" action="index.cgi" name="TestForm">

其中一个输入字段“search_string”可用于发送西里尔字符，如果发生这种情况，则URL字符串如下所示：

search_string=%41F%2F%424+%41F%41E%414%416%410%420%41A%410+%418%417+%421%412%418%41D

如何将此解码回到我发布到的页面上的原始字符串？

Answer 1

正确的解决方案，包括空格：

use open ':std', ':encoding(UTF-8)';
use Encode;

my $escaped = '%41F%2F%424+%41F%41E%414%416%410%420%41A%410+%418%417+%421%412%418%41D';
(my $unescaped = $escaped) =~ s/\+/ /g;
$unescaped =~ s/%([[:xdigit:]]+)/chr hex $1/eg;
print $unescaped;
# П/Ф ПОДЖАРКА ИЗ СВИН

信用转到Renaud Bompuis，因为它们首先认识到这些是以%为前缀的Unicode代码点。

我想补充一点，问题的编码方案很不寻常，我以前没见过。通常人们会期望字符串П/Ф ПОДЖАРКА ИЗ СВИН被编码为%D0%9F%2F%D0%A4+%D0%9F%D0%9E%D0%94%D0%96%D0%90%D0%A0%D0%9A%D0%90+%D0%98%D0%97+%D0%A1%D0%92%D0%98%D0%9D，也就是说，首先将字符编码为UTF-8，然后八位字节被转义为百分比。该方案适用于Dr.Kameleon的答案。

Answer 2

保留原始字符串中+和任何其他字符的解决方案：

my $s = '%41F%2F%424+%41F%41E%414%416%410%420%41A%410+%418%417+%421%412%418%41D';
$s =~ s/%([[:xdigit:]]+)/chr(hex($1))/eg;
print $s;

结果：

П/Ф+ПОДЖАРКА+ИЗ+СВИН

Answer 3

在您的脚本中尝试（index.cgi）：

use Encode;

则...

$search_string = decode_utf8( $search_string );

另一个想法（如果你想创建一个对你的CGI输入的UTF8友好的哈希）：

require Encode;
require CGI;
my $query = CGI ->new;
my $form_input = {};  
foreach my $name ( $query ->param ) {
  my @val = $query ->param( $name );
  foreach ( @val ) {
    $_ = Encode::decode_utf8( $_ );
  }
  $name = Encode::decode_utf8( $name );
  if ( scalar @val == 1 ) {   
    $form_input ->{$name} = $val[0];
  } else {                      
    $form_input ->{$name} = \@val;  # save value as an array ref
  }
}

取自：http://ahinea.com/en/tech/perl-unicode-struggle.html

如何为URL编码西里尔字符然后解码它们？

3 个答案: