我正在处理我从网站上抓取的文件,该文件保存为带引号字段的分号csv。 最后一个字段包含嵌入的换行符。 我一直在处理一个处理文件的脚本。 我是perl的新手,起初是用普通的perl脚本尝试它但很快就发现它不起作用。 我做了我的研究,发现我应该使用Text :: CSV模块。我遇到了这些网站,解释了如何使用该模块:
http://perlmaven.com/how-to-read-a-csv-file-using-perl
http://perlmeme.org/tutorials/parsing_csv.html
http://metacpan.org/pod/Text::CSV#Embedded-newlines
基本上我想要完成的是正确读取文件,以便所有字段都能正确分隔,而不是在换行符中断开。然后从该字段中删除换行符并将其写入新文件。
以下是原始数据的示例:
"2030";"NH Amersfoort";"Stationsstraat 75";"3811 MH AMERSFOORT";"033-4221200";"www.nh-hotels.nl";"52.154316";"5.380036";"<UL class=stars><LI>
<LI>
<LI>
<LI></LI></UL>"
"2031";"NH Amsterdam Centre";"Stadhouderskade 7";"1054 ES AMSTERDAM";"020-6851351";"www.nh-hotels.com";"52.363075";"4.879458";"<UL class=stars><LI>
<LI>
<LI>
<LI></LI></UL>"
"2032";"NH Atlanta Rotterdam Hotel";"Aert van Nesstraat 4";"3012 CA ROTTERDAM";"010-2067800";"www.nh-hotels.com";"51.921028";"4.478619";"<UL class=stars><LI>
<LI>
<LI>
<LI></LI></UL>"
我想要的是这个:
"2030";"NH Amersfoort";"Stationsstraat 75";"3811 MH AMERSFOORT";"033-4221200";"www.nh-hotels.nl";"52.154316";"5.380036";"<UL class=stars><LI><LI><LI><LI></LI></UL>"
"2031";"NH Amsterdam Centre";"Stadhouderskade 7";"1054 ES AMSTERDAM";"020-6851351";"www.nh-hotels.com";"52.363075";"4.879458";"<UL class=stars><LI><LI><LI><LI></LI></UL>"
"2032";"NH Atlanta Rotterdam Hotel";"Aert van Nesstraat 4";"3012 CA ROTTERDAM";"010-2067800";"www.nh-hotels.com";"51.921028";"4.478619";"<UL class=stars><LI><LI><LI><LI></LI></UL>"
到目前为止,这是我的完整脚本。我尝试了10种不同的选项和建议,但它们都没有用!
use strict;
use warnings;
use Text::CSV;
my $inputfile = shift || die "Give input and output names!\n";
my $outputfile = shift || die "Give output name!\n";
open my $infile, '<', $inputfile or die "Sourcefile in use / not found :$!\n";
open my $outfile, '>', $outputfile or die "Outputfile in use :$!\n";
my $csv = Text::CSV->new ({
binary => 1,
sep_char => ';'
});
while (my $elements = $csv->getline( $infile )) {
my $stars = $elements->[8];
#$ster =~ s/[\r\n]//g
print "$stars\n\n";
}
close $infile;
close $outfile;
这会正确打印带有换行符的字段,但是当然没有删除它们。我怎么做?使用正则表达式替换换行符不起作用。接下来的问题是当我弄清楚如何清理那个字段时..如何打印新文件?
答案 0 :(得分:2)
我不确定你在这里问的是什么,因为看起来你已经有了答案。但是,此代码确实有效:
use strict;
use warnings;
use Text::CSV;
my $csv = Text::CSV->new ({
binary => 1,
sep_char => ';',
eol => $/, # to make $csv->print use newlines
always_quote => 1, # to keep your numbers quoted
});
while (my $row = $csv->getline( *DATA )) {
$row->[8] =~ s/[\r\n]+//g;
$csv->print(*STDOUT, $row);
}
__DATA__
"2030";"NH Amersfoort";"Stationsstraat 75";"3811 MH AMERSFOORT";"033-4221200";"www.nh-hotels.nl";"52.154316";"5.380036";"<UL class=stars><LI>
<LI>
<LI>
<LI></LI></UL>"
"2031";"NH Amsterdam Centre";"Stadhouderskade 7";"1054 ES AMSTERDAM";"020-6851351";"www.nh-hotels.com";"52.363075";"4.879458";"<UL class=stars><LI>
<LI>
<LI>
<LI></LI></UL>"
"2032";"NH Atlanta Rotterdam Hotel";"Aert van Nesstraat 4";"3012 CA ROTTERDAM";"010-2067800";"www.nh-hotels.com";"51.921028";"4.478619";"<UL class=stars><LI>
<LI>
<LI>
<LI></LI></UL>"
<强>指针:强>
将eol
选项与Text::CSV
打印一起使用可以达到预期效果,即打印换行符。我使用STDOUT
作为输出句柄,但您可以使用任何所需的文件句柄。
我不知道为什么你说替换对你来说“不起作用”,但我怀疑你可能做过这样的事情:
my $foo = $row->[8];
$foo =~ s/[\r\n]//g;
print @$row;
这不会更改$row
中的值,只会更改$foo
中的副本。