我有一个csv文件,4000条记录中只有4条有一些非ASCII字符。例如
['com.manager', '2016012300', '16.1.23', 'en', 'kinzie', '2015-04-11T17:36:23Z', '1428773783781', '2016-03-11T09:53:45Z', 'df', '5', "\xa5\x06`'", '\xc0\x03"', '\xa2{\xac ===]\xa9}\xf7\xf7\xf7\xf7\xf7\xf7\xf7\xf7\xf7\xf7\xf7\xf7\xf7>', '', '', '', 'https://play.google.com/apps/publish?account=sd#ReviewDetailsPlace:p=com.manager&reviewid=gp:AOqpTOEcQQGmjFcd-bFfU372DTrxh']
我正在使用以下python代码来阅读csv
with open('/Users/duttaam/Downloads/test1.csv', 'rU') as csvfile:
reader_obj = csv.reader(x.replace('\0', '') for x in csvfile)
rownum=0
for row in reader_obj:
rownum += 1
if len(row) != 16:
print rownum
print row
对于四行,读者显示不一致的列号。但是,当我计算这些行中的分隔符(,)时,它显示正常。只有我能看到的问题是非ascii字符作为上一行中显示的示例行。我猜这些是将一些表情符号转换成一些字符。
我想出了一个从字符串中删除不可打印字符的函数如何将它应用于整个csv?(感谢以下帖子:Stripping non printable characters from a string in python)
def removeSpecialcahr(s):
printable = set(string.printable)
return filter(lambda x: x in printable, s)
有没有办法处理csv并删除所有不可打印和/或非ascii字符?
答案 0 :(得分:4)
要从文件中删除非ASCII字符,请将open
来电替换为codecs.open()
。您还可以定义自己的错误处理程序......:
import codecs
codecs.open('file.csv', 'r', encoding='ascii', errors='ignore')