作为awk
的初学者,我能够通过
awk -F, '{print >> $1".csv";close($1)}' myfile.csv
但我想基于附加条件拆分大型CSV文件,这是特定列中唯一值的出现。
具体来说,输入
111,1,0,1
111,1,1,1
222,1,1,1
333,1,0,0
333,1,1,1
444,1,1,1
444,0,0,0
555,1,1,1
666,1,0,0
我希望输出文件是
111,1,0,1
111,1,1,1
222,1,1,1
333,1,0,0
333,1,1,1
和
444,1,1,1
444,1,0,1
555,1,1,1
666,1,0,0
每一个在第一列中分别包含三个(在本例中)唯一值111,222,333
和444,555,666
。
任何帮助将不胜感激。
答案 0 :(得分:2)
这将解决问题,我发现它非常易读且易于理解:
awk -F',' 'BEGIN { count=0; filename=1 }
x[$1]++==0 {count++}
count==4 { count=1; filename++}
{print >> filename".csv"; close(filename".csv");}' file
我们的计数从0开始,我们的文件名在1开始。然后我们计算从第一列得到的每个唯一值,只要是第四列,我们重置计数并移动到下一个文件名。
以下是我使用的一些示例数据,这些数据只是您的一些额外行。
~$ cat test.txt
111,1,0,1
111,1,1,1
222,1,1,1
333,1,0,0
333,1,1,1
444,1,1,1
444,0,0,0
555,1,1,1
666,1,0,0
777,1,1,1
777,1,0,1
777,1,1,0
777,1,1,1
888,1,0,1
888,1,1,1
999,1,1,1
999,0,0,0
999,0,0,1
101,0,0,0
102,0,0,0
像这样运行awk:
~$ awk -F',' 'BEGIN { count=0; filename=1 }
x[$1]++==0 {count++}
count==4 { count=1; filename++}
{print >> filename".csv"; close(filename".csv");}' test.txt
我们看到以下输出文件和内容:
~$ cat 1.csv
111,1,0,1
111,1,1,1
222,1,1,1
333,1,0,0
333,1,1,1
~$ cat 2.csv
444,1,1,1
444,0,0,0
555,1,1,1
666,1,0,0
~$ cat 3.csv
777,1,1,1
777,1,0,1
777,1,1,0
777,1,1,1
888,1,0,1
888,1,1,1
999,1,1,1
999,0,0,0
999,0,0,1
~$ cat 4.csv
101,0,0,0
102,0,0,0
答案 1 :(得分:1)
这个单行会有所帮助:
awk -F, -v u=3 -v i=1 '{a[$1];
if (length(a)>u){close(i".csv");++i;delete a;a[$1]}print>i".csv"}' file
您将u=3
值更改为x
,以获得每个文件的x
个唯一值。
如果您使用输入文件运行此行,则应该1.csv and 2.csv
kent$ ll
total 4.0K
drwxr-xr-x 2 kent kent 60 Mar 25 18:19 ./
drwxrwxrwt 19 root root 580 Mar 25 18:18 ../
-rw-r--r-- 1 kent kent 90 Mar 25 17:57 f
kent$ cat f
111,1,0,1
111,1,1,1
222,1,1,1
333,1,0,0
333,1,1,1
444,1,1,1
444,0,0,0
555,1,1,1
666,1,0,0
kent$ awk -F, -v u=3 -v i=1 '{fn=i".csv";a[$1];if (length(a)>u){close(fn);++i;delete a;a[$1]}print>fn}' f
kent$ head *.csv
==> 1.csv <==
111,1,0,1
111,1,1,1
222,1,1,1
333,1,0,0
333,1,1,1
==> 2.csv <==
444,1,1,1
444,0,0,0
555,1,1,1
666,1,0,0