《SED 单行脚本快速参考》的 perl 实现
《SED 单行脚本快速参考》的 perl 实现
需要处理文本时,通常我会使用sed或者awk,但我从来没有掌握它们,每次用时都得临时去查怎么使用。最近又碰到一个问题,想把一个html里面所有的css及javascript链接取出来,用sed或awk折腾了半天没有整出来,最后终于放弃了。我决定转向perl,perl是门非常强大的通用语言,但它最初诞生是用于文本处理,因此它处理文本的能力非常强大,并且于它一系列古怪的缩写,使得写命令非常简洁,非常适合一次性的文本处理。perl的与正则表达式的是我非常熟悉,几乎所有的现代编程语言都使用的是perl的正则表达式语法,不像vim,sed,grep等的正则表达式需要那么多转义,十分古怪。至于学习成本,我觉得perl更容易学,通用编程语言大都十分相似,如果有多虑其它语言的编程经历,再学习另外一门编程语言非常容易,perl也不例外,在我开始写这篇文章时,其实只看perl的基本语法,花了大概2个小时,当然写的时间要长得多。相反对于sed,awk仅仅用于面向行的流处理工具,其语法跟通用编程语言有很大差别,理解它的处理模型,并记住它的特殊语法要困难得多。学习perl另外一个好处就是可以看懂别人写的perl代码,有很多优秀的perl源代码。以下基于“《SED 单行脚本快速参考》的 awk 实现”,原文内容保留,以便对比。
文本间隔:
# 在每一行后面增加一空行
sed Gawk '{printf("%s\n\n",$0)}'perl -ne 'print "$_\n"'perl -pe '$_ .= "\n"'perl -pe '$\="\n"'
sed '/^$/d;G'awk '!/^$/{printf("%s\n\n",$0)}'perl -ne 'print "$_\n" unless /^$/'
sed 'G;G'awk '{printf("%s\n\n\n",$0)}'perl -ne 'print "$_\n\n"'perl -pe '$_ .= "\n\n"'
sed 'n;d'awk '{f=!f;if(f)print $0}'perl -ne 'print if $.%2'perl -pe '$_="" if $.%2'
sed '/regex/{x;p;x;}'awk '{if(/regex/)printf("\n%s\n",$0);else print $0}'perl -pe 'print "\n" if /regex/'
sed '/regex/G'awk '{if(/regex/)printf("%s\n\n",$0);else print $0}'perl -ne 'print; print "\n" if /regex/'perl -pe '$_ .= "\n" if /regex/'
sed '/regex/{x;p;x;G;}'awk '{if(/regex/)printf("\n%s\n\n",$0);else print $0}'perl -pe 's/.*regex.*/\n$_/'perl -pe '$_ = "\n$_\n" if /regex/'
sed = filename | sed 'N;s/\n/\t/'awk '{i++;printf("%d\t%s\n",i,$0)}'perl -pe 'print "$.\t"'perl -pe '$_ = "$.\t$_"'
sed = filename | sed 'N; s/^/ /; s/ *\(.\{6,\}\)\n/\1 /'awk '{i++;printf("%6d %s\n",i,$0)}'perl -pe 'printf "%6d ", $.'
sed '/./=' filename | sed '/./N; s/\n/ /'awk '{i++;if(!/^$/)printf("%d %s\n",i,$0);else print}'perl -pe 'print "$. " unless /^$/'
sed -n '$='awk '{i++}END{print i}'perl -nle 'END { print $.}'
sed 's/.$//' # 假设所有行以CR/LF结束sed 's/^M$//' # 在bash/tcsh中,将按Ctrl-M改为按Ctrl-Vsed 's/\x0D$//' # ssed、gsed 3.02.80,及更高版本awk '{sub(/\x0D$/,"");print $0}'perl -pe 's/\r$//'
sed "s/$/`echo -e \\\r`/" # 在ksh下所使用的命令sed 's/$'"/`echo \\\r`/" # 在bash下所使用的命令sed "s/$/`echo \\\r`/" # 在zsh下所使用的命令sed 's/$/\r/' # gsed 3.02.80 及更高版本awk '{printf("%s\r\n",$0)}'perl -pe 's/$/\r/'
sed "s/$//" # 方法 1sed -n p # 方法 2
sed "s/\r//" infile >outfile # UnxUtils sed v4.0.7 或更高版本tr -d \r <infile >outfile # GNU tr 1.22 或更高版本
sed 's/^[ \t]*//' # 见本文末尾关于'\t'用法的描述awk '{sub(/^[ \t]+/,"");print $0}'perl -ple 's/^\s+//'
sed 's/[ \t]*$//' # 见本文末尾关于'\t'用法的描述awk '{sub(/[ \t]+$/,"");print $0}'perl -ple 's/\s+$//'
sed 's/^[ \t]*//;s/[ \t]*$//'awk '{sub(/^[ \t]+/,"");sub(/[ \t]+$/,"");print $0}'perl -ple 's/\s+(.*)\s+$/\1/'
sed 's/^/ /'awk '{printf(" %s\n",$0)}'perl -pe 'print " "x5'
sed -e :a -e 's/^.\{1,78\}$/ &/;ta'awk '{printf("%79s\n",$0)}'perl -ne 'printf "%80s", $_'
sed -e :a -e 's/^.\{1,77\}$/ & /;ta' # 方法1sed -e :a -e 's/^.\{1,77\}$/ &/;ta' -e 's/\( *\)\1/\1/' # 方法2awk '{for(i=0;i<39-length($0)/2;i++)printf(" ");printf("%s\n",$0)}' #相当于上面的方法二perl -pe 'print " " x (40-(length)/2)' # 方法2
sed 's/foo/bar/' # 只替换每一行中的第一个“foo”字串sed 's/foo/bar/4' # 只替换每一行中的第四个“foo”字串sed 's/foo/bar/g' # 将每一行中的所有“foo”都换成“bar”sed 's/\(.*\)foo\(.*foo\)/\1bar\2/' # 替换倒数第二个“foo”sed 's/\(.*\)foo/\1bar/' # 替换最后一个“foo”awk '{gsub(/foo/,"bar");print $0}' # 将每一行中的所有“foo”都换成“bar”perl -pe 's/foo/bar/' # 只替换每一行中的第一个“foo”字串perl -pe 's/foo/bar/g' # 将每一行中的所有“foo”都换成“bar” perl -pe 's/(.*)foo(.*foo)/\1bar\2/' # 替换倒数第二个“foo”perl -pe 's/(.*)foo/\1bar/' # 替换最后一个“foo”
sed '/baz/s/foo/bar/g'awk '{if(/baz/)gsub(/foo/,"bar");print $0}'perl -pe 's/foo/bar/g if /baz/'
sed '/baz/!s/foo/bar/g'awk '{if(/baz$/)gsub(/foo/,"bar");print $0}'perl -pe 's/foo/bar/g unless /baz/'
sed 's/scarlet/red/g;s/ruby/red/g;s/puce/red/g' #对多数的sed都有效gsed 's/scarlet\|ruby\|puce/red/g' # 只对GNU sed有效awk '{gsub(/scarlet|ruby|puce/,"red");print $0}'perl -pe 's/scarlet|ruby|puce/red/g'
sed '1!G;h;$!d' # 方法1sed -n '1!G;h;$p' # 方法2awk '{A[i++]=$0}END{for(j=i-1;j>=0;j--)print A[j]}'perl -e 'print reverse <>'
sed '/\n/!G;s/\(.\)\(.*\n\)/&\2\1/;//D;s/.//'awk '{for(i=length($0);i>0;i--)printf("%s",substr($0,i,1));printf("\n")}'perl -ple '$_=scalar reverse'
sed '$!N;s/\n/ /'awk '{f=!f;if(f)printf("%s",$0);else printf(" %s\n",$0)}'perl -pe 's/\n/ / if $.%2'
sed -e :a -e '/\\$/N; s/\\\n//; ta'awk '{if(/\\$/)printf("%s",substr($0,0,length($0)-1));else printf("%s\n",$0)}'perl -pe 's/\\\n//'
sed -e :a -e '$!N;s/\n=/ /;ta' -e 'P;D'awk '{if(/^=/)printf(" %s",substr($0,2));else printf("%s%s",a,$0);a="\n"}END{printf("\n")}'perl -0777pe 's/\n=/ /'
gsed ':a;s/\B[0-9]\{3\}\>/,&/;ta' # GNU sedsed -e :a -e 's/\(.*[0-9]\)\([0-9]\{3\}\)/\1,\2/;ta' # 其他sed#awk的正则没有后向匹配和引用,搞的比较狼狈,呵呵。awk '{while(match($0,/[0-9][0-9][0-9][0-9]+/)){$0=sprintf("%s,%s",substr($0,0,RSTART+RLENGTH-4),substr($0,RSTART+RLENGTH-3))}print $0}'perl -pe 's/(\d)(?=(\d{3})+\b)/\1,/g'
gsed -r ':a;s/(^|[^0-9.])([0-9]+)([0-9]{3})/\1\2,\3/g;ta'#和上例差不多awk '{while(match($0,/[^\.0-9][0-9][0-9][0-9][0-9]+/)){$0=sprintf("%s,%s",substr($0,0,RSTART+RLENGTH-4),substr($0,RSTART+RLENGTH-3))}print $0}'# 这是我写的最复杂的正则表达式perl -pe 's/(\d)((?=(\d{3}){2,}\.\d)|(\d{3}\.\d+)|(?=(\d{3})+\D))/\1,\2/g'
gsed '0~5G' # 只对GNU sed有效sed 'n;n;n;n;G;' # 其他sedawk '{print $0;i++;if(i==5){printf("\n");i=0}}'perl -pe '$_.="\n" if $.%5==0'
sed 10qawk '{print;if(NR==10)exit}'perl -pe 'last if $.==11'
sed qawk '{print;exit}'perl -ne 'print;exit'perl -pe 'last if $.==2'
sed -e :a -e '$q;N;11,$D;ba'#用awk干这个有点亏,得全文缓存,对于大文件肯定很慢awk '{A[NR]=$0}END{for(i=NR-9;i<=NR;i++)print A[i]}'perl -e '@A=<>;print @A[-10..-1]'
sed '$!N;$!D'awk '{A[NR]=$0}END{for(i=NR-1;i<=NR;i++)print A[i]}'perl -e '@A=<>;print @A[-2..-1]'
sed '$!d' # 方法1sed -n '$p' # 方法2#这个比较好办,只存最后一行了。awk '{A=$0}END{print A}'perl -e '@A=<>;print @A[-1]'perl -ne '$t=$_;END{print $t}'
sed -e '$!{h;d;}' -e x # 当文件中只有一行时,输出空行sed -e '1{$q;}' -e '$!{h;d;}' -e x # 当文件中只有一行时,显示该行sed -e '1{$d;}' -e '$!{h;d;}' -e x # 当文件中只有一行时,不输出#存两行呗(当文件中只有一行时,输出空行)awk '{B=A;A=$0}END{print B}'perl -e '@A=<>;print @A[-2]'
sed -n '/regexp/p' # 方法1sed '/regexp/!d' # 方法2awk '/regexp/{print}'perl -ne 'print if /regexp/'
sed -n '/regexp/!p' # 方法1,与前面的命令相对应sed '/regexp/d' # 方法2,类似的语法awk '!/regexp/{print}'perl -ne 'print unless /regexp/'
sed -n '/regexp/{g;1!p;};h'awk '/regexp/{print A}{A=$0}'perl -ne 'print $t if /regexp/;$t=$_'
sed -n '/regexp/{n;p;}'awk '{if(A)print;A=0}/regexp/{A=1}'perl -ne 'print scalar <> if /regexp/'
sed -n -e '/regexp/{=;x;1!p;g;$!N;p;D;}' -e hawk '{if(F)print;F=0}/regexp/{print NR;print b;print;F=1}{b=$0}'perl -ne 'if($M){print $.-1 ."\n$L0$L1$_"};$M=/regexp/;$L0,$L1=$L1,$_'
sed '/AAA/!d; /BBB/!d; /CCC/!d' # 字串的次序不影响结果awk '{if(match($0,/AAA/) && match($0,/BBB/) && match($0,/CCC/))print}'perl -ne 'print if /AAA/ && /BBB/ && /CCC/'
sed '/AAA.*BBB.*CCC/!d'awk '{if(match($0,/AAA.*BBB.*CCC/))print}'perl -ne 'print if /AAA.*BBB.*CCC/'
sed -e '/AAA/b' -e '/BBB/b' -e '/CCC/b' -e d # 多数sedgsed '/AAA\|BBB\|CCC/!d' # 对GNU sed有效awk '/AAA/{print;next}/BBB/{print;next}/CCC/{print}'awk '/AAA|BBB|CCC/{print}'perl -ne 'print if /AAA|BBB|CCC/'
sed -e '/./{H;$!d;}' -e 'x;/AAA/!d;'awk 'BEGIN{RS=""}/AAA/{print}'awk -vRS= '/AAA/{print}'perl -00ne 'print if /AAA/'
sed -e '/./{H;$!d;}' -e 'x;/AAA/!d;/BBB/!d;/CCC/!d'awk -vRS= '{if(match($0,/AAA/) && match($0,/BBB/) && match($0,/CCC/))print}'perl -00ne 'print if /AAA/ && /BBB/ && /CCC/'
sed -e '/./{H;$!d;}' -e 'x;/AAA/b' -e '/BBB/b' -e '/CCC/b' -e dgsed '/./{H;$!d;};x;/AAA\|BBB\|CCC/b;d' # 只对GNU sed有效awk -vRS= '/AAA|BBB|CCC/{print "";print}'perl -00ne 'print if /AAA|BBB|CCC/'
sed -n '/^.\{65\}/p'cat ll.txt | awk '{if(length($0)>=65)print}'perl -ne 'print if /.{65}/'perl -nle 'print if /.{65}/'
sed -n '/^.\{65\}/!p' # 方法1,与上面的脚本相对应sed '/^.\{65\}/d' # 方法2,更简便一点的方法awk '{if(length($0)<=65)print}'perl -nle 'print unless /.{65}/'
sed -n '/regexp/,$p'awk '/regexp/{F=1}{if(F)print}'perl -ne 'print if /regex/..0'
sed -n '8,12p' # 方法1sed '8,12!d' # 方法2awk '{if(NR>=8 && NR<12)print}'perl -ne 'print if 8..12'
sed -n '52p' # 方法1sed '52!d' # 方法2sed '52q;d' # 方法3, 处理大文件时更有效率awk '{if(NR==52){print;exit}}'perl -ne 'print if 52..52'perl -ne 'print if $.==52'
gsed -n '3~7p' # 只对GNU sed有效sed -n '3,${p;n;n;n;n;n;n;}' # 其他sedawk '{if(NR==3)F=1}{if(F){i++;if(i%7==1)print}}'perl -ne 'print if $.%7==3'
sed -n '/Iowa/,/Montana/p' # 区分大小写方式awk '/Iowa/{F=1}{if(F)print}/Montana/{F=0}'perl -ne 'print if /Iowa/../Montana/'
sed '$!N; /^\(.*\)\n\1$/!P; D'awk '{if($0!=B)print;B=$0}'perl -ne 'print unless $_ eq $t;$t=$_'
sed -n 'G; s/\n/&&/; /^\([ -~]*\n\).*\n\1/d; s/\n//; h; P' #bones7456注:我这里此命令并不能正常工作awk '{if(!($0 in B))print;B[$0]=1}'perl -ne 'print if !$H{$_};$H{$_}=1'
sed '$!N; s/^\(.*\)\n\1$/\1/; t; D'awk '{if($0==B && $0!=l){print;l=$0}B=$0}'perl -ne 'print if $_ eq $t;$t=$_'
sed '1,10d'awk '{if(NR>10)print}'perl -ne 'print if 11..0'
sed '$d'#awk在过程中并不知道文件一共有几行,所以只能通篇缓存,大文件可能不适合,下面两个也一样awk '{B[NR]=$0}END{for(i=0;i<=NR-1;i++)print B[i]}'perl -e '@A=<>;print @A[0..$#A-1]'
sed 'N;$!P;$!D;$d'awk '{B[NR]=$0}END{for(i=0;i<=NR-2;i++)print B[i]}'perl -e '@A=<>;print @A[0..$#A-2]'
sed -e :a -e '$d;N;2,10ba' -e 'P;D' # 方法1sed -n -e :a -e '1,10!{P;N;D;};N;ba' # 方法2awk '{B[NR]=$0}END{for(i=0;i<=NR-10;i++)print B[i]}'perl -e '@A=<>;print @A[0..$#A-10]'
gsed '0~8d' # 只对GNU sed有效sed 'n;n;n;n;n;n;n;d;' # 其他sedawk '{if(NR%8!=0)print}' |headperl -ne 'print if $.%8'
sed '/pattern/d' # 删除含pattern的行。当然pattern可以换成任何有效的正则表达式awk '{if(!match($0,/pattern/))print}'perl -ne 'print unless /pattern/'
sed '/^$/d' # 方法1sed '/./!d' # 方法2awk '{if(!match($0,/^$/))print}'perl -ne 'print if /./'
sed '/./,/^$/!d' #方法1,删除文件顶部的空行,允许尾部保留一空行sed '/^$/N;/\n$/D' #方法2,允许顶部保留一空行,尾部不留空行awk '{if(!match($0,/^$/)){print;F=1}else{if(F)print;F=0}}' #同上面的方法2perl -00 -pe '' #方法2
sed '/^$/N;/\n$/N;//D'awk '{if(!match($0,/^$/)){print;F=0}else{if(F<2)print;F++}}'perl -ne 'if(/^$/){$N++}else{$N=0};print if $N<=2'
sed '/./,$!d'awk '{if(F || !match($0,/^$/)){print;F=1}}'perl -ne 'if(/./ && !$N){$N=1};print if $N'
sed -e :a -e '/^\n*$/{$d;N;ba' -e '}' # 对所有sed有效sed -e :a -e '/^\n*$/N;/\n$/ba' # 同上,但只对 gsed 3.02.*有效awk '/^.+$/{for(i=l;i<NR-1;i++)print "";print;l=NR}'
sed -n '/^$/{p;h;};/./{x;/./p;}'#很长,很ugly,应该有更好的办法awk -vRS= '{B=$0;l=0;f=1;while(match(B,/\n/)>0){print substr(B,l,RSTART-l-f);l=RSTART;sub(/\n/,"",B);f=0};print ""}'#sed版本不正确,perl版本会删除最后一个段落的所有空行perl -ne 'if(/./){$N-- if $N>1;print "\n"x$N.$_;$N=0}else{$N++}'
sed "s/.`echo \\\b`//g" # 外层的双括号是必须的(Unix环境)sed 's/.^H//g' # 在bash或tcsh中, 按 Ctrl-V 再按 Ctrl-Hsed 's/.\x08//g' # sed 1.5,GNU sed,ssed所使用的十六进制的表示方法awk '{gsub(/.\x08/,"",$0);print}'perl -pe 's/\b//g'
sed '/^$/q' # 删除第一行空行后的所有内容awk '{print}/^$/{exit}'perl -pe 'exit if /^$/' # 不会保留空行
sed '1,/^$/d' # 删除第一行空行之前的所有内容awk '{if(F)print}/^$/{F=1}'perl -ne 'print if /^$/..0' # 这会保留第一行空行
sed '/^Subject: */!d; s///;q'awk '/^Subject:.*/{print substr($0,10)}/^$/{exit}'perl -ne 'print if s/^Subject: (.*)/\1/'
sed '/^Reply-To:/q; /^From:/h; /./d;g;q'#好像是输出第一个Reply-To:开头的行?From是干啥用的?不清楚规则。。awk '/^Reply-To:.*/{print;exit}/^$/{exit}'#实际是:有Reply-To:显示Reply-To行,否则没有Reply-To但有From:则显示From行perl -ne 'if (/^Reply-To:/){print;exit};$F=$_ if /^From:/;print $F if /^$/'perl -ne '$H{"R"}=$_ if /^Reply-To:/;$H{"F"}=$_ if /^From:/;END { print ($H{"R"} or $H{"F"}) }'perl -ne '$H{substr($1,0,1)}=$_ if /^(Reply-To|From):/;END{print ($H{"R"} or $H{"F"})}'
sed 's/ *(.*)//; s/>.*//; s/.*[:<] *//'#取尖括号里的东西吧?awk -F'[<>]+' '{print $2}'#取冒号后内容: 有<...>只取尖括号中内容, 不取(...)中内容。#From: aaaa<bbbb> => bbbb, From: aaaa => aaaaperl -pe 's/ *\(.*\)//; s/>.*//; s/.*[:<] *//' # 直接仿照sed版本
sed 's/^/> /'awk '{print "> " $0}'perl -pe 's/^/> /'
sed 's/^> //'awk '/^> /{print substr($0,3)}'perl -pe 's/^> //'
sed -e :a -e 's/<[^>]*>//g;/</N;//ba'awk '{gsub(/<[^>]*>/,"",$0);print}'perl -pe 's/<[^>]*>//g'
sed '/^end/,/^begin/d' file1 file2 ... fileX | uudecode # vers. 1sed '/^end/,/^begin/d' "$@" | uudecode # vers. 2#我不想装个uudecode验证,大致写个吧awk '/^end/{F=0}{if(F)print}/^begin/{F=1}' file1 file2 ... fileXperl -ne 'print unless /^end/../^begin/'
sed '/./{H;d;};x;s/\n/={NL}=/g' file | sort | sed '1s/={NL}=//;s/={NL}=/\n/g'gsed '/./{H;d};x;y/\n/\v/' file | sort | sed '1s/\v//;y/\v/\n/'awk -vRS= '{gsub(/\n/,"\v",$0);print}' ll.txt | sort | awk '{gsub(/\v/,"\n",$0);print;print ""}'# 上面的版本在我的机器上不能运行,我是按照我的理解来吧perl -00e '@A=<>; print sort @A' # 有个缺陷,它要求最后一行以空行结束
perl -00nle 'if (/^g?sed/) { print "[ code]\n${_}\n[ /code]"}else{print}'