回到：

詳細分析awk字段分割

awk讀取每一條記錄之後，會將其賦值給$0，同時還會對這條記錄按照預定義變量FS劃分字段，將劃分好的各個字段分別賦值給$1 $2 $3 $4...$N，同時將劃分的字段數量賦值給預定義變量NF。

引用字段的方式

$N引用字段：

N=0：即$0，引用記錄本身

0<N<=NF：引用對應字段

N>NF：表示引用不存在的字段，返回空字符串

N<0：報錯

可使用變量或計算的方式指定要獲取的字段序號。

awk '{n = 5;print $n}' a.txt
 awk '{print $(2+2)}' a.txt   # 括號必不可少，用於改變優先級
 awk '{print $(NF-3)}' a.txt

分割字段的方式

讀取record之後，將使用預定義變量FS、FIELDWIDTHS或FPAT中的一種來分割字段。分割完成之後，再進入main代碼段(所以，在main中設置FS對本次已經讀取的record是沒有影響的，但會影響下次讀取)。

劃分字段方式(一)：FS或-F

FS或者-F：字段分隔符

FS為單個字符時，該字符即為字段分隔符

FS為多個字符時，則採用正則表達式模式作為字段分隔符

特殊的，也是FS默認的情況，FS為單個空格時，將以連續的空白（空格、製表符、換行符）作為字段分隔符

特殊的，FS為空字符串""時，將對每個字符都進行分隔，即每個字符都作為一個字段

設置預定義變量IGNORECASE為非零值，正則匹配時表示忽略大小寫(隻影響正則，所以FS為單字時無影響)

如果record中無法找到FS指定的分隔符(例如將FS設置為"\n")，則整個記錄作為一個字段，即$1和$0相等

# 字段分隔符指定為單個字符
 awk -F":" '{print $1}' /etc/passwd
 awk 'BEGIN{FS=":"}{print $1}' /etc/passwd
 
 # 字段分隔符指定為正則表達式
 awk 'BEGIN{FS=" +|@"}{print $1,$2,$3,$4,$5,$6}' a.txt

劃分字段方式(二)：FIELDWIDTHS

指定預定義變量FIELDWIDTHS按字符寬度分割字段，這是gawk提供的高級功能。在處理某字段缺失時非常好用。

用法：

示例1：

# 沒取完的字符串DDD被丟棄，且NF=3
 $ awk 'BEGIN{FIELDWIDTHS="2 3 2"}{print $1,$2,$3,$4}' <<<"AABBBCCDDDD"
 AA BBB CC 
 
 # 字符串不夠長度時無視
 $ awk 'BEGIN{FIELDWIDTHS="2 3 2 100"}{print $1,$2,$3,$4"-"}' <<<"AABBBCCDDDD"
 AA BBB CC DDDD-
 
 # *號取剩餘所有，NF=3
 $ awk 'BEGIN{FIELDWIDTHS="2 3 *"}{print $1,$2,$3}' <<<"AABBBCCDDDD"      
 AA BBB CCDDDD
 
 # 字段數多了，則取完字符串即可，NF=2
 $ awk 'BEGIN{FIELDWIDTHS="2 30 *"}{print $1,$2,NF}' <<<"AABBBCCDDDD"  
 AA BBBCCDDDD 2

示例2：處理某些字段缺失的數據。

如果按照常規的FS進行字段分割，則對於缺失字段的行和沒有缺失字段的行很難統一處理，但使用FIELDWIDTHS則非常方便。

假設a.txt文本內容如下：

ID  name    gender  age  email          phone
 1   Bob     male    28   abc@qq.com     18023394012
 2   Alice   female  24   def@gmail.com  18084925203
 3   Tony    male    21   aaa@163.com    17048792503
 4   Kevin   male    21   bbb@189.com    17023929033
 5   Alex    male    18                  18185904230
 6   Andy    female  22   ddd@139.com    18923902352
 7   Jerry   female  25   exdsa@189.com  18785234906
 8   Peter   male    20   bax@qq.com     17729348758
 9   Steven  female  23   bc@sohu.com    15947893212
 10  Bruce   female  27   bcbd@139.com   13942943905

因為email字段有的是空字段，所以直接用FS劃分字段不便處理。可使用FIELDWIDTHS。

# 字段1：4字符
 # 字段2：8字符
 # 字段3：8字符
 # 字段4：2字符
 # 字段5：先跳過3字符，再讀13字符，該字段13字符
 # 字段6：先跳過2字符，再讀11字符，該字段11字符
 awk '
 BEGIN{FIELDWIDTHS="4 8 8 2 3:13 2:11"}
 NR>1{
     print "<"$1">","<"$2">","<"$3">","<"$4">","<"$5">","<"$6">"
 }' a.txt
 
 # 如果email為空，則輸出它
 awk '
 BEGIN{FIELDWIDTHS="4 8 8 2 3:13 2:11"}
 NR>1{
     if($5 ~ /^ +$/){print $0}
 }' a.txt

劃分字段方式(三)：FPAT

FS是指定字段分隔符，來取得除分隔符外的部分作為字段。

FPAT是取得匹配的字符部分作為字段。它是gawk提供的一個高級功能。

FPAT根據指定的正則來全局匹配record，然後將所有匹配成功的部分組成$1、$2...，不會修改$0。

awk 'BEGIN{FPAT="[0-9]+"}{print $3"-"}' a.txt

之後再設置FS或FPAT，該變量將失效

FPAT常用於字段中包含了字段分隔符的場景。例如，CSV文件中的一行數據如下：

Robbins,Arnold,"1234 A Pretty Street, NE",MyTown,MyState,12345-6789,USA

其中逗號分隔每個字段，但雙引號包圍的是一個字段整體，即使其中有逗號。

這時使用FPAT來劃分各字段比使用FS要方便的多。

echo 'Robbins,Arnold,"1234 A Pretty Street, NE",MyTown,MyState,12345-6789,USA' |\
 awk '
     BEGIN{FPAT="[^,]*|(\"[^\"]*\")"}
     {
         for (i=1;i<NF;i++){
             print "<"$i">"
         }
     }
 '

最後，patsplit()函數和FPAT的功能一樣。

檢查字段劃分的方式

有FS、FIELDWIDTHS、FPAT三種獲取字段的方式，可使用PROCINFO數組來確定本次使用何種方式獲得字段。

PROCINFO是一個數組，記錄了awk進程工作時的狀態信息。

如果：

PROCINFO["FS"]=="FS"，表示使用FS分割獲取字段

PROCINFO["FPAT"]=="FPAT"，表示使用FPAT匹配獲取字段

PROCINFO["FIELDWIDTHS"]=="FIELDWIDTHS"，表示使用FIELDWIDTHS分割獲取字段

例如：

if(PROCINFO["FS"]=="FS"){
     ...FS spliting...
 } else if(PROCINFO["FPAT"]=="FPAT"){
     ...FPAT spliting...
 } else if(PROCINFO["FIELDWIDTHS"]=="FIELDWIDTHS"){
     ...FIELDWIDTHS spliting...
 }

本站聲明:網站內容來源於博客園,如有侵權,請聯繫我們,我們將及時處理【其他文章推薦】

※USB CONNECTOR掌控什麼技術要點? 帶您認識其相關發展及效能

※評比前十大台北網頁設計、台北網站設計公司知名案例作品心得分享

※智慧手機時代的來臨，RWD網頁設計已成為網頁設計推薦首選

Orignal From: 精通awk系列(8)：awk劃分字段的3種方式

3C資訊

搜尋此網誌

精通awk系列(8)：awk劃分字段的3種方式