您现在的位置是：首页 > 数据库

当前栏目

awk一行码：求交集、差集、筛选白名单数据

数据

2023-04-18 14:46:38 时间

众所周知，awk不是一个工具/命令，它其实是一种『编程语言』。

对于后台开发工程师而言，不管你是什么语言的工程师。对于统计线上数据，从日志提炼信息等等场景，awk都是必备神器！

场景1：

一个TAB分割的数据文件，假设名为data.txt，第二列为用户id。

从中筛选用户id为123的所有数据：

awk -F'	' '{if($2==123) print $0}'  data.txt > new_data.txt

awk的列从1计数，1是第一列，2是第2列……

$0是特殊的变量，表示这一整行的数据。

场景2：

如果要筛选多个用户id怎么办？

可以将待筛选的用户id存入一个文件userid.txt。一行一个id。

过滤data.txt，找到userid.txt中的用户id的数据来输出。

awk -F '	' 'BEGIN{while(getline<"userid.txt") a[$1]=1;} {if(a[$2]==1) print $0;}' data.txt > new_data.txt

（分号也可以去掉）

BEGIN语法是在逐行解析之前执行的一段代码。这里它会加载userid.txt将用户id存入关联数组a中：key是用户id，value是1。

后面的代码块开始逐行解析，用data.txt的第二列做key去关联数组a中查找。如果查找到value为1，就输出整行。

关联数组就类似其他语言里面的dict或map。

简化：交集和差集

这一行码可以改成求两个文件的交集。只需要调整读取的列号即可。

awk -F '	' 'BEGIN{while(getline<"a.txt") a[$0]=1;} {if(a[$0]==1) print $0;}' b.txt > ab.txt

要求差集，改下判断条件，如下便是b.txt 减去 a.txt的差集了。

awk -F '	' 'BEGIN{while(getline<"a.txt") a[$0]=1;} {if(a[$0]!=1) print $0;}' b.txt > ba.txt

有时候我们离线处理一些数据，你会说人生苦短，我用Python。

我们当然可以用Python来实现，但是很多时候，每次写一个Python脚本，有点杀鸡用牛刀的感觉。另外就是如果一个文件特别大，比如10G。Python脚本会卡很久（除非你自己做大量优化），彼时该就上演awk的拿手好戏了，快到不敢相信。

猜你喜欢

新一代数据基础设施：数据智能平台（附下载）
SQLite 基础6
被奖12万！凌晨发现实验室漏水，中科大5学生踹门救下2400万设备和九章三号
为什么 2022 年互联网大厂都在集中裁员？答案就两个字
把DNA换成RNA，有望创造强大、可持续的生物计算机
Transformer 自然语言处理简介
KVM虚拟机误删除数据恢复案例分享
如何亿点点降低语音识别跨领域、跨语种迁移难度？
开价20w美元，这家公司想买下你的脸！不限性别年龄，预计2023年投入机器人使用
Gartner公布首个SSE魔力象限排名
众筹十万美元搞火箭，搞研发全靠志愿者！这个“草根”航天组织已经开启载人测试
TikTok遭扎克伯格“黑公关”：全美撒黑稿，持续近半年，现承认了
元宇宙将有750亿新人类？新智元发布《中国AI和元宇宙产业七大趋势》
2021年10月腾讯云开发者社区视频月度榜单公布
腾讯优图&厦门大学提出无需训练的ViT结构搜索算法
敏捷开发：从理论到团队落地
2021图灵奖揭晓：高性能计算先驱、超算TOP500榜单创始人之一Jack Dongarra获奖
SQLite 基础7
20年老码农分享20条编程经验，你pick哪些？
写代码，你以为的快方法，可能是慢方法

zl程序教程

当前栏目

awk一行码：求交集、差集、筛选白名单数据

相关文章