pandas中使用excel的模糊匹配通配符,真香
2023-06-13 09:16:57 时间
前言
在 pandas 中,实现如下的模糊匹配统计,要怎么做?
简单:
因为在 pandas 中可以把筛选和统计两种逻辑分开编写,所以代码清晰好用。 问题在于pandas 中要实现模糊匹配,只能使用正则表达式或某种具体的函数。
在 excel 中有一类可以模糊匹配的统计函数,比如 sumifs
、 countifs
等,它们可以使用通配符实现模糊匹配统计。之前的 excel 公式:
- 问号
?
表示1个任意的字符,星号*
表示任意个数(0、1、或n)的字符 - 对比来看,这可以直接在字符串中表达出 pandas 中的
startswith
,endswith
,contains
这种直接在字符串中表达模糊匹配规则,真香!难道在 pandas 中无法做到?
正则表达式的特殊字符
要在字符串中表达匹配规则,用正则表达式是最好的选择。其实思路挺简单,不就是直接把表达字符串中的符合替换成正则表达式相对于的符号吗?如下:
- 行3:正则表达式中的点
.
,表示任意一个字符 - 行4:在表达式前后添加开始
^
和结束$
标志
问题在于,用户输入的表达字符串里面可能包含了正则表达式的其他符号:
- 这里我希望表达的是,搜索内容中有加号
+
,但因为 加号在正则表达式中有1或多个字符的意思 ,导致结果仍然匹配成功(内容中根本没有加号)
在 python 的正则表达式库中,为此有专门的函数,可以把所有在正则表达式中有特殊意义的符号,转义成匹配内容:
- 处理后的结果中,加号
+
前面添加了反斜杠,正则表达式中反斜杠可以把特殊含义符号转义成普通内容
正确步骤
现在我们已经把整个问题拆分成2个小问题(并有解决方法):
- excel 的通配符在正则表达式中的对应表达
- 排除正常正则表达式中的特殊符号
只要设计好这两个步骤的执行顺序,应该就可以顺利解决问题。
定义函数:
- 函数只做一件事情,把匹配字符串转成符合要求的表达式字符串
- 行4: 首先用
re.escape
转成普通内容,然后针对星号和问号做替换
定义一个测试函数:
- 行3:
re.match
返回有结果,就是匹配到
写一些简单的测试:
没有报错,证明没问题。
应用到 pandas 的 series.str.match
函数即可:
不过,每次都这样子调用很啰嗦。可以封装到一个函数里面:
现在可以使用:
相关文章
- 用python的pandas打开csv文件_如何使用Pandas DataFrame打开CSV文件 – python[通俗易懂]
- 如何利用 pandas 批量合并 Excel?
- 微软 Excel 要成第一编程语言了么?
- python 字符转数字函数_excel将字符串转数字
- 【说站】Excel如何快速删除空行?WPS删除excel空白行
- Excel函数-SUMPRODUCT进行各班、各分数段人数统计
- 提高工作效率的神器:基于前端表格实现Chrome Excel扩展插件
- pandas 读取excel文件
- pandas读取excel某一行_python读取csv数据指定行列
- python处理Excel实现自动化办公教学(含实战)【一】
- Python自动化办公--Pandas玩转Excel【一】
- 代替VBA!用Python轻松实现Excel编程(文末赠书)
- 软件测试|Python操作Excel制作报表,不要太方便
- 怎么把两个excel表合成一个表合并保持相同数据
- java使用POI读取excel模版并向固定表格里填写数据详解编程语言
- 导入Excel数据到Oracle中的完美解决方案(oracle导入excel)
- 使用Excel快速读取MySQL数据(excel读取mysql)
- 微软 Office 更新 Word、Excel 等开始支持 WebP 图像格式
- 轻松导出:用SQL Server批量将数据导出到Excel(sqlserver导出excel)
- 将Excel表格数据导入MySQL数据库(excel到mysql)
- mssql数据快速转换称Excel格式(mssql转excel)
- 从Excel快速导入Oracle数据库(excel到oracle)
- 实现Redis数据批量导出至Excel(redis 转excel)
- C#如何将DataTable导出到Excel解决方案
- C#将htmltable导出成excel实例
- php备份数据库代码(生成word,excel,json,xml,sql)
- EXCEL数据上传到SQLSERVER中的简单实现方法
- php导出word文档与excel电子表格的简单示例代码
- javascript操作excel生成报表全攻略