盘点Python中4种读取json文件和提取json文件内容的方法
前言
前几天在才哥的交流群有个叫【杭州-学生-飞飞飞】的粉丝在群里问了一个json文件处理的问题。
看上去他只需要follower和ddate这两个字段下的对应的值。
我们知道json是一种常见的数据传输形式,所以对于爬取数据的数据解析,json的相关操作是比较重要的,能够加快我们的数据提取效率。
思路
关于这个问题,倒不是很难,群里提出了三个方法,第一个是才哥说的pd处理或者正则表达式,第二个是小编自己提出的json处理,第三个是【成都-IT技术支持-小王】提出的jsonpath,总之方法很多,这里给出4个处理方法,希望下次粉丝们再遇到类似问题的时候,有章可循。
实现过程
1、正则表达式
这个方法可以看看,通过匹配的方法进行提取,代码如下所示:
import re
import json
file = open('漫画.txt', 'r', encoding='utf-8')
content = file.readline()
ddate_result1 = re.findall('"ddate":"(d+-d+-d+)"', content)
ddate_result2 = re.findall('"ddate":"(.*?)"', content)
follower_result1 = re.findall('"follower":(d+),"', content)
print(ddate_result1)
print(ddate_result2)
print(follower_result1)
运行之后,可以得到结果:
关于ddate,follower获取的方法肯定还有很多其他写法,这里只是抛砖引玉,欢迎大家多多尝试。
2、jsonpath方法一
关于jsonpath的用法,之前在这篇文章中有提及,感兴趣的小伙伴也可以去看看:数据提取之JSON与JsonPATH。
下面是【成都-IT技术支持-小王】大佬给的代码:
from jsonpath import jsonpath
import json
"""follower和ddate"""
with open("漫画.txt", encoding="utf-8") as file:
file_json = json.loads(file.readline())
follower = jsonpath(file_json, "$..follower")
ddate = jsonpath(file_json, "$..ddate")
print(follower)
print(ddate)
代码运行之后,就会得到想要的数据,如下图所示:
这个..就和xpath里面的//一样,子孙节点,$是根节点。
3、jsonpath方法二
这个是另外一个用法了,小号【皮皮】提供的,直接上代码。
import json
import jsonpath
# obj = json.load(open('罗翔.json', 'r', encoding='utf-8')) # 注意,这里是文件的形式,不能直接放一个文件名的字符串
file = open('漫画.txt', 'r', encoding='utf-8') # 注意,这里是文件的形式,不能直接放一个文件名的字符串
obj = json.loads(file.readline())
follower = jsonpath.jsonpath(obj, '$..follower') # 文件对象 jsonpath语法
ddate = jsonpath.jsonpath(obj, '$..ddate') # 文件对象 jsonpath语法
print(follower)
print(ddate)
代码运行之后,也可以得到预期的结果。
当然了,如果你的文件本来就是json文件,也可以直接读取,代码类似:
import json
import jsonpath
obj = json.load(open('罗翔.json', 'r', encoding='utf-8')) # 注意,这里是文件的形式,不能直接放一个文件名的字符串
# file = open('罗翔.json', 'r', encoding='utf-8') # 注意,这里是文件的形式,不能直接放一个文件名的字符串
# obj = json.loads(file.readline())
follower = jsonpath.jsonpath(obj, '$..follower') # 文件对象 jsonpath语法
ddate = jsonpath.jsonpath(obj, '$..ddate') # 文件对象 jsonpath语法
print(follower)
print(ddate)
运行之后,也可以得到预期的结果:
4、jsonpath方法三
这个是群里【深圳-Hua Bro】华博提供的,代码如下:
import json
import jsonpath
with open("罗翔.txt", 'r', encoding="UTF-8") as fr:
file_json = eval(fr.read().replace('
u200b', '')) # 读取的str转为字典
follower = jsonpath.jsonpath(file_json, '$..follower') # 文件对象 jsonpath语法
ddate = jsonpath.jsonpath(file_json, '$..ddate') # 文件对象 jsonpath语法
print(follower)
print(ddate)
方法大同小异,运行之后,也可以拿到预取的目标数据,如下图所示。
总结
我是Python进阶者。本文基于粉丝针对json文件处理的提问,综合群友们的回答,整理了4种可行的方案,帮助粉丝解决了问题。这里墙裂给大家推荐jsonpath这个库,感兴趣的小伙伴可以学习学习,下次再遇到json文件提取数据就再也不慌啦!
最后感谢粉丝【杭州-学生-飞飞飞】提问,感谢【才哥】、【成都-IT技术支持-小王】、【深圳-Hua Bro】和小编提供的思路和代码。文中提供了4种方法,亲测可行,小编相信肯定还有其他的方法的,也欢迎大家在评论区谏言。
如果需要本文的json文件做测试的话,可以前往小编的git进行获取。小编git地址:https://github.com/cassieeric/DataAnalysis/tree/main/json_file_process
,
相关文章
- Python使用tkinter组件Label显示简单数学公式
- 内网渗透之DCOM横向移动
- 以目标为导向的语义交流的共同语言——一个课程学习框架
- python爬虫前奏【成信笔记】
- HTML 5 File API:文件拖放上传功能
- 教你快速创建 Python 虚拟环境
- pyenv 实现Python多版本自由切换
- 用 Python 对 Excel文件进行批量操作
- Python - 接入钉钉机器人
- Python - 抓取 iphone13 pro 线下店供货信息并发送到钉钉机器人,最后设置为定时任务
- crontab - 解决 mac 下通过 crontab 设置了 Python 脚本的定时任务却无法运行
- [源码解析] PyTorch分布式(5) ------ DistributedDataParallel 总述&如何使用
- Python科普系列——类与方法(上篇)
- SAP对STO的交货单执行PGI,报错 -Fld selectn for mvmt type 643 acct 400020 differs
- Spring Boot 实现通用 Auth 认证的 4 种方式
- 盘点4种使用Python批量合并同一文件夹内所有子文件夹下的Excel文件内所有Sheet数据
- OushuDB 学习经验分享(三):技术特点
- Java和Python思维方式的不同之处
- Python中日志记录新技能
- 奥比中光Gemini OpenCV—Python使用