您现在的位置是：首页 > Python

当前栏目

用 Python 删除文件中的乱码

Python 文件代码

2023-03-31 10:30:30 时间

当我们用 Python 来处理有乱码的文件时，经常会遇到编码错误，有时候不得不加一个 errors = 'ignore' 参数来忽略错误，今天分享一下如何用 Python 来删除这些乱码，得到一个干净的文件。

先说下思路：用二进制方式打开文件，这样就不会出现编码问题，然后读取每一个字节，只要这个字节不在我们使用编码的范围内，就把它踢掉，然后保存剩下的字节，我们得到的就是一个干净的文件。

比如说这样 ascii 编码的文件，它含有乱码：

处理之后是这样的：

代码是这样写的：

import struct 

def is_good_byte(b):
    """
    可以自定义什么是好字节，比如 GBK 的字节范围可以在这里定义好
    """
    return b <= 127

def clean_bytes(bs):
    return filter(is_good_byte, bs)

def clean_file_bin():
    with open("names.txt", mode = "rb") as reader:
        with open("cleaned_names.txt", mode = "wb") as writer:
            for line in reader:
                for byte in clean_bytes(line):
                    writer.write(struct.pack('B',byte))

if __name__ == '__main__':
    clean_file_bin()

上面这段代码是一个字节一个字节来处理的，如果是多字节编码，可以自行修改代码逻辑，比如一次读取 3 个字节，判断这三个字节是否一个合法的字节组合。

对于中英文混合的，比如：

>>> x
'abc中国'
>>> x.encode("GBK")
b'abcxd6xd0xb9xfa'
>>> for i in x.encode("GBK"):
...     print(i)
...
97
98
99
214
208
185
250
>>>

需要综合判断，先判断是否英文字母，是的就放行，然后看接下来的两个字节是否在 GBK 的编码范围之内，是的就放行，不是就要删除，看看是删除一个字节，还是两个字节就要继续判断了。删除的依据就是不会造成更多乱码。

猜你喜欢

Python中的函数与方法以及Bound Method和Unbound Method
从本体论开始说起——运营商关系图谱的构建及应用
一篇运维老司机的大数据平台监控宝典（2）-联通大数据集群平台监控体系详解
一篇运维老司机的大数据平台监控宝典（1）-联通大数据集群平台监控体系进程详解
Flask中的请求上下文和应用上下文
深入探讨Java中的异常与错误处理
研究学习Kotlin的一些方法
如何成为一名数据科学家？
金融服务领域的大数据：即时分析
影响大数据、机器学习和人工智能未来发展的8个因素
从未见过的堂兄杀了人，你的DNA是关键证据
一文贯通python文件读取
数据显示Java热度持续下落，日子屈指可数？
从0开始构建一个属于你自己的PHP框架
如何将Hadoop集成到工作流程中？这6个优秀实践必看
2017年5月编程语言排行榜：Java与C语言优势正开始缩小
SEO公司使用大数据优化其模型的5种方法
Java多线程之内置锁与显示锁
关于Web Workers你需要了解的七件事
20个安全可靠的免费数据源，各领域数据任你挑

zl程序教程

当前栏目

用 Python 删除文件中的乱码

相关文章