详解如何使用Python实现删除重复文件

 更新时间:2022年10月09日 15:30:50   作者:冫马讠成  
这篇文章主要为大家详细介绍了如何利用Python实现删除重复文件功能,文中的示例代码讲解详细,对我们学习Python有一定帮助,需要的可以参考一下

Python自动化办公之删除重复文件

思路介绍

两层判断:

1.先判断文件大小是否为相同,大小不同则不是重复文件,予以保留;

2.文件大小相同再判断文件md5,md5相同,则是重复文件,予以删除。

源码解说

from pathlib import Path
import hashlib


def getmd5(filename):
    # 接收文件路径,返回文件md5值
    with open(filename, 'rb') as f:
        data = f.read()
    file_md5 = hashlib.new("md5", data).hexdigest()
    return file_md5


def main():
    path = r"F:\FileRecv\删除文件测试"
    all_size = {}
    total_file = 0
    total_delete = 0

    # 获取路径内的所有文件名,默认是升序排列,相同文件将会保留日期时间最新的
    all_files = Path(path).glob('*.*')

    # 降序排列,相同文件将会保留文件名最短的(即日期时间最久的)
    all_files = sorted(all_files, reverse=True)

    # 遍历文件路径内的所有文件
    for file in all_files:
        # 获取文件所占字节大小,作为数据字典的键
        size = file.stat().st_size
        # name_and_md5列表用于存储文件绝对路径和md5值,作为数据字典的值
        name_and_md5 = [file, '']

        # 针对重复文件进行处理,生成字典存储相关信息
        # 字典all_size中key是size,value是name_and_md5列表
        # 针对相同size的文件,再调用getmd5函数,获取文件的md5值
        # 文件size不同(不在all_size.keys()中),则自动判断为不同的文件,予以保留
        if size in all_size.keys():
            # 调用getmd5函数,获取文件的md5值
            new_md5 = getmd5(file)
            if all_size[size][1] == '':
                all_size[size][1] = getmd5(all_size[size][0])
            # 判断md5值存在,即文件重复,则删除文件。md5值不存在,则把md5值加入列表中
            if new_md5 in all_size[size]:
                file.unlink()
                total_delete += 1
            else:
                all_size[size].append(new_md5)
        else:
            all_size[size] = name_and_md5
        total_file += 1

    print(f'文件总数:{total_file}')
    print(f'删除个数:{total_delete}')


if __name__ == '__main__':
    main()

效果图:

代码说明:特别感谢瑜亮老师提供的代码!

知识拓展

pathlib和os,os.path常用的函数对应关系

pathlib常用方法介绍:

Path(path).name  # 返回文件名+文件后缀

Path(path).stem  # 返回文件名

Path(path).suffix  # 返回文件后缀

Path(path).suffixes  # 返回文件后缀列表

Path(path).root  # 返回根目录

Path(path).parts  # 返回文件

Path(path).anchor  # 返回根目录

Path(path).parent  # 返回父级目录

Path(path).parents  # 返回所有上级目录的列表

Path.exists()  # 判断 Path 路径是否是一个已存在的文件或文件夹

Path.is_dir()  # 判断 Path 是否是一个文件夹

Path.is_file()  # 判断 Path 是否是一个文件

Path.mkdir()  # 创建文件夹

Path.rmdir()  # 删除文件夹,文件夹必须为空

Path.unlink()  # 删除文件

到此这篇关于详解如何使用Python实现删除重复文件的文章就介绍到这了,更多相关Python删除重复文件内容请搜索脚本之家以前的文章或继续浏览下面的相关文章希望大家以后多多支持脚本之家!

相关文章

  • pyinstaller打包可执行文件,存放路径包含中文无法运行的解决方案

    pyinstaller打包可执行文件,存放路径包含中文无法运行的解决方案

    这篇文章主要介绍了pyinstaller打包可执行文件,存放路径包含中文无法运行的解决方案,具有很好的参考价值,希望对大家有所帮助。一起跟随小编过来看看吧
    2021-03-03
  • PyTorch与PyTorch Geometric的安装过程

    PyTorch与PyTorch Geometric的安装过程

    这篇文章主要介绍了PyTorch与PyTorch Geometric的安装,本文给大家介绍的非常详细,对大家的学习或工作具有一定的参考借鉴价值,需要的朋友可以参考下
    2023-04-04
  • Python必知必会之os模块实例详解

    Python必知必会之os模块实例详解

    os模块是Python标准库中整理文件和目录最为常用的模块,该模块提供了非常丰富的方法用来处理文件和目录,下面这篇文章主要给大家介绍了关于Python必知必会之os模块的相关资料,需要的朋友可以参考下
    2022-10-10
  • django 实现手动存储文件到model的FileField

    django 实现手动存储文件到model的FileField

    这篇文章主要介绍了django 实现手动存储文件到model的FileField,具有很好的参考价值,希望对大家有所帮助。一起跟随小编过来看看吧
    2020-03-03
  • python实现数字炸弹游戏程序

    python实现数字炸弹游戏程序

    这篇文章主要为大家详细介绍了python实现数字炸弹游戏程序,文中示例代码介绍的非常详细,具有一定的参考价值,感兴趣的小伙伴们可以参考一下
    2020-07-07
  • python 时间的访问和转换 time示例小结

    python 时间的访问和转换 time示例小结

    Python 的 time 模块提供了各种与时间处理相关的功能,包括获取当前时间、操作日期/时间以及执行与时间相关的各种其它功能,这篇文章主要介绍了python 时间的访问和转换 time,需要的朋友可以参考下
    2024-05-05
  • Django restframework 源码分析之认证详解

    Django restframework 源码分析之认证详解

    这篇文章主要介绍了Django-restframework 源码分析之认证详解,小编觉得挺不错的,现在分享给大家,也给大家做个参考。一起跟随小编过来看看吧
    2019-02-02
  • Python中高级语法糖的使用示例详解

    Python中高级语法糖的使用示例详解

    Python 是一门简洁而强大的编程语言,具备许多高级语法糖(syntactic sugar)功能,本文将介绍一些常见的Python高级语法糖,以及如何使用它们来提高代码质量和开发效率,需要的小伙伴可以参考下
    2024-01-01
  • 解决pytorch中的kl divergence计算问题

    解决pytorch中的kl divergence计算问题

    这篇文章主要介绍了解决pytorch中的kl divergence计算问题,具有很好的参考价值,希望对大家有所帮助。如有错误或未考虑完全的地方,望不吝赐教
    2021-05-05
  • Python中hash()函数之哈希值的奥秘详解

    Python中hash()函数之哈希值的奥秘详解

    hash()是Python 中的一个内置函数,用于计算对象的哈希值,哈希值是一个整数,用于唯一标识对象,下面这篇文章主要给大家介绍了关于Python中hash()函数之哈希值奥秘的相关资料,需要的朋友可以参考下
    2024-06-06

最新评论