如何用Python寻找重复文件并删除

最新推荐文章于 2024-03-29 19:37:24 发布

slowtech

最新推荐文章于 2024-03-29 19:37:24 发布

阅读量2.4k

点赞数

本文链接：https://blog.csdn.net/slowtech/article/details/50846947

版权

本文介绍了如何使用Python脚本来查找并删除重复文件。通过diskwalk模块遍历文件，chechsum模块计算MD5值，find_dupes找到重复文件，delete模块提供不同删除选项，包括直接删除、试运行和交互模式，确保用户需求得到充分考虑。

摘要由CSDN通过智能技术生成

在实际生活中，经常会有文件重复的困扰，即同一个文件可能既在A目录中，又在B目录中，更可恶的是，即便是同一个文件，文件名可能还不一样。在文件较少的情况下，该类情况还比较容易处理，最不济就是one by one的人工比较——即便如此，也很难保证你的眼神足够犀利。倘若文件很多，这岂不是个impossible mission？最近在看《Python UNIX和Linux系统管理指南》，里面就有有关“数据比较”的内容，在其基础上，结合实际整理如下。

该脚本主要包括以下模块:diskwalk,chechsum,find_dupes,delete。其中diskwalk模块是遍历文件的，给定路径，遍历输出该路径下的所有文件。chechsum模块是求文件的md5值。find_dupes导入了diskwalk和chechsum模块，根据md5的值来判断文件是否相同。delete是删除模块。具体如下：

1. diskwalk.py

import os,sys
class diskwalk(object):
        def __init__(self,path):
                self.path = path
        def paths(self):
                path=self.path
                path_collection=[]
                for dirpath,dirnames,filenames in os.walk(path):
                        for file in filenames:
                                fullpath=os.path.join(dirpath,file)
                                path_collection.append(fullpath)
                return path_collection
if