python实现两个文件夹的同步

更新时间：2019年08月29日 10:44:57 作者：Geek_Arking

这篇文章主要为大家详细介绍了利用python实现两个文件夹的同步，具有一定的参考价值，感兴趣的小伙伴们可以参考一下

其实无论windows还是Linux，简单地去实现两个两个文件夹的同步只需系统自带的复制命令加参数就可以了。

WINDOWS：

xcopy 源文件夹\* 目标文件夹 /s /e /y

Linux：

cp -r 源文件夹/* 目标文件夹

这里使用python来实现这些基本功能，并增加一些去重之类的增强功能。

1、复制源文件夹中文件至目标文件夹

要想同步两个文件夹中的数据，基本思路首先需要遍历源文件夹中的信息，将源文件夹中的文件复制到目标文件夹。

遍历文件夹采用os中的listdir函数就可以了。

import os
 
path_s = 'F:\\test\\s'
path_t = 'F:\\test\\t'
 
for filename in os.listdir(path_s):
 filename_s = path_s+os.sep+filename
 print '[*] Source :',filename_s
 filename_t = path_t+os.sep+filename
 print '[*] Target :',filename_t
 with open(filename_s,'rb') as f_s:
 with open(filename_t,'wb') as f_t:
  f_t.write(f_s.read())

但是很明显这里没有考虑源文件夹中还会存在文件夹甚至多重文件夹的情况。

2、源文件夹中存在多重文件夹

一个简单的思路就是：在遍历源文件夹内的文件时，先判定当前文件这是文件还是文件夹。如果当前文件是文件夹的话，开始遍历此文件夹内的文件，如果里面还有文件夹，遍历这个文件夹，依次类推。利用递归的方法，代码如下：

import os
 
 
path_s = 'F:\\test\\s'
path_t = 'F:\\test\\t'
 
def copy_file(paths,patht):
 for filename in os.listdir(paths):
 filename_s = paths+os.sep+filename
 filename_t = patht+os.sep+filename
 if os.path.isdir(filename_s):
  if not os.path.exists(filename_t):
  os.mkdir(filename_t) #在目标文件夹中创建对应的文件夹
  copy_file(filename_s,filename_t) # 递归
 else:
  print '[*] Source :',filename_s
 
  print '[*] Target :',filename_t
  with open(filename_s,'rb') as f_s:
  with open(filename_t,'wb') as f_t:
   f_t.write(f_s.read())
 
 
copy_file(path_s,path_t)

目前，简单的文件夹复制功能已经实现了。

3、目标文件夹中已有文件不再复制

一个简单的方法就是在目标文件夹中复制文件之前先利用函数“os.path.exists”判定这个文件是否存在。

import os
 
 
path_s = 'F:\\test\\s'
path_t = 'F:\\test\\t'
 
def copy_file(paths,patht):
 for filename in os.listdir(paths):
 filename_s = paths+os.sep+filename
 filename_t = patht+os.sep+filename
 if os.path.isdir(filename_s):
  if not os.path.exists(filename_t):
  os.mkdir(filename_t)
  copy_file(filename_s,filename_t)
 else:
  if os.path.exists(filename_t):
  print '[*] "%s" already exists! ' % filename_t
  else:
  print '[*] Source :',filename_s
 
  print '[*] Target :',filename_t
  with open(filename_s,'rb') as f_s:
   with open(filename_t,'wb') as f_t:
   f_t.write(f_s.read())
 
copy_file(path_s,path_t)

这个办法避免了一部分已有文件的重复复制操作，减少了部分不必要的读写操作，但是却无法消除内容相同但名称、路径不同的重复文件。

4、利用MD5判定重复文件

目前判定两个文件是否相同，除了按字节逐个对比这个笨方法外，简单常用的办法就是利用MD5和CRC校验，或是按一定规律挑取文件的指定位置的数据块就行对比。

这次利用文件的MD5值，将目标文件夹中已有文件的MD5值保存到列表或字典中，每在源文件夹中读取一个文件就判定该文件的MD5值是否已经存在于MD5列表，没有的话再进行复制操作，并将该文件的MD5值写入列表。

import os
import hashlib
 
path_s = 'F:\\test\\s'
path_t = 'F:\\test\\t'
list_file = {}
 
def create_file_list(path):
 for name in os.listdir(path):
 filename = path+os.sep+name
 if os.path.isdir(filename):
  create_file_list(filename)
 else:
  with open(filename,'rb') as f:
  md5 = hashlib.md5(f.read()).hexdigest()
  if md5 not in list_file:
   list_file[md5] = 1
 
def copy_file(paths,patht):
 for filename in os.listdir(paths):
 filename_s = paths+os.sep+filename
 filename_t = patht+os.sep+filename
 if os.path.isdir(filename_s):
  if not os.path.exists(filename_t):
  os.mkdir(filename_t)
  copy_file(filename_s,filename_t)
 else:
  if os.path.exists(filename_t):
  print '[*] "%s" already exists! ' % filename_t
  else:
  with open(filename_s,'rb') as f_s:
   data = f_s.read()
   file_md5 = hashlib.md5(data).hexdigest()
   if file_md5 not in list_file:
   list_file[file_md5] = 1
   print '[*] Source :',filename_s
   print '[*] Target :',filename_t
   with open(filename_t,'wb') as f_t:
    f_t.write(data)
   else:
   print '[*] "%s"\'s MD5 already exists! ' % filename_t
 
create_file_list(path_t)
copy_file(path_s,path_t)

如下图，运行后内容相同的几个文件，只有第一次读取到的时候才写入目标文件夹，其他路径下的文件并没有复制到目标文件夹。

以上就是本文的全部内容，希望对大家的学习有所帮助，也希望大家多多支持脚本之家。

您可能感兴趣的文章:

python 解决动态的定义变量名,并给其赋值的方法(大数据处理)
今天小编就为大家分享一篇python 解决动态的定义变量名,并给其赋值的方法(大数据处理)，具有很好的参考价值，希望对大家有所帮助。一起跟随小编过来看看吧
2018-11-11
Python中的请求重试策略深入探讨
在网络通信中,由于各种原因,请求可能会失败,为了增加程序的健壮性和可靠性,实现一个优雅的请求重试策略是至关重要的,本文将深入探讨如何在Python中实现优雅的请求重试,通过丰富的示例代码和详细的解释,帮助大家更好地理解和应用重试机制
2024-01-01
numpy matrix和array的乘和加实例
今天小编就为大家分享一篇numpy matrix和array的乘和加实例，具有很好的参考价值，希望对大家有所帮助。一起跟随小编过来看看吧
2018-06-06
python 利用zmail库发送邮件
这篇文章主要介绍了python 如何利用zmail库发送邮件，帮助大家更好的理解和学习python，感兴趣的朋友可以了解下
2020-09-09
Python 遍历子文件和所有子文件夹的代码实例
本篇文章主要介绍了Python 遍历子文件和所有子文件夹的代码实例，具有一定的参考价值，感兴趣的小伙伴们可以参考一下。
2016-12-12
Pycharm学习教程（6） Pycharm作为Vim编辑器使用
这篇文章主要为大家详细介绍了最全的Pycharm学习教程第六篇，Pycharm作为Vim编辑器使用，具有一定的参考价值，感兴趣的小伙伴们可以参考一下
2017-05-05
在Python3中使用asyncio库进行快速数据抓取的教程
这篇文章主要介绍了在Python3中使用asyncio进行快速数据抓取,asyncio是一个异步IO库,运行效率较高,需要的朋友可以参考下
2015-04-04
Numpy中的shape、reshape函数的区别
本文主要介绍了Numpy中的shape、reshape函数的区别，文中通过示例代码介绍的非常详细，对大家的学习或者工作具有一定的参考学习价值，需要的朋友们下面随着小编来一起学习学习吧
2022-07-07
Python利用Turtle绘制虎年图像
2022年是农历壬寅虎年，在自然界中，虎有“百兽之王”之称。本文也将利用Python中的Turtle绘制一个卡通的虎年图像，感兴趣的可以学习一下
2022-01-01
python+Django实现防止SQL注入的办法
这篇文章主要介绍了python+Django实现防止SQL注入的办法，文中通过示例代码介绍的非常详细，对大家的学习或者工作具有一定的参考学习价值，需要的朋友们下面随着小编来一起学习学习吧
2019-10-10