Python遍历目录下文件、读取、千万条数据合并详情

 更新时间:2022年01月26日 09:02:58   作者:你隔壁的小王  
这篇文章主要介绍了Python遍历目录下文件、读取、千万条数据合并详情,对文件夹和文件进行属性判断,首先对文件夹进行遍历,看文件夹里有什么样的文件,读取出文件夹中的所有文件,下面文章将详细介绍该内容,需要的小伙伴可以参考一下

一、使用Python进行文件和文件夹的判断

  • 递归 :主要目的就是遍历文件夹和文件
  • 对文件夹和文件进行属性判断
  • 首先对文件夹进行遍历,看文件夹里有什么样的文件,读取出文件夹中的所有文件
import os
path= "./data" #路径
files = os.listdir(path)
#os.listdir() 方法用于返回指定的文件夹包含的文件或文件夹的名字的列表。
for file in files:
    print(file)
    if os.path.isfile(path+ "/"+file):
        #os.path.isfile(path) 判断路径是否为文件
        print('file'+'这是一个文件')
        filename,extension = os.path.splitext(file)
        #分割路径,返回路径名和文件扩展名的元组
        if extension == ".txt":
            print(filename+'这是一个文本文件')
        elif extension == ".xlsx":
            print(filename+'这是一个excel文件')
    if os.path.isdir(path + "/" +file):
        print(file+"是一个文件夹")

读取结果:

二、使用Python完整的获取所有文件及文件夹并读取相应的文件

在我们遍历文件夹的基础上,如何实现快速读取指定文件,提高工作效率?
只需要在上述代码的基础上,导入pandas包,read_excel_我们所需要的文件即可

import pandas as pd
import os 
path = './data'
def get_all_files(path):
    print('-'*25+'函数被调用'+'-'*25)
    files = os.listdir(path)
#os.listdir() 方法用于返回指定的文件夹包含的文件或文件夹的名字的列表。
    for file in files:
        if os.path.isfile(path+ "/"+file):
            #os.path.isfile(path) 判断路径是否为文件
            print('file'+">>>>>是文件")
            filename,extension = os.path.splitext(file)
            #分割路径,返回路径名和文件扩展名的元组
            if extension == ".txt":
                print(filename+"#####是文本文件#####")
                print("读取"+filename+"文件中的内容...........")
                data = pd.read_table(path+'/'+file)
                print(data)
            elif extension == ".xlsx":
                print(filename+'#####是Excel文件#####')
                print("读取"+filename+"文件中的内容...........")
                data = pd.read_excel(path+'/'+file)
                print(data)
            elif extension == ".csv":
                print(filename+'#####是csv文件#####')
                print("读取"+filename+"文件中的内容...........")
                data = pd.read_csv(path+'/'+file)
                print(data)
        if os.path.isdir(path + "/" +file):
            print(file+"¥¥¥¥¥¥¥是文件夹¥¥¥¥¥¥¥")
            get_all_files(path+'/'+file)
get_all_files(path)    

读取成功! 

三、使用Python合并数据

在日常工作中我们有很多表格需要处理,如何批量的将很多个文件夹中的表格合并到一起?

重点:

DataFrame.append(*other*, *ignore_index=False*, *verify_integrity=False*, *sort=None*)

append的使用

  • other: 是要添加的数据,append很不挑食,这个other可以是dataframe,dict,Seris,list等等。
  • ignore_index: 参数为True时将在数据合并后,按照0,1,2,3....的顺序重新设置索引,忽略了旧索引。
  • verify_integrity:参数为True时,如果合并的数据与原数据包含索引相同的行,将报错。
path='./project_data'
 ## 声明一个空的DataFrame,用来做最终的数据合并
final_data = pd.DataFrame()
# 声明一个空的DataFrame,用来做最终的数据合并
final_data = pd.DataFrame()
 
def get_all_files(path):
    global final_data
    print("-"*20 + "函数被调用" + "-"*20)
    files = os.listdir(path)
    for file in files:
        if os.path.isfile(path + "/" +file):
            print(file+">>>>>是文件")
            filename,extension=os.path.splitext(file)
            # 判断是不是文本文件
            if extension == ".txt" :
                print(filename+"#####是文本文件#####")
                print("读取"+filename+"文件中的内容...........")
                data = pd.read_table(path+'/' +file)
                print(data)
            elif extension=='.xlsx':
                print(filename+"#####是Excel文件#####")
                print("读取"+filename+"文件中的内容...........")
                data = pd.read_excel(path+'/' +file)
                print(data)
            elif extension=='.csv':
                print(filename + "是csv文件,是本次需要处理的文件")
                # 获取文件内容
                file_data = pd.read_csv(path +'/'+file)
                final_data = final_data.append(file_data,ignore_index=True)
                #append描述:在列表ls最后(末尾)添加一个元素object
                print("《《《《合并"+filename+"文件数据》》》》")
                
        # 判断是不是文件夹
        elif os.path.isdir(path+'/'+file):
            print(file + "¥¥¥¥是文件夹¥¥¥¥¥¥")
            get_all_files(path + '/' + file)
get_all_files(path)
print("数据合并完成")

开始合并,我们来查看一下合并后的数据:

 总共1000多万条数据,如果我们用Excel的话估计要很多时间将这么多表格合并,而且会很卡,

到此这篇关于Python遍历目录下文件、读取、千万条数据合并详情的文章就介绍到这了,更多相关Python遍历目录下的文件内容请搜索脚本之家以前的文章或继续浏览下面的相关文章希望大家以后多多支持脚本之家!

相关文章

  • Python 函数编编程的三大法宝map+filter+reduce分享

    Python 函数编编程的三大法宝map+filter+reduce分享

    这篇文章主要介绍了Python 函数编编程的三大法宝map,filter,reduce的分享,python利用 map 在一个可迭代对象的各项上调用函数的工具;利用 filter 来过滤项;利用 reduce 把函数作用在成对的项上来运行结果的工具,下面我们就来对这三者进行详细的介绍,需要的朋友可以参考下
    2022-03-03
  • Python中列表,元组,字典和集合的区别及它们之间的转换

    Python中列表,元组,字典和集合的区别及它们之间的转换

    这篇文章主要介绍了Python中列表,元组,字典和集合的区别及它们之间的转换方式,具有很好的参考价值,希望对大家有所帮助。如有错误或未考虑完全的地方,望不吝赐教
    2022-05-05
  • 胶水语言Python与C/C++的相互调用的实现

    胶水语言Python与C/C++的相互调用的实现

    这篇文章主要介绍了胶水语言Python与C/C++的相互调用的实现,文中通过示例代码介绍的非常详细,对大家的学习或者工作具有一定的参考学习价值,需要的朋友们下面随着小编来一起学习学习吧
    2021-05-05
  • 关于python3中setup.py小概念解析

    关于python3中setup.py小概念解析

    这篇文章主要介绍了关于python3中setup.py小概念解析,文中通过示例代码介绍的非常详细,对大家的学习或者工作具有一定的参考学习价值,需要的朋友可以参考下
    2019-08-08
  • Python正则匹配判断手机号是否合法的方法

    Python正则匹配判断手机号是否合法的方法

    今天小编就为大家分享一篇Python正则匹配判断手机号是否合法的方法,具有很好的参考价值,希望对大家有所帮助。一起跟随小编过来看看吧
    2018-12-12
  • 谈一谈基于python的面向对象编程基础

    谈一谈基于python的面向对象编程基础

    在本篇内容中我们给大家整理了关于python面向对象编程基础的观点分析以及知识点整理,有需要的朋友们学习下。
    2019-05-05
  • matplotlib一维散点分布图的实现

    matplotlib一维散点分布图的实现

    本文主要介绍了matplotlib一维散点分布图的实现,文中通过示例代码介绍的非常详细,对大家的学习或者工作具有一定的参考学习价值,需要的朋友们下面随着小编来一起学习学习吧
    2023-03-03
  • python利用拉链法实现字典方法示例

    python利用拉链法实现字典方法示例

    这篇文章主要介绍了python利用拉链法实现字典的方法,文中给出了详细的示例代码,相信对大家具有一定的参考价值,需要的朋友可以们下面来一起看看吧。
    2017-03-03
  • python 多线程重启方法

    python 多线程重启方法

    今天小编就为大家分享一篇python 多线程重启方法,具有很好的参考价值,希望对大家有所帮助。一起跟随小编过来看看吧
    2019-02-02
  • python实现mean-shift聚类算法

    python实现mean-shift聚类算法

    这篇文章主要为大家详细介绍了python实现mean-shift聚类算法,文中示例代码介绍的非常详细,具有一定的参考价值,感兴趣的小伙伴们可以参考一下
    2020-06-06

最新评论