Pandas 计算相关性系数corr()方式

 更新时间:2022年07月16日 10:37:49   作者:胡桃の壶  
这篇文章主要介绍了Pandas 计算相关性系数corr()方式,具有很好的参考价值,希望对大家有所帮助。如有错误或未考虑完全的地方,望不吝赐教

Pandas 计算相关性系数corr()

相关:数据之间有关联,相互有影响

如:A和B 存在一定的相关性,A对B存在一定程度的影响,A变化,B也会有一定的变化

  • 如果A和B相等 或者 B可以由A经过计算得到---->完全相关
  • 如果B是由 A和C计算得到 ---->并且 A可以计算出B的大部分 -----> A和B 强度相关
  • 如果B是由 A和C计算得到 ---->并且 A可以计算出B的小部分 -----> A和B 弱度相关
  • 如果 A和B 毫无关系 ----> 不相关

如果B和 A相关:

  • A的增大导致B的减小 —> 负相关
  • A的增大导致B的增大 —> 正相关

相关性系数:衡量相关性强弱的

其范围是[-1,1],绝对值越靠近0,表示不相关,绝对值越靠近1,表示相关性越强

小于 0 表示负相关;大于 0 表示正相关。

构造如下数据

import pandas as pd

data = pd.DataFrame(
    data={
        'age': [2,7,10,16,20],
        'height': [70,90,143,166,178],
        'score': [98,37,103,76,53]
    }
)

使用corr()方法计算相关性系数:

# 计算相关性系数的列 必须都是数值型的数据!
corr = data.loc[:, ["age","height"]].corr()        # 会计算两两列之间的相关性系数
print("corr\n", corr)
"""
corr
            age   height
age     1.00000  0.96043
height  0.96043  1.00000
"""

自身与自身的相关性系数为 1

计算多列相关性系数:

corr = data.loc[:, ["age","height","score"]].corr()
print("corr\n", corr)
"""
corr
             age    height     score
age     1.000000  0.960430 -0.340053
height  0.960430  1.000000 -0.096782
score  -0.340053 -0.096782  1.000000
"""

pandas相关系数-DataFrame.corr()参数

DataFrame.corr(method='pearson', min_periods=1)

参数说明

  • method:可选值为{‘pearson’, ‘kendall’, ‘spearman’}
  • pearson:Pearson相关系数来衡量两个数据集合是否在一条线上面,即针对线性数据的相关系数计算,针对非线性数据便会有误差。
  • kendall:用于反映分类变量相关性的指标,即针对无序序列的相关系数,非正太分布的数据
  • spearman:非线性的,非正太分布的数据的相关系数
  • min_periods:样本最少的数据量
  • 返回值:各类型之间的相关系数DataFrame表格。

为区分不同参数之间的区别,我们实验如下:

from pandas import DataFrame
import pandas as pd
x=[a for a in range(100)]
#构造一元二次方程,非线性关系
def y_x(x):
    return 2*x**2+4
y=[y_x(i) for i in x]
 
data=DataFrame({'x':x,'y':y})
 
#查看下data的数据结构
data.head()
Out[34]: 
   x   y
0  0   4
1  1   6
2  2  12
3  3  22
4  4  36
 
data.corr()
Out[35]: 
          x         y
x  1.000000  0.967736
y  0.967736  1.000000
 
data.corr(method='spearman')
Out[36]: 
     x    y
x  1.0  1.0
y  1.0  1.0
 
data.corr(method='kendall')
Out[37]: 
     x    y
x  1.0  1.0
y  1.0  1.0

因为y经由函数构造出来,x和y的相关系数为1,但从实验结构可知pearson系数,针对非线性数据有一定的误差。

需要说明,数据之间的相关关系,并不代表其之间的因果关系,相关系数为1,只能说明二者之间具备完全相关性,但不能说y是x的果。

以上为个人经验,希望能给大家一个参考,也希望大家多多支持脚本之家。

相关文章

  • 创建SparkSession和sparkSQL的详细过程

    创建SparkSession和sparkSQL的详细过程

    SparkSession 是 Spark SQL 的入口,Builder 是 SparkSession 的构造器。 通过 Builder, 可以添加各种配置,并通过 stop 函数来停止 SparkSession,本文给大家分享创建SparkSession和sparkSQL的详细过程,一起看看吧
    2021-08-08
  • python如何将两个txt文件内容合并

    python如何将两个txt文件内容合并

    这篇文章主要为大家详细介绍了python如何将两个txt文件内容合并,文中示例代码介绍的非常详细,具有一定的参考价值,感兴趣的小伙伴们可以参考一下
    2019-10-10
  • 在django中使用post方法时,需要增加csrftoken的例子

    在django中使用post方法时,需要增加csrftoken的例子

    这篇文章主要介绍了在django中使用post方法时,需要增加csrftoken的例子,具有很好的参考价值,希望对大家有所帮助。一起跟随小编过来看看吧
    2020-03-03
  • Python实现的选择排序算法原理与用法实例分析

    Python实现的选择排序算法原理与用法实例分析

    这篇文章主要介绍了Python实现的选择排序算法,简单描述了选择排序的原理,并结合实例形式分析了Python实现与应用选择排序的具体操作技巧,需要的朋友可以参考下
    2017-11-11
  • Python中psutil模块使用汇总

    Python中psutil模块使用汇总

    psutil模块是一个跨平台库,用于检索Python中运行进程和系统利用率(CPU、内存、磁盘、网络、传感器)的信息。它主要用于系统监视、分析和限制进程资源以及管理正在运行的进程,本文给大家介绍Python中psutil模块使用汇总,感兴趣的朋友一起看看吧
    2021-12-12
  • 点云地面点滤波(Cloth Simulation Filter, CSF)

    点云地面点滤波(Cloth Simulation Filter, CSF)

    这篇文章主要介绍了点云地面点滤波(Cloth Simulation Filter, CSF)“布料”滤波算法介绍,本文从基本思想到实现思路一步步给大家讲解的非常详细,需要的朋友可以参考下
    2021-08-08
  • Python之is与==的区别详解

    Python之is与==的区别详解

    这篇文章主要介绍了Python之is与==的区别详解,本篇文章通过简要的案例,讲解了该项技术的了解与使用,以下就是详细内容,需要的朋友可以参考下
    2021-09-09
  • pygame实现弹力球及其变速效果

    pygame实现弹力球及其变速效果

    这篇文章主要为大家详细介绍了pygame实现弹力球及其变速效果,具有一定的参考价值,感兴趣的小伙伴们可以参考一下
    2017-07-07
  • tf.concat中axis的含义与使用详解

    tf.concat中axis的含义与使用详解

    今天小编就为大家分享一篇tf.concat中axis的含义与使用详解,具有很好的参考价值,希望对大家有所帮助。一起跟随小编过来看看吧
    2020-02-02
  • Python使用uuid库生成唯一标识ID

    Python使用uuid库生成唯一标识ID

    这篇文章主要介绍了Python使用uuid模块生成唯一标识ID,需要的朋友可以参考下
    2020-02-02

最新评论