Pandas 计算相关性系数corr()方式

更新时间：2022年07月16日 10:37:49 作者：胡桃の壶

这篇文章主要介绍了Pandas 计算相关性系数corr()方式，具有很好的参考价值，希望对大家有所帮助。如有错误或未考虑完全的地方，望不吝赐教

Pandas 计算相关性系数corr()

构造如下数据

import pandas as pd

data = pd.DataFrame(
    data={
        'age': [2,7,10,16,20],
        'height': [70,90,143,166,178],
        'score': [98,37,103,76,53]
    }
)

使用corr()方法计算相关性系数：

# 计算相关性系数的列 必须都是数值型的数据！
corr = data.loc[:, ["age","height"]].corr()        # 会计算两两列之间的相关性系数
print("corr\n", corr)
"""
corr
            age   height
age     1.00000  0.96043
height  0.96043  1.00000
"""

自身与自身的相关性系数为 1

计算多列相关性系数：

corr = data.loc[:, ["age","height","score"]].corr()
print("corr\n", corr)
"""
corr
             age    height     score
age     1.000000  0.960430 -0.340053
height  0.960430  1.000000 -0.096782
score  -0.340053 -0.096782  1.000000
"""

pandas相关系数-DataFrame.corr()参数

DataFrame.corr(method='pearson', min_periods=1)

参数说明

method：可选值为{‘pearson’, ‘kendall’, ‘spearman’}
pearson：Pearson相关系数来衡量两个数据集合是否在一条线上面，即针对线性数据的相关系数计算，针对非线性数据便会有误差。
kendall：用于反映分类变量相关性的指标，即针对无序序列的相关系数，非正太分布的数据
spearman：非线性的，非正太分布的数据的相关系数
min_periods：样本最少的数据量
返回值：各类型之间的相关系数DataFrame表格。

为区分不同参数之间的区别，我们实验如下：

from pandas import DataFrame
import pandas as pd
x=[a for a in range(100)]
#构造一元二次方程，非线性关系
def y_x(x):
    return 2*x**2+4
y=[y_x(i) for i in x]
 
data=DataFrame({'x':x,'y':y})
 
#查看下data的数据结构
data.head()
Out[34]: 
   x   y
0  0   4
1  1   6
2  2  12
3  3  22
4  4  36
 
data.corr()
Out[35]: 
          x         y
x  1.000000  0.967736
y  0.967736  1.000000
 
data.corr(method='spearman')
Out[36]: 
     x    y
x  1.0  1.0
y  1.0  1.0
 
data.corr(method='kendall')
Out[37]: 
     x    y
x  1.0  1.0
y  1.0  1.0

因为y经由函数构造出来，x和y的相关系数为1，但从实验结构可知pearson系数，针对非线性数据有一定的误差。

需要说明，数据之间的相关关系，并不代表其之间的因果关系，相关系数为1，只能说明二者之间具备完全相关性，但不能说y是x的果。

以上为个人经验，希望能给大家一个参考，也希望大家多多支持脚本之家。

您可能感兴趣的文章:

Python Selenium 设置元素等待的三种方式
这篇文章主要介绍了Python Selenium 设置元素等待的三种方式，文中通过示例代码介绍的非常详细，对大家的学习或者工作具有一定的参考学习价值，需要的朋友们下面随着小编来一起学习学习吧
2020-03-03
python在回调函数中获取返回值的方法
今天小编就为大家分享一篇python在回调函数中获取返回值的方法，具有很好的参考价值，希望对大家有所帮助。一起跟随小编过来看看吧
2019-02-02
opencv实现图片模糊和锐化操作
这篇文章主要为大家详细介绍了opencv实现图片模糊和锐化操作，文中示例代码介绍的非常详细，具有一定的参考价值，感兴趣的小伙伴们可以参考一下
2018-11-11
python用线性回归预测股票价格的实现代码
这篇文章主要介绍了python用线性回归预测股票价格的实现代码，文中通过示例代码介绍的非常详细，对大家的学习或者工作具有一定的参考学习价值，需要的朋友们下面随着小编来一起学习学习吧
2019-09-09
tornado+celery的简单使用详解
今天小编就为大家分享一篇tornado+celery的简单使用详解，具有很好的参考价值，希望对大家有所帮助。一起跟随小编过来看看吧
2019-12-12
python实现简单名片管理系统
这篇文章主要为大家详细介绍了python实现简单名片管理系统，具有一定的参考价值，感兴趣的小伙伴们可以参考一下
2018-11-11
利用python 制作词云特效详情
这篇文章主要介绍了利用python 制作词云特效详情，词云也是数据可视化的一种形，根据关键词的出现频率而生成的一幅图像，人们只要扫一眼就能够明白其文章主旨，下文详细介绍,需要的朋友可以参考一下
2022-04-04
Python迭代器iterator生成器generator使用解析
这篇文章主要介绍了Python迭代器iterator生成器generator使用解析,文中通过示例代码介绍的非常详细，对大家的学习或者工作具有一定的参考学习价值,需要的朋友可以参考下
2019-10-10
djano一对一、多对多、分页实例代码
在本篇文章里小编给大家整理的是关于djano一对一，多对多，分页实例代码以及相关知识点，需要的朋友们学习下。
2019-08-08
Python爬虫小技巧之伪造随机的User-Agent
这篇文章主要给大家介绍了关于Python爬虫小技巧之伪造随机的User-Agent的相关资料，文中通过示例代码介绍的非常详细，对大家的学习或者工作具有一定的参考学习价值，需要的朋友们下面随着小编来一起学习学习吧
2018-09-09