聚类算法之特征降维-特征选择、主成分分析

2023-08-03 08:01:02 阅读次数：366

聚类算法之特征降维-特征选择、主成分分析

1 降维

1.1 定义【就是改变特征值，选择哪列保留，哪列删除；目标是得到一组“不相关”的主变量】

降维是指在某些限定条件下，降低随机变量(特征)个数，得到一组“不相关”主变量的过程

降低随机变量的个数

相关特征(correlated feature)
- 相对湿度与降雨量之间的相关
- 等等

正是因为在进行训练的时候，我们都是使用特征进行学习。如果特征本身存在问题或者特征之间相关性较强，对于算法学习预测会影响较大

1.2 降维的两种方式

特征选择
主成分分析（可以理解一种特征提取的方式）

2 特征选择【剔除数据中的冗余变量】

2.1 定义

数据中包含冗余或无关变量（或称特征、属性、指标等），旨在从原有特征中找出主要特征。

聚类算法之特征降维-特征选择、主成分分析

2.2 方法

Filter(过滤式)：主要探究特征本身特点、特征与特征和目标值之间关联
- 方差选择法：低方差特征过滤
- 相关系数
Embedded (嵌入式)：算法自动选择特征（特征与目标值之间的关联）
- 决策树:信息熵、信息增益
- 正则化：L1、L2
- 深度学习：卷积等

2.3 低方差特征过滤【把方差比较小的某一列进行剔除；因为不能按意愿进行删除，所以平时不会常用】

删除低方差的一些特征，前面讲过方差的意义。再结合方差的大小来考虑这个方式的角度。

特征方差小：某个特征大多样本的值比较相近
特征方差大：某个特征很多样本的值都有差别

2.3.1 API

sklearn.feature_selection.VarianceThreshold(threshold = 0.0) 【threshold这个参数必须得传】
- 删除所有低方差特征
- Variance.fit_transform(X)
  - X:numpy array格式的数据[n_samples,n_features]
  - 返回值：训练集差异低于threshold的特征将被删除。默认值是保留所有非零方差特征，即删除所有样本中具有相同值的特征。

2.3.2 数据计算

我们对某些股票的指标特征之间进行一个筛选，除去'index,'date','return'列不考虑（这些类型不匹配，也不是所需要指标）

一共这些特征

pe_ratio,pb_ratio,market_cap,return_on_asset_net_profit,du_return_on_equity,ev,earnings_per_share,revenue,total_expense

index,pe_ratio,pb_ratio,market_cap,return_on_asset_net_profit,du_return_on_equity,ev,earnings_per_share,revenue,total_expense,date,return
0,000001.XSHE,5.9572,1.1818,85252550922.0,0.8008,14.9403,1211444855670.0,2.01,20701401000.0,10882540000.0,2012-01-31,0.027657228229937388
1,000002.XSHE,7.0289,1.588,84113358168.0,1.6463,7.8656,300252061695.0,0.326,29308369223.2,23783476901.2,2012-01-31,0.08235182370820669
2,000008.XSHE,-262.7461,7.0003,517045520.0,-0.5678,-0.5943,770517752.56,-0.006,11679829.03,12030080.04,2012-01-31,0.09978900335112327
3,000060.XSHE,16.476,3.7146,19680455995.0,5.6036,14.617,28009159184.6,0.35,9189386877.65,7935542726.05,2012-01-31,0.12159482758620697
4,000069.XSHE,12.5878,2.5616,41727214853.0,2.8729,10.9097,81247380359.0,0.271,8951453490.28,7091397989.13,2012-01-31,-0.0026808154146886697

分析

1、初始化VarianceThreshold,指定阀值方差

2、调用fit_transform 【在特征降维中，不需要对目标值进行降维，只对特征值进行特征降维】

import pandas as pd
from sklearn.feature_selection import VarianceThreshold


def variance_demo():
    """
    删除低方差特征--特征选择
    :return: None
    """
    data = pd.read_csv('./factor_returns.csv')
    print(data)
    #  1.实例化一个转换器类
    transfer = VarianceThreshold(threshold=1)
    #  2.调用fit_transform
    data = transfer.fit_transform(data.iloc[:, 1:10])  # 除去'index,'date','return'列不考虑（这些类型不匹配，也不是所需要指标）
    print('删除低方差特征的结果：\n', data)
    print("形状：\n", data.shape)
    return None


variance_demo()

运行结果：

            index  pe_ratio  pb_ratio  ...  total_expense        date    return
0     000001.XSHE    5.9572    1.1818  ...   1.088254e+10  2012-01-31  0.027657
1     000002.XSHE    7.0289    1.5880  ...   2.378348e+10  2012-01-31  0.082352
2     000008.XSHE -262.7461    7.0003  ...   1.203008e+07  2012-01-31  0.099789
3     000060.XSHE   16.4760    3.7146  ...   7.935543e+09  2012-01-31  0.121595
4     000069.XSHE   12.5878    2.5616  ...   7.091398e+09  2012-01-31 -0.002681
...           ...       ...       ...  ...            ...         ...       ...
2313  601888.XSHG   25.0848    4.2323  ...   1.041419e+10  2012-11-30  0.060727
2314  601901.XSHG   59.4849    1.6392  ...   1.089783e+09  2012-11-30  0.179148
2315  601933.XSHG   39.5523    4.0052  ...   1.749295e+10  2012-11-30  0.137134
2316  601958.XSHG   52.5408    2.4646  ...   6.009007e+09  2012-11-30  0.149167
2317  601989.XSHG   14.2203    1.4103  ...   4.132842e+10  2012-11-30  0.183629

[2318 rows x 12 columns]
删除低方差特征的结果：
 [[ 5.95720000e+00  1.18180000e+00  8.52525509e+10 ...  1.21144486e+12
   2.07014010e+10  1.08825400e+10]
 [ 7.02890000e+00  1.58800000e+00  8.41133582e+10 ...  3.00252062e+11
   2.93083692e+10  2.37834769e+10]
 [-2.62746100e+02  7.00030000e+00  5.17045520e+08 ...  7.70517753e+08
   1.16798290e+07  1.20300800e+07]
 ...
 [ 3.95523000e+01  4.00520000e+00  1.70243430e+10 ...  2.42081699e+10
   1.78908166e+10  1.74929478e+10]
 [ 5.25408000e+01  2.46460000e+00  3.28790988e+10 ...  3.88380258e+10
   6.46539204e+09  6.00900728e+09]
 [ 1.42203000e+01  1.41030000e+00  5.91108572e+10 ...  2.02066110e+11
   4.50987171e+10  4.13284212e+10]]
形状：
 (2318, 8)

【从运行结果可以看出，列数减少了，由本来的12列，经过代码处理选择1：10列，代码降维处理是减少了1列】

2.4 相关系数

主要实现方式：
- 皮尔逊相关系数
- 斯皮尔曼相关系数

2.4.1 皮尔逊相关系数(Pearson Correlation Coefficient)

1.作用

反映变量之间相关关系密切程度的统计指标

2.公式计算案例

公式

聚类算法之特征降维-特征选择、主成分分析

举例

比如说我们计算年广告费投入与月均销售额

聚类算法之特征降维-特征选择、主成分分析

那么之间的相关系数怎么计算

聚类算法之特征降维-特征选择、主成分分析

最终计算：

聚类算法之特征降维-特征选择、主成分分析

所以我们最终得出结论是广告投入费与月平均销售额之间有高度的正相关关系。

3.特点

相关系数的值介于–1与+1之间，即–1≤ r ≤+1。其性质如下：

当r>0时，表示两变量正相关，r<0时，两变量为负相关
当|r|=1时，表示两变量为完全相关，当r=0时，表示两变量间无相关关系
当0<|r|<1时，表示两变量存在一定程度的相关。且|r|越接近1，两变量间线性关系越密切；|r|越接近于0，表示两变量的线性相关越弱
一般可按三级划分：|r|<0.4为低度相关；0.4≤|r|<0.7为显著性相关；0.7≤|r|<1为高度线性相关

4.api

from scipy.stats import pearsonr
- x : (N,) array_like
- y : (N,) array_like Returns: (Pearson’s correlation coefficient, p-value)

5.案例

from scipy.stats import pearsonr

x1 = [12.5, 15.3, 23.2, 26.4, 33.5, 34.4, 39.4, 45.2, 55.4, 60.9]
x2 = [21.2, 23.9, 32.9, 34.1, 42.5, 43.2, 49.0, 52.8, 59.4, 63.5]

ret = pearsonr(x1, x2)
print(ret)

运行结果：

聚类算法之特征降维-特征选择、主成分分析

2.4.2 斯皮尔曼相关系数(Rank IC)

1.作用：

反映变量之间相关关系密切程度的统计指标

2.公式计算案例

公式:

聚类算法之特征降维-特征选择、主成分分析

n为等级个数，d为二列成对变量的等级差数

举例:

聚类算法之特征降维-特征选择、主成分分析

3.特点

斯皮尔曼相关系数表明 X (自变量) 和 Y (因变量)的相关方向。如果当X增加时， Y 趋向于增加, 斯皮尔曼相关系数则为正
与之前的皮尔逊相关系数大小性质一样，取值 [-1, 1]之间

斯皮尔曼相关系数比皮尔逊相关系数应用更加广泛

4.api

from scipy.stats import spearmanr

5.案例

from scipy.stats import spearmanr

x1 = [12.5, 15.3, 23.2, 26.4, 33.5, 34.4, 39.4, 45.2, 55.4, 60.9]
x2 = [21.2, 23.9, 32.9, 34.1, 42.5, 43.2, 49.0, 52.8, 59.4, 63.5]

ret = spearmanr(x1, x2)
print(ret)

运行结果：

聚类算法之特征降维-特征选择、主成分分析

3 主成分分析

3.1 什么是主成分分析(PCA) 【高维数据转换为低维数据，然后产生了新的变量】

定义：高维数据转化为低维数据的过程，在此过程中可能会舍弃原有数据、创造新的变量
作用：是数据维数压缩，尽可能降低原数据的维数（复杂度），损失少量信息。
应用：回归分析或者聚类分析当中

那么更好的理解这个过程呢？来看一张图

聚类算法之特征降维-特征选择、主成分分析

3.2 API

sklearn.decomposition.PCA(n_components=None)
- 将数据分解为较低维数空间
- n_components:
  - 小数：表示保留百分之多少的信息
  - 整数：减少到多少特征
- PCA.fit_transform(X) X:numpy array格式的数据[n_samples,n_features]
- 返回值：转换后指定维度的array

3.3 数据计算

先拿个简单的数据计算一下

from sklearn.decomposition import PCA


def pca_demo():
    """
    对数据进行PCA降维
    :return: None
    """
    data = [[2, 8, 4, 5], [6, 3, 0, 8], [5, 4, 9, 1]]

    #  1.实例化PCA，小数--保留多少信息
    transfer = PCA(n_components=0.9)
    #  2.调用fit_transform
    data1 = transfer.fit_transform(data)
    print("保留90%的信息，降维结果为：\n", data1)

    #  1.实例化PCA，整数--指定降维到的维数
    transfer2 = PCA(n_components=3)
    #  调用fit_transform
    data2 = transfer2.fit_transform(data)
    print("降维到3维的结果：\n", data2)

    return None


pca_demo()

运行结果：

保留90%的信息，降维结果为：
 [[ 1.28620952e-15  3.82970843e+00]
 [ 5.74456265e+00 -1.91485422e+00]
 [-5.74456265e+00 -1.91485422e+00]]
降维到3维的结果：
 [[ 1.28620952e-15  3.82970843e+00  5.26052119e-16]
 [ 5.74456265e+00 -1.91485422e+00  5.26052119e-16]
 [-5.74456265e+00 -1.91485422e+00  5.26052119e-16]]

活动

智算服务

应用商城

合作伙伴

开发者

支持与服务

了解天翼云

聚类算法之特征降维-特征选择、主成分分析

聚类算法之特征降维-特征选择、主成分分析

聚类算法之特征降维-特征选择、主成分分析

1 降维

1.1 定义 【就是改变特征值，选择哪列保留，哪列删除；目标是得到一组“不相关”的主变量】

1.2 降维的两种方式

2 特征选择 【剔除数据中的冗余变量】

2.1 定义

2.2 方法

2.3 低方差特征过滤 【把方差比较小的某一列进行剔除；因为不能按意愿进行删除，所以平时不会常用】

2.4 相关系数

3 主成分分析

3.1 什么是主成分分析(PCA) 【高维数据转换为低维数据，然后产生了新的变量】

3.2 API

3.3 数据计算

相关文章

双连通域分解算法

Python算法学习[10]—经典算法问题的解决&算法分析与实现

python四种抽样方法的使用：随机抽样、聚类抽样、系统抽样、分层抽样

Python算法学习[6]—查找算法：表、树、散列、斐波那契查找算法&实践操作

视频 | Python测试开发之调试print代码实例

python简单介绍及基础知识（一）

使用Python扩展PAM（part 2）

归并排序算法

试探回溯法解决八皇后的问题

冒泡排序也可以写出一些花样

作者介绍

最新文章

归并排序算法

试探回溯法解决八皇后的问题

有序向量去重算法

列表的插入排序算法

python使用t-sne算法降维，方便可视化

文心一言 VS 讯飞星火 VS chatgpt （22）-- 算法导论4.2 2题

热门文章

5、使用PyTorch 实现线性回归

Lc70_爬楼梯

python使用numpy保存字典格式的数据

pandas Dataframe读取数据表是自定义列名

利用函数求出一个数组最大三个数的乘积

冒泡排序法解析

热门标签

相关产品

弹性云主机

天翼云电脑（公众版）

对象存储

云硬盘

随机文章

负载均衡算法详解

剑指Offer【33】--丑数

正常的里程表会依次显示自然数表示里程，吉祥的里程表会忽略含有4的数字而跳到下一个完全不含有4的数。正常：1 2 3 4 5 6 7 8 9 10 11 12 13 14 15

负载均衡算法概述

算法基础之递推

设计模式之模板设计模式

1.1 定义【就是改变特征值，选择哪列保留，哪列删除；目标是得到一组“不相关”的主变量】

2 特征选择【剔除数据中的冗余变量】

2.3 低方差特征过滤【把方差比较小的某一列进行剔除；因为不能按意愿进行删除，所以平时不会常用】