熵值法测算面板数据的影响因素权重:整体分析 vs 分组分析
创作时间:
作者:
@小白创作中心
熵值法测算面板数据的影响因素权重:整体分析 vs 分组分析
引用
CSDN
1.
https://blog.csdn.net/weixin_43213884/article/details/136611024
在进行面板数据分析时,如何确定影响因素的权重是一个关键问题。本文通过模拟数据实验,探讨了两种常见的计算方法:将所有数据作为一个整体进行分析,以及按省份分组进行分析。通过比较两种方法计算出的权重和综合指标,帮助读者理解如何根据研究目标选择合适的计算方法。
当你使用熵值法来测算面板数据的影响因素权重,你面临的主要决策之一是是否应该将数据按省份或年份分组来进行分析,或者是将所有数据作为一个整体来分析。这个决定取决于你的研究目标以及数据本身的性质。以下是一些指导原则和步骤,帮助你决定如何操作,并说明了如何计算权重。
决定是否分组
研究目标为整体趋势分析:如果你的目标是理解整体趋势,比如整个国家不同因素随时间的影响权重变化,那么可以将所有数据一起分析,不进行分组。这样可以得到一个全国范围内各影响因素的综合权重。
研究目标为区域或时间细分析:如果你关注的是不同省份之间或不同时间段内的差异,分组分析将更有意义。按省份分组可以帮助你理解不同地区之间的差异;按年份分组则可以揭示时间序列上的变化趋势。
模拟数据实验
不同方式计算的权重
import numpy as np
import pandas as pd
# 步骤 1: 生成模拟数据
np.random.seed(0) # 确保生成的数据是可复现的
data = {
'Province': np.repeat(['A', 'B', 'C'], 4), # 省份
'Year': np.tile([2020, 2021, 2022, 2023], 3), # 年份
'X1': np.random.rand(12), # 影响因素1
'X2': np.random.rand(12), # 影响因素2
'X3': np.random.rand(12) # 影响因素3
}
df = pd.DataFrame(data)
# 计算熵值法权重的函数
def entropy_weight(data):
# 数据标准化
data_normalized = data / data.sum()
# 计算熵值
epsilon = 1e-12 # 避免对0取对数
data_entropy = -np.sum(data_normalized * np.log(data_normalized + epsilon), axis=0) / np.log(len(data))
# 计算权重
weights = (1 - data_entropy) / (1 - data_entropy).sum()
return weights
# 步骤 2A: 不分组直接计算权重
weights_all = entropy_weight(df[['X1', 'X2', 'X3']])
# 步骤 2B: 按省份分组计算权重
weights_by_province = df.groupby('Province')[['X1', 'X2', 'X3']].apply(entropy_weight)
# 输出结果
print("全数据权重:\n", weights_all)
print("\n按省份分组计算的权重:\n", weights_by_province)
print("\n按省份分组计算的权重平均值:\n", weights_by_province.mean())
全数据权重:
X1 0.084956
X2 0.477880
X3 0.437164
dtype: float64
按省份分组计算的权重:
X1 X2 X3
Province
A 0.008879 0.567479 0.423642
B 0.131374 0.677755 0.190871
C 0.173210 0.096664 0.730126
按省份分组计算的权重平均值:
X1 0.104487
X2 0.447300
X3 0.448213
dtype: float64
不同方式计算的综合指标
# 继续使用之前的df
# 标准化函数
def normalize_data(data):
return (data - data.min()) / (data.max() - data.min())
# 应用标准化
df_normalized = df[['X1', 'X2', 'X3']].apply(normalize_data)
# 使用全数据权重计算综合指标
composite_score_all = df_normalized.mul(weights_all, axis=1).sum(axis=1)
# 将综合指标添加到df
df['Composite_Score_All'] = composite_score_all
# 使用按省份分组的权重计算综合指标
# 注意,由于每个省份的权重可能不同,我们需要对每个省份单独计算
for province in df['Province'].unique():
province_weights = weights_by_province.loc[province]
province_data = df[df['Province'] == province][['X1', 'X2', 'X3']].apply(normalize_data)
df.loc[df['Province'] == province, 'Composite_Score_By_Province'] = province_data.mul(province_weights, axis=1).sum(axis=1)
# 查看结果
print(df[['Province', 'Year', 'Composite_Score_All', 'Composite_Score_By_Province']])
Province Year Composite_Score_All Composite_Score_By_Province
0 A 2020 0.344345 0.330248
1 A 2021 0.793291 0.843774
2 A 2022 0.116266 0.015874
3 A 2023 0.494165 0.434329
4 B 2020 0.243413 0.096354
5 B 2021 0.630426 0.766517
6 B 2022 0.501895 0.608406
7 B 2023 0.854848 1.000000
8 C 2020 0.769341 0.803114
9 C 2021 0.647918 0.733258
10 C 2022 0.279804 0.121882
11 C 2023 0.683157 0.833184
画图展示
import numpy as np
import pandas as pd
import matplotlib.pyplot as plt
# 生成模拟数据
np.random.seed(0) # 确保生成的数据是可复现的
data = {
'Province': np.repeat(['A', 'B', 'C'], 4), # 省份
'Year': np.tile([2020, 2021, 2022, 2023], 3), # 年份
'X1': np.random.rand(12), # 影响因素1
'X2': np.random.rand(12), # 影响因素2
'X3': np.random.rand(12) # 影响因素3
}
df = pd.DataFrame(data)
# 计算熵值法权重的函数
def entropy_weight(data):
# 数据标准化
data_normalized = data / data.sum()
# 计算熵值
epsilon = 1e-12 # 避免对0取对数
data_entropy = -np.sum(data_normalized * np.log(data_normalized + epsilon), axis=0) / np.log(len(data))
# 计算权重
weights = (1 - data_entropy) / (1 - data_entropy).sum()
return weights
# 标准化函数
def normalize_data(data):
return (data - data.min()) / (data.max() - data.min())
# 计算权重
weights_all = entropy_weight(df[['X1', 'X2', 'X3']])
weights_by_province = df.groupby('Province')[['X1', 'X2', 'X3']].apply(entropy_weight)
# 应用标准化
df_normalized = df[['X1', 'X2', 'X3']].apply(normalize_data)
# 使用全数据权重计算综合指标
composite_score_all = df_normalized.mul(weights_all, axis=1).sum(axis=1)
df['Composite_Score_All'] = composite_score_all
# 使用按省份分组的权重计算综合指标
for province in df['Province'].unique():
province_weights = weights_by_province.loc[province]
province_data = df[df['Province'] == province][['X1', 'X2', 'X3']].apply(normalize_data)
df.loc[df['Province'] == province, 'Composite_Score_By_Province'] = province_data.mul(province_weights, axis=1).sum(axis=1)
# 绘制图形
plt.figure(figsize=(10, 6))
for province in df['Province'].unique():
province_data = df[df['Province'] == province]
plt.plot(province_data['Year'], province_data['Composite_Score_All'], label=f'All - {province}', linestyle='-', marker='o', color='black')
plt.plot(province_data['Year'], province_data['Composite_Score_By_Province'], label=f'By Province - {province}', linestyle='--', marker='x', color='grey')
plt.title('Composite Score Comparison')
plt.xlabel('Year')
plt.ylabel('Composite Score')
plt.legend()
plt.grid(True, which='both', linestyle='--', linewidth=0.5, color='grey')
plt.tight_layout()
plt.show()
结论
计算的权重略有区别,个别可能比较大;计算的综合指标差异不大,但趋势一致。
反思
如果嫌麻烦,那就全扔进去。面板的个体差异和时间差异,如果很看重权重,那还是分开计算好。
热门推荐
我国科学家“点石成锦”让火星土壤变纤维,这能拿来打造火星基地吗?
营养专家指导,定制你的日常饮食与运动方案
SCMP证书国家认可吗?让我们一起探索它的真实价值!
轻松过关:年检尾气检测全攻略
Win10登录故障排查:快速解决常见登录问题指南
2025年十大动作游戏推荐:从科幻到历史,总有一款适合你
穴位太多记不住?锁定5大关键穴位,守护健康不费劲,小病小痛一扫清!
在Mac上自定义背景图片的完整指南
儿童湿疹如何用药?
让·科克托《美女与野兽》的诞生
月季花最好的肥料
为何很多科学家晚年信奉宗教?是科学的探索还是另有玄机?
新能源浪潮下,传统车企的转型与挑战
硬拉是三个最重要的力量训练要素之一。如果练习得当,力量会暴增,而且不会伤腰。
计算机网络的七层模型
软水盐:从家庭到工业的全方位水处理专家
市场动荡之际 高股息蓝筹股或成投资新宠
金银花炖鸡汤:一道清热解毒的养生佳品
是谁?何时?为何对靖国神社下此“狠手”?
心脏积水是怎么回事?严重吗?能治好吗?
办理户口需要的亲子鉴定流程与注意事项
三文鱼哪个部位最好吃?从腹部到鱼头的全面解析
蛇雕:热带森林中的蛇类猎手
高蛋白饮食对减脂的影响及如何合理安排
黑神话悟空黄眉怎么打 妖王黄眉攻略
四川三所实力强劲的非211大学:专业特色与就业前景分析
一定要有社保才能申请入户深圳吗?无社保也有机会拿到深圳户口!
陕西风味传奇:油泼面的诱惑之秘
毕业即开公司 看大学生如何在社区创业?
【攻略】地下室、大户型除湿机怎么选?卡梭、德业、格力、美的、欧井热门品牌选哪个?