R语言几个好用的数据分析包
·
最近在学习R语言数据分析,通过查阅和别人分享的资料,觉得R语言中以下几个包还不错,下面就和大家一起分享。
#先生成一组随机数
df <- data.frame(age = rnorm(100,25,10),
gender = sample(c("Male","Female"),100,replace = TRUE),
income = rnorm(100,5000,10),
grade = rnorm(100,98,20),
outcome = rnorm(100,10000,20),
drug = sample(c("A","B"),100,replace = TRUE))
1.在R语言中,skimr 是一个用于数据摘要和探索性分析的高效工具,它提供了比基础函数(如 summary())更详细且直观的数据概览.
###1.skimr
install.packages("skimr") # 安装包
library(skimr) # 加载包
##基本用法
skim(df)
##还可结合dplyr进行分组统计
install.packages("dplyr")
library(dplyr)
df %>%
group_by(gender) %>%
skim()
运行结果如图:

2.在R语言中,psych 包是一个专注于心理测量学、人格心理学和多元统计分析的强大工具包,特别适用于问卷数据分析、因子分析、信度检验等场景。
install.packages("psych") # 安装包
library(psych) # 加载包
describe(df)
##结合gtable得到描述性表格
library(gtable)
describe(df)%>% gt::gt()

3.在R语言中,corrplot 包是专门用于可视化相关性矩阵的工具,能够通过颜色、形状和大小直观展示变量间的相关系数。
install.packages("corrplot") # 安装包
library(corrplot)
cor_matrix <- cor(df[,c(1,3,4,5)]) # 计算相关系数矩阵
p_matrix <- cor.mtest(df[,c(1,3,4,5)], conf.level = 0.95)$p
corrplot(cor_matrix,
method = "square",##形状
addCoef.col = "blue",##字体颜色
order = "hclust",
type = "upper",##上三角
rect.col = "black",
addrect = 2,
p.mat = p_matrix, # 输入p值矩阵
sig.level = 0.05, # 显著性阈值
insig = "label_sig", # 标记不显著的相关系数
pch.col = "red") # 标记颜色
参数说明:
method: 图形类型("circle","square","ellipse","number","color"等)。type: 显示方式("full"全矩阵,"upper"上三角,"lower"下三角)。order: 排序方法("original","hclust"层次聚类,"AOE"特征值排序等)。
4.在R语言中,PerformanceAnalytics 包是金融分析和投资组合绩效评估的核心工具,专注于计算收益、风险指标以及生成专业图表,由于本文数据不符合金融分析和投资组合绩效评估数据,因此只介绍该包的一点皮毛。
install.packages("PerformanceAnalytics") # 安装包
library(PerformanceAnalytics) # 加载包
##使用PerformanceAnalytics画相关性矩阵热图
chart.Correlation(
df[,c(1,3,4,5)],
histogram = TRUE,
method = "pearson",
pch = "+"
)

5.在R语言中,GGally 包是 ggplot2 的扩展工具,专注于多变量数据可视化和复杂图形矩阵的创建,尤其擅长生成变量间的交互关系图。
install.packages("GGally") # 安装包
library(GGally) # 加载包
ggpairs(df[, c("age","income", "grade", "outcome", "gender")],
mapping = aes(color = gender),
progress = FALSE) # 隐藏进度条

好啦,以上就是今天的分享,Thanks for your time!
更多推荐
所有评论(0)