最近在学习R语言数据分析,通过查阅和别人分享的资料,觉得R语言中以下几个包还不错,下面就和大家一起分享。

#先生成一组随机数
df <- data.frame(age = rnorm(100,25,10),
                 gender = sample(c("Male","Female"),100,replace = TRUE),
                 income = rnorm(100,5000,10),
                 grade = rnorm(100,98,20),
                 outcome = rnorm(100,10000,20),
                 drug = sample(c("A","B"),100,replace = TRUE))

 1.在R语言中,skimr 是一个用于数据摘要和探索性分析的高效工具,它提供了比基础函数(如 summary())更详细且直观的数据概览.

###1.skimr
install.packages("skimr")  # 安装包
library(skimr)            # 加载包
##基本用法
skim(df)
##还可结合dplyr进行分组统计
install.packages("dplyr")
library(dplyr)
df %>%
  group_by(gender) %>%
  skim()

运行结果如图:

2.在R语言中,psych 包是一个专注于心理测量学、人格心理学和多元统计分析的强大工具包,特别适用于问卷数据分析、因子分析、信度检验等场景。

install.packages("psych")  # 安装包
library(psych)             # 加载包
describe(df)
##结合gtable得到描述性表格
library(gtable)
describe(df)%>% gt::gt()

 

3.在R语言中,corrplot 包是专门用于可视化相关性矩阵的工具,能够通过颜色、形状和大小直观展示变量间的相关系数。

install.packages("corrplot")  # 安装包
library(corrplot)
cor_matrix <- cor(df[,c(1,3,4,5)])  # 计算相关系数矩阵
p_matrix <- cor.mtest(df[,c(1,3,4,5)], conf.level = 0.95)$p
corrplot(cor_matrix,
         method = "square",##形状
         addCoef.col = "blue",##字体颜色
         order = "hclust",
         type = "upper",##上三角
         rect.col = "black",
         addrect = 2,
         p.mat = p_matrix,    # 输入p值矩阵
         sig.level = 0.05,    # 显著性阈值
         insig = "label_sig", # 标记不显著的相关系数
         pch.col = "red")      # 标记颜色

参数说明​:

  • method: 图形类型("circle""square""ellipse""number""color" 等)。
  • type: 显示方式("full" 全矩阵, "upper" 上三角, "lower" 下三角)。
  • order: 排序方法("original""hclust" 层次聚类, "AOE" 特征值排序等)。

 

 4.在R语言中,PerformanceAnalytics 包是金融分析和投资组合绩效评估的核心工具,专注于计算收益、风险指标以及生成专业图表,由于本文数据不符合金融分析和投资组合绩效评估数据,因此只介绍该包的一点皮毛。

install.packages("PerformanceAnalytics")  # 安装包
library(PerformanceAnalytics)             # 加载包
##使用PerformanceAnalytics画相关性矩阵热图
chart.Correlation(
  df[,c(1,3,4,5)], 
  histogram = TRUE,
  method = "pearson",
  pch = "+"
)

5.在R语言中,GGally 包是 ggplot2 的扩展工具,专注于多变量数据可视化和复杂图形矩阵的创建,尤其擅长生成变量间的交互关系图。 

install.packages("GGally")  # 安装包
library(GGally)             # 加载包
ggpairs(df[, c("age","income", "grade", "outcome", "gender")], 
        mapping = aes(color = gender), 
        progress = FALSE)  # 隐藏进度条

 好啦,以上就是今天的分享,Thanks for your time!

Logo

腾讯云面向开发者汇聚海量精品云计算使用和开发经验,营造开放的云计算技术生态圈。

更多推荐