1、样本均值的抽样分布

随着样本容量n的增大(n>=30),不论原来的总体是否服从正态分布,样本值的抽样分布都趋于正态分布,其分布的数学期望为总体均值m,方差为总体方差的1/n,这就是中心极限定理,表述为:设从均值为m,方差为s 2的一个任意总体中抽取容量为n的样本,当n充分大时,样本均值的抽样分布近似服从均值为μ、方差为σ2/n的正态分布”

 2、比例和比率

比例和比率的区别是概念不同,形式表示不同,比较的对象不同。
1、概念不同:
比例是表示两或多个比相等的式子。
比率是样本中各不同类别数据之间的比值。
2、形式表示不同:
比例用几比几的形式表示。
比率用百分比的形式表示。
3、比较的对象不同:
比例表示总体中两个部分之间的比较。
比率表示总体中的一部分与总体作比较。
比例(proportion)是一个数学术语,表示两个或多个比相等的式子。在一个比例中,两个外项的积等于两个内项的积,叫做比例的基本性质。在数学中,如果一个变量的变化总是伴随着另一个变量的变化,则两个变量是成比例的,并且如果变化总是通过使用常数乘数相关联,那么 常数称为比例系数或比例常数。

深度盘点:数据分析常用100个指标和术语! - 知乎

大学统计学易错易混知识点 - 知乎

 3、假设检验

概率论复习笔记3.0--假设检验_检验假设的原假设都是小概率事件吗-CSDN博客

原假设最好是大概率事件,或者叫做小概率事件不发生,备择假设选小概率事件发生,

假设检验_假设检验 何时显著_玉骨.的博客-CSDN博客

4、为什么在做了F检验后还要做t检验

多元线性回归模型的总体显著性F检验是检验模型中全部解释变量对被解释变量的共同影响是否显著。通过了此F检验,就可以说模型中的全部解释变量对被解释变量的共同影响是显著的,但却不能就此判定模型中的每一个解释变量对被解释变量的影响都是显著的。因此还需要就每个解释变量对被解释变量的影响是否显著进行检验,即进行t检验

5、点估计和区间估计

点估计方法简单易用,但准确性有限。区间估计方法更为准确,但计算复杂,需要更多的样本数据和统计知识。在实际应用中,我们需要根据具体情况选择合适的参数估计方法。

参数的区间估计和点估计 - 百度文库

6、大数据思维

大数据思维可以概括为数据采集层面的“全样本思维”“关注效率思维”,数据分析层面的“相关性思维”“价值性思维”,数据使用层面的“数据核心思维”“共享性思维”。

7、朴素贝叶斯算法

朴素贝叶斯法(Naive Bayes model)是基于贝叶斯定理与特征条件独立假设的分类方法

NBC模型所需估计的参数很少,对缺失数据不太敏感,算法也比较简单。理论上,NBC模型与其他分类方法相比具有最小的误差率。但是实际上并非总是如此,这是因为NBC模型假设属性之间相互独立,这个假设在实际应用中往往是不成立的,这给NBC模型的正确分类带来了一定影响。

贝叶斯方法的特点是结合先验概率和后验概率,即避免了只使用先验概率的主观偏见,也避免了单独使用样本信息的过拟合现象。贝叶斯分类算法在数据集较大的情况下表现出较高的准确率,同时算法本身也比较简单

朴素贝叶斯分类(NBC)是以贝叶斯定理为基础并且假设特征条件之间相互独立的方法,先通过已给定的训练集,以特征词之间独立作为前提假设,学习从输入到输出的联合概率分布,再基于学习到的模型,输入X求出使得后验概率最大的输出Y

朴素贝叶斯算法的介绍-CSDN博客

8、其他知识点

Logo

腾讯云面向开发者汇聚海量精品云计算使用和开发经验,营造开放的云计算技术生态圈。

更多推荐