山东大学软件学院2025-2026学年第一学期数据仓库数据挖掘期末考试题回忆版
前言
说实话,感觉题量有点大(全场没有提前交卷的应该),很看重理解,自己复习的也没有那么细致到位,光贝多芬(比如俺这种)是很难拿到很高的分数的,希望能够后人一些启发式的过程吧。
任课老师:PP
考试时间:2025.12.23 14:00-16:00
考试地点:实验室机房,用的线上考试系统
考试内容
简答题(5*6.5)
- 数据仓库的几个特点
- 数据预处理的步骤?每个包含哪些任务?
- 数据规范化的含义?在执行K-means等依赖距离的算法时候为什么要对原始特征进行规范化?
- 提升度的定义、公式?为什么支持度+置信度在实际过程中是不够的?
- K-近邻距离的定义方式(解释清楚至多、至少、小于、小于等于阈值关系)
设计题(5*13.5)
1.电诈预测系统,给出了一个混淆矩阵,数值具体不太记得了,大约如下:
|
预测正例(预测是诈骗电话) |
预测负例(预测非诈骗电话) | |
|
实际正例(确实是诈骗通话) |
75 |
30 |
|
实际负例(不是诈骗电话) |
45 |
9850 |
回答下面问题:
- 计算预测准确率、召回率、精确率、F-Score分数四个指标;
- 你认为该系统是否已经达到实际使用的要求和程度?说明你的理由
2. 数据仓库设计
仓储系统度量运输消耗成本。包含下面若干个维度和实体:
Time:(day,week,month,year)
Route:(route_id,start,end,dist_grade)
Cargo(运输方式):(cargo_id,weight_grade,type)
Customer:(customer_id,name,money_grade)
回答下面问题:
- 每个数据立方体具有的维度层次如何?度量了什么内容?
- 如果要查询2024年1-6月各种运输方式的平均运输成本,给出相应的OLAP操作;
- 说明该设计如何支持时间粒度的分割?
- 采用的是什么数据分裂的策略(这个真傻眼了不会)
- 忘了,但是是偏记忆性的东西
- 如果用MOLAP存储,说明使用的存储模型和优缺点。
3. 序列挖掘算法
给出了一个序列数据库,好像就5条数据,项种类数为4,总体数据量不大
- 说明采用Apriori-All和GSP两种算法会分别访问数据库几次?
- 两种算法生成的候选集C2一样吗?
- 两种算法剪枝后得到的结果集L2一样吗?(说是要计算,但是俺时间不太够了,经过简单分析可以得出来是一样的就说明了一下没计算,希望少扣点分呜呜呜)
- 如果现在增加了100条记录,是使用Apriori-All还是GSP好,说明理由。
- Apriori-All和GSP分别是如何从上一轮的结果集L(k-1)连接生成本轮候选集C(k)的,说明方法并举例;
- 说明Apriori算法向下封闭的原理
4.OPTICS聚类(邻域半径为5.0)
给了一系列点经过OPTICS运算的输出顺序,包括节点序号、核心距离、到之前点的最小可达距离。
- 选用聚类分割阈值为2.5,会划分为哪几个簇(每个簇的元素有哪些点),以及哪些会被识别为噪声?
- 可达距离的含义解释
- 忘了
- 注意到里面有一些点核心距离为-(非数值),最小可达距离为-,分别解释这两类异常数据出现的原因。
5.推荐算法(貌似是第一年考?之前往年题都没看到过)
假设像现在有5个用户(A-E),6样商品(a-f),另外一个用户F喜欢商品a,b,d,对应喜爱度分别为1,2,2,还给出了A-E五个用户各自喜欢的商品集合。现在需要给F推荐c,e,f其中的一个。
- 说明使用什么推荐算法好,原理是什么简要介绍一下;
- 说明演示推荐算法运行的过程并且给出三种商品的预测喜好度评分,以及应该优先给F推荐哪个商品。
看得出来,因为使用机考,很多复杂的算法都不能直接方便考查(特别是BIRCH、FP树这种基于图的算法),老师也是尽可能回避复杂计算,转向更看重考察对于知识点的深入、准确理解了。PS:机房的那个机械键盘挺难蚌的,用惯了笔记本之后就经常会打错字,而且考场全程都是键盘声音得有个心理准备。总的来说感觉答得并不是很好,有很多地方不确定的,有不少地方是因为自己准备不充分导致无法得到一个满意确定的答案。望后人能从这个帖子里面吸取经验教训吧
更多推荐
所有评论(0)