共计 1648 个字符,预计需要花费 5 分钟才能阅读完成。
科目特点与备考痛点
13011 人工智能与大数据作为自考本科的核心课程,主要考查两大方向:

- 人工智能基础:监督学习(supervised learning)、无监督学习(unsupervised learning)算法原理与实现
- 大数据技术栈:Hadoop 生态系统(HDFS/YARN/MapReduce)、Spark 核心组件(RDD/DataFrame)的应用场景
考生常见问题集中表现为:
- 混淆机器学习算法适用场景(如把聚类问题误用分类算法)
- 大数据组件配置参数记忆困难(如 Spark 的 executor 内存分配)
- 编程题缺乏规范化编码习惯(PEP8 合规性问题)
模块化真题解析
机器学习高频考点
2023 年真题示例:
给出银行客户特征数据,要求选择合适算法预测贷款违约风险
解题思路:
- 判断问题类型:典型的二分类问题(违约 / 不违约)
- 算法选型:逻辑回归(Logistic Regression)或随机森林(Random Forest)
- Python 伪代码实现:
# 导入 sklearn 库 from sklearn.ensemble import RandomForestClassifier # 特征工程(真题通常省略此步骤)X = df[['age', 'income', 'credit_score']] # 特征矩阵 y = df['default_risk'] # 标签 # 模型训练 model = RandomForestClassifier(n_estimators=100) # 100 棵决策树 model.fit(X_train, y_train) # 模型评估(注意题目是否要求)print(f"Accuracy: {model.score(X_test, y_test):.2f}")
大数据技术实战
2022 年真题示例:
编写 Spark 代码统计文本中单词频率
关键配置:
- 设置 executor 数量与内存(通常题目会给出集群配置)
- 避免使用
collect()操作处理大数据集
示例代码:
from pyspark import SparkContext
sc = SparkContext("local", "WordCount")
# 读取 HDFS 文件
lines = sc.textFile("hdfs://path/to/file.txt")
# 扁平化 + 映射 + 归约
word_counts = lines.flatMap(lambda line: line.split()) \
.map(lambda word: (word, 1)) \
.reduceByKey(lambda a, b: a + b)
# 输出前 10 高频词(避免全量 collect)print(word_counts.take(10))
命题规律深度分析
通过统计近 3 年真题发现:
- 分值分布
- 机器学习基础:35-40 分
- 大数据技术:45-50 分
-
综合应用题:15-20 分
-
题型比例
- 概念简答题:30%
- 计算推导题:25%
-
编程实践题:45%
-
考点重复率
- K-Means 聚类原理:连续 3 年出现
- MapReduce 执行流程:每年必考
备考策略与资源
推荐学习路径
- 基础阶段(1 个月)
- 《机器学习实战》第 1 - 5 章
-
Hadoop 官方文档 QuickStart 部分
-
强化阶段(2 周)
- 精做近 5 年真题
-
搭建 Spark 伪分布式环境实操
-
冲刺阶段(1 周)
- 重点记忆配置参数(如 YARN 的容器内存设置)
- 整理错题本中的算法混淆点
高频失分点预警
- 混淆决策树(Decision Tree)与支持向量机(SVM)的数学假设
- 错误配置 HDFS 副本数量(默认 3 副本,考题常修改此参数)
- 忽略 Python 代码的异常处理(真题中会设置空值陷阱)
拓展思考题
- 如果训练集样本量不足,哪些机器学习算法更容易过拟合?
- 当 Spark 作业执行缓慢时,应该从哪些方面排查性能瓶颈?
- 如何设计大数据架构同时满足实时查询和批量分析需求?
结语
通过系统分析历年真题规律,考生应建立 ” 概念理解→算法实现→参数配置 ” 的三层知识体系。建议每周保持 3 - 5 小时的编程实操,重点培养根据问题场景选择技术方案的能力。遇到复杂算法时,可尝试在白板上手推计算过程(如朴素贝叶斯概率计算),这比单纯记忆公式更有效。
正文完
发表至: 未分类
近两天内
