共计 1537 个字符,预计需要花费 4 分钟才能阅读完成。
背景介绍
人工智能与大数据作为当今科技发展的核心驱动力,已成为自考本科计算机相关专业的重要考核内容。13011 科目不仅考察基础理论,更注重实际应用能力。掌握这些技术不仅能帮助考生通过考试,更能为未来职业发展打下坚实基础。

真题解析
1. 机器学习算法典型题
题目示例 :
“ 简述决策树算法的基本原理,并说明其在分类问题中的应用优势 ”
- 决策树核心原理 :通过递归地选择最优特征进行数据划分,构建树形结构。关键概念包括信息增益、基尼系数等划分标准。
- 应用优势 :
- 可解释性强(可视化决策路径)
- 不需要特征缩放
- 同时处理离散 / 连续特征
神经网络相关题 :
“ 描述前向传播与反向传播在神经网络中的作用 ”
- 前向传播:数据从输入层到输出层的计算过程,涉及权重乘加和激活函数
- 反向传播:通过链式法则计算梯度,使用优化算法(如 SGD)调整参数
2. 大数据处理框架题
Hadoop 相关考点 :
– HDFS 架构(NameNode/DataNode)
– MapReduce 编程模型(map->shuffle->reduce)
Spark 优化问题 :
– RDD 持久化策略(cache/persist)
– 宽窄依赖与分区优化
代码示例
决策树分类示例(Python/sklearn)
from sklearn.tree import DecisionTreeClassifier
from sklearn.datasets import load_iris
# 1. 加载数据
iris = load_iris()
X, y = iris.data, iris.target
# 2. 创建模型(限制树深度防止过拟合)clf = DecisionTreeClassifier(max_depth=3, random_state=42)
# 3. 训练模型
clf.fit(X, y)
# 4. 预测示例
sample = [[5.1, 3.5, 1.4, 0.2]] # 对应花萼长宽等特征
print(f"预测类别: {iris.target_names[clf.predict(sample)[0]]}")
Spark 词频统计示例
from pyspark import SparkContext
sc = SparkContext("local", "WordCount")
# 1. 创建 RDD
text_rdd = sc.parallelize(["hello world", "hello spark"])
# 2. 转换操作
words = text_rdd.flatMap(lambda line: line.split(" "))
word_counts = words.countByValue() # Action 操作触发计算
print(dict(word_counts)) # 输出: {'hello': 2, 'world': 1, 'spark': 1}
备考策略
- 知识体系构建 :
- 制作思维导图梳理技术脉络(如机器学习监督 / 非监督学习分类)
-
重点标记历年高频考点(如 Hadoop/Spark 对比)
-
真题训练法 :
- 按题型分类练习(名词解释 -> 简答 -> 综合应用)
-
建立错题本记录易错概念(如混淆准确率 / 召回率)
-
时间分配建议 :
- 理论记忆(30%)+ 代码实践(40%)+ 真题模拟(30%)
避坑指南
- 概念陷阱 :
- 区分批处理(Hadoop)与流处理(Spark Streaming)适用场景
-
明确监督学习(有标签)与无监督学习的本质区别
-
代码易错点 :
- 机器学习数据未标准化导致模型偏差
- Spark 操作混淆 transformation 和 action(如忘记 collect() 触发计算)
总结建议
建议考生在掌握核心算法原理后,通过 Jupyter Notebook 实际运行修改代码示例(如调整决策树 max_depth 观察准确率变化),并思考这些技术如何在电商推荐系统、金融风控等场景落地。真题中约 60% 分值集中在机器学习与 Spark 应用,应重点突破。
正文完
发表至: 未分类
近三天内
