Appearance
机器学习课程复习提要
1、机器学习的定义
机器学习是人工智能的一个分支。我们使用计算机设计一个系统,使它能够根据提供的训练数据按照一定的方式来学习 ;随着训练次数的增加,该系统可以在性能上不断学习和改进;通过参数优化的学习模型,能够用于预测相关问题的输出。
深度学习属于机器学习的子类。 是利用深度神经网络来解决特征表达的一种学习过程。
2、机器学习的发展历程

3、监督学习,半监督学习和无监督学习的特点
1、监督学习
从给定的有标注的训练数据集中学习出一个函数(模型参数),当新的数据到来时可以根据这个函数预测结果。 常见任务包括分类与 回归。
2、无监督学习
没有标注的训练数据集,需要根据样本间的统计规律对样本集进行分析,常见任务如聚类等。
3、半监督学习
结合**(少量的)标注训练数据和(大量的)未标注数据**来进行数据的分类学习。半监督学习可进一步划分为纯(pure)半监督学习和直推学习(transductive learning),前者假定训练数据中的未标记样本并非待测的数据,而后者则假定学习过程中所考虑的未标记样本恰是待预测数据,学习的目的就是在这些未标记样本上获得最优泛化性能
4、机器学习的步骤,每个步骤的主要内容
5、数据清洗的内容和意义
对各种脏数据进行对应方式的处理,得到标准、干净、连续的数据,提供给数据统计、数据挖掘等使用。
6、什么是数据采样
过采样(Over-Sampling)
通过随机复制少数类来增加其中的实例数量,从而可增加样本中少数类的代表性。
欠采样(Under-Sampling)
通过随机地消除占多数的类的样本来平衡类分布;直到多数类和少数类的实例实现平衡。
7、什么是特征抽取,特征如何选择,如何编码


one-hot编码:采用N位状态寄存器来对N个状态进行编码,每个状态都由他独立的寄存器位,并在任意时候只有一位有效。
语义编码:one-hot编码无法体现数据间的语义关系,对于一些有关联的文本信息来说,无法真正体现出数据关联。
8、分类算法有哪些?
9、决策树算法
10、贝叶斯分类算法
11、SVM
12、逻辑回归
13、线性回顾,最小二乘法、梯度下降法
14、K-means算法
15、层次聚类
16、密度聚类
17、集成学习AdaBoost
Boosting 的主要思想:先从初始训练集训练出一个基学习器,再根据基学习器的表现对训练样本分布进行调整,使得先前基学习器做错的训练样本在后续受到更多关注,然后基于调整后的样本分布来训练下一个基学习器;如此重复进行,直至基学习器数目达到事先指定的值T,最终将这T个基学习器进行加权结合。
- 个体学习器存在强依赖关系
- 串行生成
- 每次调整训练数据的样本分布
Bagging与随机森林
特点:基学习器不存在强依赖关系、采用并行化生成的方式、需要用到自助采样法