Skip to content

机器学习课程复习提要

1、机器学习的定义

机器学习是人工智能的一个分支。我们使用计算机设计一个系统,使它能够根据提供的训练数据按照一定的方式来学习 ;随着训练次数的增加,该系统可以在性能上不断学习和改进;通过参数优化的学习模型,能够用于预测相关问题的输出。

深度学习属于机器学习的子类。 是利用深度神经网络来解决特征表达的一种学习过程。

2、机器学习的发展历程

image-20220531110348784

3、监督学习,半监督学习和无监督学习的特点

1、监督学习

从给定的有标注的训练数据集中学习出一个函数(模型参数),当新的数据到来时可以根据这个函数预测结果。 常见任务包括分类回归

2、无监督学习

没有标注的训练数据集,需要根据样本间的统计规律对样本集进行分析,常见任务如聚类等。

3、半监督学习

结合**(少量的)标注训练数据(大量的)未标注数据**来进行数据的分类学习。半监督学习可进一步划分为纯(pure)半监督学习和直推学习(transductive learning),前者假定训练数据中的未标记样本并非待测的数据,而后者则假定学习过程中所考虑的未标记样本恰是待预测数据,学习的目的就是在这些未标记样本上获得最优泛化性能

4、机器学习的步骤,每个步骤的主要内容

image-20220531110732862

5、数据清洗的内容和意义

对各种脏数据进行对应方式的处理,得到标准、干净、连续的数据,提供给数据统计、数据挖掘等使用。

6、什么是数据采样

过采样(Over-Sampling)

通过随机复制少数类来增加其中的实例数量,从而可增加样本中少数类的代表性。

欠采样(Under-Sampling)

通过随机地消除占多数的类的样本来平衡类分布;直到多数类和少数类的实例实现平衡。

7、什么是特征抽取,特征如何选择,如何编码

image-20220531113226997

image-20220531113215809

one-hot编码:采用N位状态寄存器来对N个状态进行编码,每个状态都由他独立的寄存器位,并在任意时候只有一位有效。

语义编码:one-hot编码无法体现数据间的语义关系,对于一些有关联的文本信息来说,无法真正体现出数据关联。

8、分类算法有哪些?

9、决策树算法

10、贝叶斯分类算法

11、SVM

12、逻辑回归

13、线性回顾,最小二乘法、梯度下降法

14、K-means算法

15、层次聚类

16、密度聚类

17、集成学习AdaBoost

Boosting 的主要思想:先从初始训练集训练出一个基学习器,再根据基学习器的表现对训练样本分布进行调整,使得先前基学习器做错的训练样本在后续受到更多关注,然后基于调整后的样本分布来训练下一个基学习器;如此重复进行,直至基学习器数目达到事先指定的值T,最终将这T个基学习器进行加权结合。

  • 个体学习器存在强依赖关系
  • 串行生成
  • 每次调整训练数据的样本分布

Bagging与随机森林

特点:基学习器不存在强依赖关系、采用并行化生成的方式、需要用到自助采样法

18、性能指标:准确率,精确率,召回率,F1,PR曲线,宏平均,微平均

19、什么是人工神经网络,及其基本概念,神经元与权值连接

20、激活函数有哪些?

21、输入层,隐藏层,输出层,损失函数,反向调参策略,什么是全连接网络,什么是偏置向量

22、BP神经网络

23、卷积神经网络,局部连接,权值共享,卷积层,池化层

24、LSTM

25、训练集,验证集和测试集

26、超参有哪些

27、过拟合和欠拟合

28、常见算法:波士顿房价预测,鸢尾花分类,cnn文本分类,猫狗分类,手写数字识别,基于lstm的序列标注(翻译,命名实体识别等)

29、自然语言处理,词向量技术,分词、词性标注,文本分类,情感分析

30、此表未列入但是讲课涉及的其他内容。