|
1 | 1 |
|
2 | | -# 1) 机器学习基础 |
| 2 | +# 1. 机器学习基础 |
3 | 3 |
|
4 | | -* 机器学习是什么 |
5 | | - * 把无序的数据转换成有用的信息。 |
| 4 | +我们会利用计算机来彰显数据背后的真实含义,这才是机器学习的真实含义。 |
6 | 5 |
|
7 | | -* 机器学习的意义 |
8 | | - * 我们利用计算机来彰显数据背后的真实含义。 |
| 6 | +> 机器学习已应用于多个领域,远远超出大多数人的想象,横跨:计算机科学、工程技术和统计学等多个学科。 |
9 | 7 |
|
10 | | -* 机器学习的任务 |
11 | | - * 机器学习的主要任务就是分类。 |
12 | | - * 分类:将实例数据划分到合适的分类中。 |
13 | | - * 机器学习的另一项任务是回归。 |
14 | | - * 回归:主要用于预测数值型数据。(例子———数据拟合曲线:通过给定数据点的最优拟合曲线) |
| 8 | +* 搜索引擎,根据你的搜索点击,优化你下次的搜索结果。 |
| 9 | +* 垃圾邮件,会自动的过滤垃圾广告邮件到垃圾箱内。 |
| 10 | +* 超市优惠券,你会发现,你在购买小孩子的尿布的时候,售货员会赠送你一张优惠券可以兑换6罐啤酒。 |
| 11 | +* 邮局邮寄,手写软件自动识别寄送贺卡的地址。 |
| 12 | +* 申请贷款,通过你最近的金融活动信息继续综合评定,决定你是否合格。 |
15 | 13 |
|
| 14 | +## 机器学习的简单概述 |
| 15 | + |
| 16 | +`机器学习`就是把无序的数据转换成有用的信息;机器学习将有助于我们穿越数据雾霾,从中抽取出有用的信息。 |
| 17 | +* 1.需要获取海量的数据 |
| 18 | +* 2.才能从海量数据中获取有用的信息 |
| 19 | + |
| 20 | +## 机器学习的主要任务 |
| 21 | + |
| 22 | +> 机器学习的主要任务就是分类和回归 |
| 23 | +
|
| 24 | +* 分类:将实例数据划分到合适的分类中。 |
| 25 | +* 回归:主要用于预测数值型数据。(例子———数据拟合曲线:通过给定数据点的最优拟合曲线) |
16 | 26 | * 目标变量 |
17 | 27 | * 目标变量是机器学习预测算法的测试结果。 |
18 | | - * 在分类算法中目标变量的类型通常是标称型的,而在回归算法中通常是连续型的。 |
| 28 | + * 在分类算法中目标变量的类型通常是标称型的,而在回归算法中通常是连续型的。 |
19 | 29 |
|
20 | 30 | * 机器学习的训练过程 |
21 | | - *  |
22 | | - |
23 | | -* 监督学习 |
24 | | - * 必须知道预测什么,即必须知道目标变量的分类信息。分类和回归属于监督学习。 |
25 | | - * 样本集:训练数据 + 测试数据 |
26 | | - * 训练样本 = 特征 + 目标变量 |
27 | | - * 训练样本的集合称为训练样本集,训练样本集必须确定知道目标变量的值,以便机器学习算法可以发现特征和目标变量之间的关系。 |
28 | | - * 特征(feature-是否有缺失情况) + 目标变量(分类-离散值<A/B/C、 是/否>/回归-连续值<0~100、 -999~999>) |
29 | | - * 特征或者属性通常是训练样本集的列,它们是独立测量得到的结果,多个特征联系在一起共同组成一个训练样本。 |
30 | | - * `知识表示`:机器已经学会如何识别鸟类的过程 |
31 | | - * 1.可以采用规则集的形式 |
32 | | - * 2.可以采用概率分布的形式 |
33 | | - * 3.可以使训练样本集中的一个实例 |
34 | | - |
35 | | -* 非监督学习 |
36 | | - * 数据没有类别信息,也不会给定目标值 |
37 | | - * 聚类:在无监督学习中,将数据集合分成由类似的对象组成的多个类的过程称为聚类; |
38 | | - * 密度估计:将寻找描述数据统计值的过程称之为密度估计。 |
39 | | - * 此外,无监督学习还可以减少数据特征的维度,以便我们可以使用二维或三维图形更加直观地展示数据信息。 |
| 31 | +*  |
| 32 | + |
| 33 | +> 监督学习 |
| 34 | +
|
| 35 | +* 必须知道预测什么,即必须知道目标变量的分类信息。分类和回归属于监督学习。 |
| 36 | +* 样本集:训练数据 + 测试数据 |
| 37 | + * 训练样本 = 特征 + 目标变量 |
| 38 | + * 训练样本的集合称为训练样本集,训练样本集必须确定知道目标变量的值,以便机器学习算法可以发现特征和目标变量之间的关系。 |
| 39 | +* 特征(feature-是否有缺失情况) + 目标变量(分类-离散值<A/B/C、 是/否>/回归-连续值<0~100、 -999~999>) |
| 40 | + * 特征或者属性通常是训练样本集的列,它们是独立测量得到的结果,多个特征联系在一起共同组成一个训练样本。 |
| 41 | +* `知识表示`:机器已经学会如何识别鸟类的过程 |
| 42 | + * 1.可以采用规则集的形式 |
| 43 | + * 2.可以采用概率分布的形式 |
| 44 | + * 3.可以使训练样本集中的一个实例 |
| 45 | + |
| 46 | +> 非监督学习 |
| 47 | +
|
| 48 | +* 数据没有类别信息,也不会给定目标值 |
| 49 | +* 聚类:在无监督学习中,将数据集合分成由类似的对象组成的多个类的过程称为聚类; |
| 50 | +* 密度估计:将寻找描述数据统计值的过程称之为密度估计。 |
| 51 | +* 此外,无监督学习还可以减少数据特征的维度,以便我们可以使用二维或三维图形更加直观地展示数据信息。 |
| 52 | + |
| 53 | +> 算法汇总 |
| 54 | +
|
| 55 | + |
| 56 | + |
| 57 | +## 机器学习的原因 |
40 | 58 |
|
41 | 59 | * 选择算法需要考虑的两个问题 |
42 | | - * 使用机器学习算法的目的。 |
| 60 | + * 使用机器学习算法的目的 |
43 | 61 | * 想要完成何种任务,比如是预测明天下雨的概率还是对投票者按照兴趣分组;如果想要预测目标变量的值,则可以选择监督学习算法,否则可以选择无监督学习算法。 |
44 | 62 | * 需要分析或收集的数据是什么 |
45 | 63 | * 举例 |
46 | 64 | *  |
47 | 65 |
|
48 | | -* 开发的步骤 |
49 | | - * 1.收集数据 |
50 | | - * 2.准备输入数据 |
51 | | - * 注意数据的格式 |
52 | | - * 3.分析输入数据 |
53 | | - * 为了确保数据集中没有垃圾数据;如果是算法可以处理的数据格式或可信任的数据源,则可以跳过该步骤;另外该步骤需要人工干预,会降低自动化系统的价值。 |
54 | | - * 4.训练算法 |
55 | | - * 如果使用无监督学习算法,由于不存在目标变量值,则可以跳过该步骤 |
56 | | - * 5.测试算法 |
57 | | - * 6.使用算法 |
58 | | - |
59 | | -* Python相关的库 |
60 | | - * 科学函数库:SciPy、`NumPy`(底层语言:C和Fortran) |
| 66 | +``` |
| 67 | +开发机器学习应用程序的步骤 |
| 68 | +1. 收集数据 |
| 69 | +2. 准备输入数据 |
| 70 | + * 注意数据的格式 |
| 71 | +3. 分析输入数据 |
| 72 | + * 为了确保数据集中没有垃圾数据;如果是算法可以处理的数据格式或可信任的数据源,则可以跳过该步骤;另外该步骤需要人工干预,会降低自动化系统的价值。 |
| 73 | +4. 训练算法 |
| 74 | + * 如果使用无监督学习算法,由于不存在目标变量值,则可以跳过该步骤 |
| 75 | +5. 测试算法 |
| 76 | +6. 使用算法 |
| 77 | +``` |
| 78 | + |
| 79 | +## Python语言的优势 |
| 80 | + |
| 81 | +1. 可执行伪代码 |
| 82 | +2. Python比较流行 |
| 83 | +3. Python语言的特色 |
| 84 | +4. Python语言的缺点 |
| 85 | +5. Python相关的库 |
| 86 | + * 科学函数库:`SciPy`、`NumPy`(底层语言:C和Fortran) |
61 | 87 | * 绘图工具库:`Matplotlib` |
0 commit comments