首页>罗辑思维免费阅读 > 第三章 神经网络萃取隐蔽相关性

第三章 神经网络萃取隐蔽相关性(第14页)

目录

,像一个孩子在没人教的情况下自己学习。

非监督学习最常用的情形是分类,例如一个孩子见过许多猫和狗后,如果大人不告诉孩子这两种动物的名字,孩子也许不知道名字,但慢慢会知道猫和狗是两种不同的动物。

在商业上有很多应用,例如在营销上面可以根据人群的不同属性将其划分成不同人群进行精准营销;在社交媒体上面,可以根据人们之间的互动次数,划出每个人的朋友圈子;在医疗诊断上面可以根据不同症状之间的相关性更精确地预测还未发现的疾病;等等。

增量学习和连续学习

目前的机器学习算法都是“离线训练”

,先用一大堆数据训练模型,训练完测试好就拿去做识别用,在识别过程中,这个模型是固定的。

如果发现了新的情况,有了新的训练数据,就要把新数据和原来的老数据合在一起重新训练这个模型,训练完还要重新测试才能使用。

许多互联网巨头每个月都要训练几十万个模型,目前的计算量主要在训练上。

增量学习就是当有新数据时,只用新数据训练原来的模型,使机器在原有的识别功能之上增加新的识别功能。

连续学习就是能够边识别边学习。

这两种学习算法都还在研究的早期阶段。

生成对抗网络

监督学习的最大问题之一就是需要大量人工标注的数据。

在很多情况下,要么没有数据,要么标注的工作量太大。

生成对抗网络(GenerativeAdversarialNetwork,GAN)解决了这个问题。

因此GAN成为目前最炙手可热的非监督学习算法之一。

GAN减少深度学习训练所需的数据量的方法是:从少量的已有数据出发去创造出更多的新的标注数据——多数情况下是图像数据。

图3.13是GAN的示意图,图中有两个深度神经网络:G和D,其中G是生成网络,D是鉴别网络。

生成网络的任务是根据一组真实、有限的数据(例如一组图片)生成更多类似但不同的数据。

然后把这些生成的数据和真实数据混在一起喂给鉴别网络。

鉴别网络的任务是使用很少的真实数据训练后,分出哪些是真实数据哪些是生成数据。

如果生成网络生成的数据能被鉴别网络认出来不是真实数据,就说明生成网络模仿得不够真实,需要继续调整网络参数,目的是让鉴别网络分不出来。

如果鉴别网络分不出来真假,就说明鉴别网络不够好,需要继续调整参数分出真伪。

这样“道高一尺,魔高一丈”

地持续对抗下去,两个网络就越来越好:生成网络模仿得越来越真,鉴别网络越来越“火眼金睛”

当两个网络打得难解难分时,生成网络生成出来的数据就和真实数据无法分辨。

当缺乏足够多的真实数据时这些生成数据就可以用于神经网络的训练了。

图3.13生成对抗网络

可以把这个过程想象为一个警察和假币伪造者之间的比拼,伪造者想把假币做得像真的,警察希望看到任何钞票时都能鉴别出真伪。

两个对抗网络也在彼此学习,也就是说,当一个网络努力去鉴别假币时,另一个网络就能把假币做得越来越真。

另一个例子是生成对抗网络可以模仿名画。

经过训练之后的最终结果是,一个网络可以像凡·高、毕加索一样作画,另一个网络能以你闻所未闻的洞察力鉴别画作。

这对于医疗等领域来说非常重要,在这些领域中,由于隐私的需要,可用的数据非常有限。

GAN可以填补缺失的数据,自行制作完全“臆造”

的病患数据,而这些数据在用于训练AI时和真实数据同样有效。

深度生成模型有广泛的应用,包括密度估计、图像降噪(从低分辨率或高噪音的图像中生成高品质图像)、图像修复(从部分残缺的图像中恢复完整图像)、数据压缩、场景理解、表征学习、3D场景搭建、半监督分类或分级控制等。

相比判别模型(例如CNN),生成模型更厉害的原因如下:

(1)能够从数据中识别并表现出隐藏的结构,例如三维物体的旋转、光强、亮度或形状等概念。

(2)能够想象世界“可以是什么样”

本章未完,点击下一页继续阅读



返回顶部