三天三夜,损失函数纹丝不动的痛苦折磨过。」
台下的研究员们不由自主地点头。
这苦他们确实都吃过。
「我们的解决方案其实非常简单,直接弃用了复杂的双曲正切和逻辑函数,采用f()=ma(0,)。」
「我们称之为ReIu,也就是修正线性单元。」
「在相同的网络结构下,使用ReIu的QInet,其收敛速度比使用Tanh的网络快了6倍!
35
然而,外行看热闹,内行看门道,台下的学者研究员们,都听懂了他的意思。
f()=a(0,),这个在数学上几乎可以说是初中水平的单侧仰制函数,竟然能带来6
倍的收敛速度提升?这意味着什麽?
这意味着在大规模工程实践中,计算效率将获得质的飞跃!
「那过拟合呢?」一位M1T的教授追问,「120万张图,8层网络,6000万个参数,参数比的样本还多——我是说,这麽大的模型,你怎麽保证它不是把训练集背下来了?」
这个问题问到了点子上,全场再次安静。
「确实会有这种的担忧,所以为了防止它在测试集上出现这种情况,我们引入了一种全新的正则化技术。」
「也就是Dropout随机失活。」
「它的原理是,在每一次前向传播中,以50%的概率随机将部分神经元的输出置为零,这些被选中的神经元在这一轮训练中,既不参与前向传播,也不参与反向传播。」
「这相当於每次训练,都在训练一个不同的网络,最後做预测时,等於把无数个网络的意见集合起来,一个神经元摸了鱼,其他神经元就不敢太依赖它,逼着整个网络学到更健壮的特徵。」
「最後一个问题。」
MIT的领队现在已经从质疑变成了纯粹的好奇:「如此庞大的训练,常规的CPU集群跑下来,没有几个月根本不可能,你们是用了什麽超算?哪个国家实验室赞助的?」
所有人都以为,漆昊背後一定站着某个庞大的机构。
漆昊直接回答:「其实没有用超算。」
「当时我只是想测试我的想法是否可行,所以就用了两块GTX580。」
「两块GTX580?」MIT教授不敢相信自己听到的信息,「打游戏的那种?」
台下顿时响起了一片倒吸凉气的声音。
本章未完,请点击下一页继续阅读!