1.Why Deep-Learning?
一个监督学习问题通常始于以下三个要素:定义在样本对上的概率分布、损失函数以及假设类。经典学习理论关注的是:为了使经验风险最小化方法能够逼近该假设类中具有最优总体风险的预测器,需要多大的样本量?
深度学习改变了这一问题的侧重点。它所使用的假设类不仅规模庞大,而且由分层的非线性映射参数化;这种参数化结构的几何性质会受到网络架构、初始化、优化方法、数据以及模型规模的共同影响。
因此,深度学习理论所研究的核心对象不再只是一个函数类,而是一个由以下部分耦合而成的系统:
- 表征;
- 训练动力学;
- 统计选择机制。
我希望在学完后可以回答以下问题:
- 表达能力
深层架构能够高效逼近哪些函数?与浅层表示相比,深度在什么条件下能够降低表示复杂度?
- 优化与选择
为什么基于梯度的方法能够在非凸、过参数化的系统中找到有用的解?算法会对最终解施加什么样的隐式偏好?
- 泛化与稳定性
高容量模型为什么能够避免朴素复杂度度量所预测的失败?在现代深度学习的训练范式下,哪些理论仍然具有解释力?
- 现代机制
为了解释鲁棒性、生成模型、Transformer、规模定律、可解释性、偏好优化以及涌现式泛化,我们还需要哪些新的理论工具?
Where we start?
深度学习理论始于一个看似简单的问题:神经网络能够表达哪些函数?
这个问题并不只是关于网络的形式或架构。一个训练完成的神经网络只有在以下三件事情同时发生时才真正有用。
第一,所选择的模型类必须包含一个总体风险较小的预测器,或者至少能够对其进行良好逼近。
第二,训练算法必须能够找到一组参数,使其经验目标具有足够好的竞争力。
第三,根据有限样本选择出来的函数,还必须能够在未见过的数据上继续保持良好表现。