强化学习强化学习是一种融合了监督学习与非监督学习特点的智能化学习方式,著名的 AlphaGo 便是通过强化学习学会围棋对弈,并战胜人类顶尖棋手。 在强化学习中,存在一个未知环境,智能体Agent可在其中采取行动,环境会根据不同行动给予反馈,智能体再依据反馈调整操作,如此不断循环。230 次阅读
Generative Adversarial Networks基于深度卷积的生成对抗网络(DCGAN),用于训练生成 MNIST 手写数字图像,整体目标是让生成器能从随机噪声中生成接近真实的手写数字图像262 次阅读
前向传播与反向传播反向传播根据损失函数计算梯度,并据此更新网络的权重和偏置。在这个过程中,从输出层开始,使用损失函数逐层计算每个神经元的误差,然后利用这些误差和前一层的激活值来计算当前层权重的梯度(即损失函数对权重的偏导数)。最后使用这些梯度,通过优化算法(例如梯度下降)更新网络的参数,以减小损失函数的值。计算梯度计算误差后,需要利用链式法则(Chain Rule)将损失函数的值反向传播到网络的每一层,并计算每个权重的梯度。梯度表示了损失函数相对于每个权重的变化率,用于指导调整权重以减小损失函数的值。257 次阅读
激活函数和损失函数激活函数中引入非线性,使神经网络能够拟合复杂的数据分布,解决非线性分类和回归问题。用于衡量模型的预测值与真实值之间的差异,并以此作为模型优化的目标。损失值越小,说明模型的预测结果和真实值越接近。316 次阅读