Xavier初始化 Xavier初始化原理、数学推导与实战指南目录导读为什么需要关注初始化? – 梯度消失/爆炸的根源Xavier初始化的数学原理 – 方差守恒的推导过程激活函数的适配性分析 – 为何tanh优于ReLU... wen 2026-07-02 92
余弦退火 这是一个非常专业且重要的深度学习训练技巧,余弦退火是一种学习率调度策略,它让学习率在训练过程中按照余弦函数的形状进行衰减,下面我将从几个方面来详细解释它,它是什么?—— 一个形象的比喻想象一下,你正在... wen 2026-07-02 63
学习率调度 学习率调度(Learning Rate Scheduling)是深度学习训练中非常关键的一环,它的核心思想是:在训练过程中动态地调整学习率,而不是使用一个固定值,一个好的学习率调度策略,可以显著提升模... wen 2026-07-02 69
Kaiming He Here is a comprehensive overview of Kaiming He, one of the most influential computer scientists in t... wen 2026-07-02 57
Warmup预热 Warmup预热:解锁高效工作与运动表现的关键法则📖 目录导读什么是Warmup预热? ——概念解析与核心价值为什么预热如此重要? ——从生理到心理的科学依据高效预热的黄金法则 ——三大步骤与实用技巧... wen 2026-07-02 74
SGD动量 我们来详细解释一下 SGD动量(SGD with Momentum,带动量的随机梯度下降),这是一个在深度学习训练中非常重要的优化技术,它基本上解决了标准SGD(随机梯度下降)的两个主要问题:收敛速度... wen 2026-07-02 89
AdamW优化器 这是一个关于 AdamW 优化器 的详细解读,AdamW 是目前深度学习中(尤其是在 Transformer 架构和 LLM 训练中)最主流、最推荐的优化器之一,你可以把它理解为 Adam 的修正版,... wen 2026-07-02 125
梯度累积步长 这是一个很好的技术问题,在深度学习(特别是大模型训练)中,梯度累积步长(通常称为 Gradient Accumulation Steps,简写为 gradient_accumulation_steps... wen 2026-07-02 102
混合精度训练 混合精度训练(Mixed Precision Training)是一种通过结合使用单精度和半精度浮点数来加速深度学习模型训练、同时降低显存占用的技术,它已经成为现代大模型(如 GPT、Llama、St... wen 2026-07-02 72
梯度截断阈值 梯度截断阈值(Gradient Clipping Threshold)是训练深度神经网络(尤其是RNN、LSTM或Transformer)时用于防止梯度爆炸(Gradient Explosion)的一... wen 2026-07-02 90