Yowakko Jay
郁二杰的博客。深耕 AI / 深度学习方向,关注大模型后训练、GRPO、归一化、多智能体工作流等话题。崇尚独立探索,注重基础,知其然也知其所以然。
在这里找到我
最新文章
-
探索一套基于 Golutra + OpenClaw + Feishu 的自动化 AI 工作流系统,经一周实战测试验证其有效性,分享设计理念、测试成果与未来改进方向。
-
从 Z-Score 标准化到 Batch Norm、Layer Norm、RMSNorm,深入对比深度学习中的归一化方法,并用 Pytorch 代码演示它们在 4 维张量上的差异。
-
用 Qwen2.5-0.5B/3B/7B 在 GSM8K 上做 GRPO 强化学习的完整实践记录,深入排查奖励陷阱(Reward Trap)、loss 归零、复读机等问题及 reward engineering。
-
从微积分基础到中心极限定理,系统梳理概率论与数理统计的核心概念:极限、导数、贝叶斯公式、随机变量与分布、期望方差协方差、CLT。
-
在 Windows 10/11 系统上从零配置 Pytorch 深度学习环境,涵盖 VSCode、Conda、NVIDIA 驱动、CUDA Toolkit、cuDNN 与 pip 安装 Pytorch 的全流程。