文章
全部内容 · 共 2 篇 · 最新在前
神经网络架构
Transformer 注意力机制——数学推导与实现要点
Transformer 注意力机制的原理与实现。从 Q、K、V 推导出发,说明多头注意力与位置编码,分析 O(N²) 瓶颈及 GQA 等优化路径。
浏览 15 次
2026-09-22 →
神经网络架构
MoE 混合专家架构——路由机制与显存特性
MoE 架构的机制与资源特性。说明五种路由方案的实现与训练特性,澄清“激活参数”与“显存占用”的区别,对比 2026 年 9 月主流实现。
浏览 15 次
2026-09-22 →