ARTICLE · INTELLIGENCE

战地情报 · 详情页

来自尧图项目组的一线实战观察与深度解析

从零手搓大模型(八)国产开源模型Qwen3

从零手搓大模型(八)国产开源模型Qwen3 Qwen3 From Scratch 教程:贴近现代国产开源模型的结构这个博客很适合想理解 Qwen 系列、国产开源模型、现代 LLM 工程结构的人。一句话理解:Qwen3 在 Llama 风格 decoder-only 架构上,加入了 Qwen 自己的配置、QK norm、GQA、RoPE、MoE 变体和 KV cache 推理优化。1. Qwen3 和 GPT 主线有什么关系主线章节的 GPT 是教学版:LayerNorm learned positional embedding MHA GELU FFNQwen3 更接近现代 LLM:RMSNorm RoPE GQA SwiGLU FFN 可选 QK norm 可选 MoE KV cache 推理所以这个 bonus 是从“会写 GPT”到“看懂现代开源模型”的重要过渡。2. Qwen3Model 的整体结构standalone-qwen3.ipynb里的核心模型是:
RELATED READING

延伸阅读

更多一线实战笔记与深度复盘,助您持续精进