【HCIA- AI(正课)】2.6.Transformer架构和Diffusion结构介绍
·
















Diffusion结构介绍













算力基础概念
AI芯片介绍
Transformer架构、生成模型演进等内容讲解:
-
核心内容:覆盖 Atlas 800、Atlas 900 等 IE 实验涉及的硬件内容,以及鲲鹏 920 芯片相关介绍。
-
Transformer架构核心知识点讲解
- Attention机制核心原理
-
核心作用逻辑:核心作用是让模型带着问题匹配上下文重点,自动为关键信息分配更高权重,解决长距离依赖问题。
-
标准实现流程:实现分为三步,依次为生成自定义QKV矩阵、计算注意力权重、权重与V加权求和输出结果。
-
相较传统模型优势:相较RNN、LSTM具备并行计算能力,可捕捉全局依赖,支持动态权重分配适配不同场景需求。
-
多头注意力机制:通过多组独立QKV并行计算,提升模型在不同场景下的信息捕获能力,同时通过多粒度信息融合保障输出稳定性。
-
- Transformer基础组件功能
- 残差连接(ADD):用于解决深度神经网络的梯度消失、网络退化问题,通过捷径链路简化反向传播的链式求导过程。
- 归一化(Normalization):对网络中间输出数据做标准化处理,避免数据幅度过大,保障网络运行的稳定性与训练效率。
- 全连接神经网络:Transformer的最终输出层,所有张量计算最终都需通过全连接层完成结果的输出与映射。
- 张量与矩阵计算基础
- 张量维度对应规则:一维张量对应向量,二维张量对应矩阵,更高维张量由低维张量逐层堆叠,神经网络底层本质为张量运算。
- 全连接层拉平逻辑:输入的二维像素矩阵需先通过flatten操作拉平为一维向量,匹配矩阵相乘的维度要求,支持批次并行训练。
- 维度校验要求:搭建全连接层时需严格校验前后层矩阵的行列匹配关系,维度参数错误会直接导致网络运行失败。
- 整体架构与运行逻辑
- 编码器(Encoder)结构:输入数据经分词、词嵌入、位置编码后,依次经过注意力层、残差归一化层、全连接层,可堆叠N层扩容参数。
- 解码器(Decoder)结构:在编码器基础上新增掩码(Mask)多头注意力机制,通过遮掩后续位置信息,模拟逐词输出的预测逻辑。
- 主流模型适配:GPT、BERT等主流大模型可根据需求单独使用编码器或解码器模块,最终通过线性层与ReLU激活完成输出。
- 配套PPT说明:本次配套使用华为官方PPT,内容表述相对精简,本次讲解补充的拓展内容为核心学习要点。
- 可视化演示核心结论
- 维度不变性规则:输入词向量维度为 768 维,经位置编码、自注意力机制处理后,输出维度始终保持 768 维不变。
- 批量计算逻辑:实际运行时会将QKV三个矩阵合并为大矩阵做批量运算,而非逐个向量单独计算,提升整体运算效率。
- 结果输出逻辑:最终经全连接层与softmax函数输出各候选词的概率,按概率排序选择对应结果完成预测。
- Attention机制核心原理
-
生成模型演进与Diffusion基础介绍
- 早期生成模型技术基础
- 生成对抗网络(GAN):由生成器、判别器两个网络构成对抗训练关系,生成器从高斯分布噪声出发生成样本,判别器负责判别真伪。
- 其他早期生成模型:VAE采用“压缩-还原”的变分下界优化逻辑,可逆变换模型通过数据分布的可逆变形实现样本生成。
- Diffusion模型核心逻辑
- 基础原理:源自非均衡热力学的扩散逻辑,分为正向加噪、反向去噪两个过程,正向逐步为图片添加高斯噪声直至变为纯噪点。
- UNet结构实现:采用“下采样-上采样”的U型结构,下采样通过卷积、池化压缩图片实现加噪,上采样恢复尺寸实现去噪。
- Stable Diffusion逻辑:通过CLIP模块完成文本与图片的跨模态关联,CLIP团队开源了4亿组图文配对标签数据集,为模型训练提供支撑。
- 早期生成模型技术基础
鲲鹏昇腾开发者社区是面向全社会开放的“联接全球计算开发者,聚合华为+生态”的社区,内容涵盖鲲鹏、昇腾资源,帮助开发者快速获取所需的知识、经验、软件、工具、算力,支撑开发者易学、好用、成功,成为核心开发者。
更多推荐


所有评论(0)