很多新手刚接触AI、大模型、本地部署时,都会被“模型架构”搞混淆。简单来说,模型架构就是AI的大脑结构与思考规则,决定了AI能做什么、运行速度快慢、占用内存大小、是否适合手机/电脑本地运行。
整体架构分为四大体系:基础通用架构、Transformer标准大模型架构、新兴非Transformer/混合架构、多模态专属架构。
一、基础通用架构(所有AI的底层根基)
这四类是深度学习的入门基石,是所有复杂大模型的底层逻辑,目前不单独作为主流大模型主干,但所有高端AI都基于它们迭代优化而来。
1. 全连接神经网络(MLP/FCNN)
AI最基础的“原始大脑”,结构最简单,仅由输入层、隐藏层、输出层组成,每层神经元与上层全部连接。可以理解为层层传话的简单流水线,只做基础数据计算,没有特征提取、没有记忆能力。
核心特点:结构简单、训练门槛低;处理图片、文字、长序列数据效率极低、算力浪费严重。
适用场景:简单表格数据预测、分类任务,作为所有大模型的底层网络单元,不单独用于主流AI产品。
2. 卷积神经网络(CNN)
AI的专属“眼睛”,计算机视觉的绝对核心架构,专为处理图片、静态画面诞生。核心逻辑是从细节到整体提取图像特征,先识别线条、纹理,再拼接成完整物体,搭配参数共享机制大幅降低计算量。
核心特点:图像识别精准、效率高;无时序记忆能力,看不懂文字上下文、无法处理序列数据。
适用场景:人脸识别、图像分类、医学影像识别、图片修复,如今主要作为多模态模型的视觉编码器,不再单独做文本大模型。
3. 循环神经网络(RNN/LSTM/GRU)
初代时序记忆架构,最早用来处理文字、语音、股价等有先后顺序的数据,相当于给AI装上短期记忆,读后续内容能关联前文信息。
核心痛点(已淘汰):必须逐字顺序计算、无法并行,训练和推理速度极慢;超长文本会遗忘前文内容,算力成本极高。目前已被Transformer全面替代,仅少量轻量化老旧项目使用。
4. 图神经网络(GNN)
小众专业架构,专门处理带关联关系的数据,比如社交好友关系、分子结构、商品推荐、交通路网。核心是挖掘节点之间的隐性关联规律。
适用场景:金融风控、药物研发、知识图谱、电商推荐,不属于通用大模型架构,仅用于细分专业领域。
二、现代大模型核心:Transformer 完整谱系
Transformer是当前通用大模型的绝对基石,90%以上开源对话大模型、生成式AI都基于该架构迭代。它彻底解决了传统RNN记忆短、速度慢的问题,依靠自注意力机制实现全局上下文理解。
Transformer分为三大分支,其中有一类是现在的大语言模型的主流。
1. Encoder-only(仅编码器)
定位:只理解、不生成,擅长语义分析、特征提取,无文本生成能力。
代表模型:BERT、RoBERTa
现状:本地聊天大模型几乎不用,仅用于AI检索、文本分类、嵌入向量生成。
2. Encoder-Decoder(编解码混合)
定位:擅长转换类任务,编码理解内容、解码输出结果,适配翻译、摘要、改写。
代表模型:T5、Flan-T5、BART
现状:结构冗余、生成能力弱,移动端、通用对话模型基本淘汰。
3. Decoder-only(仅解码器)
定位:专为生成而生,纯解码器堆叠,采用自回归生成模式(逐个预测文字Token),依靠自注意力捕捉全局上下文,是当前90%开源大模型的核心架构。
代表模型:Llama 3/4、Qwen 2/3、Gemma 2/4、Mistral、Yi、Bonsai、GLM稠密版
核心优势:结构统一、生态成熟、量化工具完善、GGUF/MLX权重适配所有本地部署设备,适配对话、创作、代码生成等全场景。
短板:超长上下文、超大参数量场景下,全局注意力计算成本高、内存消耗大。
Decoder-only 注意力机制迭代
大模型的核心优化都集中在注意力机制,直接决定模型速度和内存占用:
MHA(多头注意力):初代方案,KV缓存体积巨大、内存占用高,基本淘汰
MQA(多查询注意力):早期精简方案,优化有限,逐步被GQA替代
GQA(分组查询注意力):现在最常用,大幅压缩KV Cache体积,推理速度更快、移动端/本地部署友好,所有新款主流模型均采用该方案
Decoder-only 两大分支:稠密模型 + MoE稀疏模型
MoE不是独立新架构,是Transformer Decoder-only的进阶变种,专为超大模型降本提速而生。
稠密模型:每次推理,模型全部参数全员参与计算,稳定性强、适配所有场景,适合中小参数量模型
MoE 混合专家模型(稀疏架构):每层不再是单一网络,而是多个“专家网络”,通过路由机制,每次推理只激活少数专家参数。特点是总参数量极大,但单次计算量小、速度快、算力成本低。
MoE代表模型:Mixtral 8x7B、Qwen-MoE、Kimi K3、LFM2 MoE
核心适配场景:超大模型推理、超长文本处理,iPhone外接硬盘流式加载、端侧大模型轻量化部署,均专门针对MoE架构优化。
三、新锐进阶架构(非Transformer/混合架构,移动端提速主流)
近几年为解决Transformer“长文本算力爆炸、KV缓存过高”的痛点,行业诞生了一批新型架构与混合架构,主打边缘设备、手机、本地部署提速,是当前轻量化大模型的研发热点。
1. LFM 液态基础模型(Liquid Foundation Model)
核心结构:注意力机制 + 门控一维卷积(LIV)混合架构
用轻量化局部卷积替代部分全局注意力,大幅降低计算开销,KV Cache增长极其平缓,长文本推理优势明显,兼顾效果与速度。
代表模型:LFM2、LFM2.5(稠密版+MoE稀疏版)
2. Mamba / Mamba 2(SSM状态空间模型)
颠覆性特点:彻底去掉传统自注意力机制,用状态空间序列建模处理文本。计算复杂度随上下文线性增长,彻底解决Transformer长文本算力爆炸问题。
优势:超长文本速度极快、内存占用低;短板:MLX框架原生优化不足,部分移动端App适配不如Transformer成熟。
代表模型:Mamba 2.8B/7B、Jamba(Mamba+Transformer混合架构)
3. RWKV(国产轻量化时序架构)
国内开源专属架构,无注意力机制,融合RNN与线性注意力思路,极致节省KV内存,是超长文本本地推理的最优轻量化方案之一,适配低端设备本地部署。
4. Hybrid 交替混合架构
采用“一层注意力 + 一层SSM状态空间”交替堆叠的混搭结构,结合Transformer的理解优势和SSM的速度优势,综合性能更强。
代表模型:Jamba、Phi-4 部分变体
四、生成式专属架构(图像/视频创作)
这类架构不做文本对话,主打无中生有创作内容,是AI绘画、AI视频的底层核心。
1. GAN 生成对抗网络
通过“生成器+判别器”对抗训练创作内容,早期用于AI绘画、换脸。缺点是训练不稳定、画面容易畸形失真,目前已全面淘汰。
2. 扩散模型(Diffusion Model)
现在Midjourney、Stable Diffusion等所有主流AI绘画、视频生成工具的底层架构。核心逻辑是“先加噪破坏、再降噪重建”,生成画面细节饱满、稳定性强、可控性高,全面替代GAN。
当下GAN架构已淘汰,主流普遍已采用扩散模型。
五、多模态架构(图文音一体,Gemma4 VL/Qwen-VL通用逻辑)
所有图文、音视频多模态大模型,均采用专属编码器和文本大模型主干的固定组合架构,逻辑统一、无例外。
通用运行流程:
- 图片/视频通过SigLIP/CLIP视觉编码器,转化为AI可识别的图像Token;
- 将图像Token与文本Token合并;
- 送入Decoder-only Transformer文本主干,完成理解、问答、生成。
代表模型:Gemma 4 VL、Qwen-VL、LLaVA 全系多模态模型
六、小白速记
当下的主流架构:Decoder-only Transformer(普遍采用GQA分组查询注意力),分为稠密模型、MoE稀疏模型两大分支
端侧架构:LFM、Mamba2、RWKV、Transformer+SSM混合架构
图像生成专属:扩散模型(Diffusion Model)
多模态通用:视觉编码器 + Decoder-only文本主干
老旧淘汰/小众专用:RNN/GAN、Encoder-Decoder、纯MHA/MQA架构
细分领域专用:CNN(视觉编码)、GNN(关系数据)、MLP(基础计算)
七、小白高频疑问解答
1、MoE、Mamba、LFM 属于 Transformer 吗?
MoE是Transformer Decoder的衍生变种,属于Transformer家族;Mamba、RWKV、原生LFM属于非Transformer新锐架构,是替代Transformer的轻量化方案。
2、新手重点学哪些架构?
优先吃透:Decoder-only Transformer(GQA+稠密/MoE)、扩散模型、Mamba/LFM新锐架构、多模态混合架构,即可覆盖99%的主流AI模型场景。