主流AI模型架构分类与核心原理详解

AI模型架构,简单说就是AI大脑的构造和思考方式。不同的架构,决定了AI擅长干什么、跑得多快、占多少内存、能不能在手机本地运行。

目前所有AI模型,一共就五大类:基础模型、Transformer大模型、新型轻量化模型、画图模型、图文多模态模型。下面用通俗易懂的方式,完整且直白的介绍所有架构。

一、基础通用架构(AI最初的形态)

这四类是最早的AI结构,现在不会单独拿来做大模型,但所有高级AI都是在它们基础上升级出来的。

1. MLP 全连接网络(最简单的AI)

最原始、最简单的AI结构。就是一层一层数据全连通,没有任何特殊技巧,只会简单计算、简单分类。

通俗理解:只会死记硬背、线性计算,看不懂图片、读不懂长句子。

用途:现在只当做大模型内部的“计算小零件”,不用来单独做AI对话。

2. CNN 卷积网络(AI 的眼睛)

专门为看图片诞生的结构。它会一点点提取图片的线条、纹理、形状,最后识别出这是什么物体。

通俗理解:视力很好,但没脑子。只会看图,看不懂文字、听不懂上下文。

用途:现在专门给多模态模型当“视觉解码器”,负责把图片变成AI能读懂的数字。

3. RNN/LSTM/GRU(最早的记忆AI,现已淘汰)

最早用来处理文字、语音的模型,有一点点记忆功能,能记住前面几句话的内容,算是最早会“读序列内容”的AI。

通俗理解:记性极差、读书超级慢。它必须一个字一个字按顺序读,不能跳着看,句子一长,开头的内容就彻底忘了。

现状:已经被彻底淘汰,现在的大模型没人用它做主结构,只存在于老旧教程里。

4. GNN 图神经网络(专门学“关系”的AI)

普通AI只处理单独的图片、文字,GNN专门处理有关系、有连接的数据。比如人和人的好友关系、化学分子结构、商品推荐关系。

通俗理解:不会聊天、不会画图,只擅长找事物之间的关联。

用途:金融风控、药物研发、社交分析,不属于聊天大模型体系。

二、Transformer 架构(现在所有大模型的亲爹)

现在你能用到的所有ChatGPT、Llama、通义千问、Qwen、Gemma,90%全是Transformer架构。它的核心绝活就是:全局通读、抓重点、懂上下文

Transformer一共就三个分支,只有一个是现在主流。

1. Encoder-only(只会理解,不会生成)

专门用来读懂内容、提取特征,但是不会写字、不会续写。

代表:BERT

用处:文本分类、语义检索、做向量数据库,不做AI聊天。

2. Encoder-Decoder(老派翻译架构,基本淘汰)

一半理解、一半生成,最早用来做机器翻译、文本摘要。

代表:T5、Flan-T5

现状:结构笨重、聊天效果差,现在移动端、本地大模型基本不用。

3. Decoder-only(当前绝对主流!重点)

纯解码器结构,专门用来写字、对话、续写、生成内容。所有主流开源大模型全部是它。

代表模型:Llama3/4、Qwen2/3、Gemma2/4、Mistral、Yi、GLM稠密版

通俗原理:AI从第一个字开始,一个字一个字往后猜(自回归),全程能看到全文上下文,精准理解整段话的意思。

优点:生态最全、工具最多、能本地部署、能量化、手机电脑都能跑。

缺点:文本特别长的时候,计算量大、占用内存(KV缓存)高。

Decoder-only 内部注意力进化(看懂新旧模型区别)

大模型迭代本质就是优化内存和速度,三代进化很简单:

  • MHA(初代):最笨、占用内存巨大、老旧模型用,现在淘汰
  • MQA(中期):稍微省内存,优化一般,逐步淘汰
  • GQA(现在标配):速度快、内存占用低、效果不掉点。现在所有新模型全是GQA

Decoder-only 两大分支:稠密 vs MoE

注意:MoE不是新架构,是Transformer的升级版!

  • 稠密模型:每次思考,全身所有参数全部开动。稳定、适合中小模型
  • MoE 混合专家模型:大脑分成很多个“专家小组”,每次思考只激活少数几个专家。参数超大、推理超快、超省算力

MoE代表:Mixtral、Qwen-MoE、Kimi K3、LFM2 MoE

通俗理解:稠密是全员上班,MoE是谁懂谁上班,效率极高。iPhone外接硬盘跑大模型,就是专门适配MoE架构。

三、新型轻量化架构(未来主流,替代传统Transformer)

为了解决 Transformer 长文本卡、内存高的问题,近几年出了一批新架构,主打:更快、更省内存、适合手机本地跑

1. LFM 液态模型

一半注意力、一半卷积,混合结构。不全程用笨重的全局计算,大量用轻量化局部计算。

优点:内存涨得慢、长文本稳、端侧部署友好。

代表:LFM2、LFM2.5 稠密/MoE

2. Mamba / Mamba2(颠覆式新架构)

彻底去掉了注意力机制,换了一套全新的思考方式(状态空间模型)。

最大优势:句子越长,它比Transformer越快、越省内存。

缺点:生态不如Transformer成熟,部分本地APP适配一般。

3. RWKV(国产极简架构)

无注意力、极简结构,极度省内存,专门适合超长文本本地推理,低端设备也能跑。

4. Hybrid 混合架构

一层Transformer、一层Mamba交替堆叠,结合两者优点:理解准、速度快。

代表:Jamba、Phi4 部分版本

四、画图生成架构(AI绘画专用)

1. GAN(现在已基本淘汰)

最早的AI画画架构,经常画畸形、画质差、不稳定,现在彻底不用。

2. 扩散模型 Diffusion(现在唯一主流)

现在所有AI画画、AI视频全部是扩散模型。

通俗原理:先把图片弄成全是噪点的糊图,再一点点还原、细化,根据你的文字指令生成高清画面。画质稳、细节多、可控性强。

五、多模态架构(既能认字、又能看图)

比如 Gemma4 VL、Qwen-VL、LLaVA 这种图文模型,结构统一、非常简单。

固定公式视觉编码器(看图) + 文本大模型主干(认字、思考)

工作流程

1. 图片交给 CLIP/SigLIP 编码器,变成AI能看懂的“图像文字”;

2. 图像信息和普通文字合并;

3. 送入Decoder-only大模型进行思考、回答。

小白必背

  • 老牌基础架构:MLP(计算)、CNN(看图)、RNN(旧记忆)、GNN(看关系)
  • 当前主流大模型:Decoder-only Transformer(GQA标配,稠密/MoE双分支)
  • 新锐提速架构:Mamba、LFM、RWKV、混合架构(适合本地手机跑)
  • 画图架构:扩散模型(唯一主流)
  • 多模态(支持图片和文字):图片编码器 + 文本大模型
说说我的看法