大模型术语词典——120 个核心概念速查
面向初学者的 LLM 术语速查。收录 120 个核心概念,按模型结构、推理、上下文、评估、应用、安全六类编排,每词列中英文对照、释义与常见误用。
大模型术语词典概念速查2026Q3
分类:入门与导航 › 核心概念词典
发布于 2026-09-22
19 次浏览
说明
本词典覆盖 2026 年 9 月大模型领域 六大类共 120 个核心术语,每个词条含"术语 + 一句解释 + 常见误用场景"。使用方式:遇术语先看中英对照与"误用",可排查表述错误还是概念混淆。六大类:①模型结构与训练 ②推理与部署 ③上下文与记忆 ④评估与对齐 ⑤应用与架构 ⑥安全与合规。
不包含
- "大模型训练相关术语"中的分布式训练细节(ZeRO 系列 / FSDP / 混合并行),本篇不展开,参考相关章节
- "多模态相关术语"中的CLIP / DINOv2 / SigLIP 等视觉模型,参考相关章节
- "推理框架相关术语"中的vLLM / SGLang / TensorRT-LLM 特有术语,参考相关章节
这 3 板块各有专门的主题文章覆盖,本篇只覆盖"通用 + 高频"的 120 个术语,用于速查与防误用。
一 术语分类
1.1 模型结构与训练(25 个)
| 术语 | 一句话解释 | 常见误用 |
|---|---|---|
| Transformer | 2017 Google 提出的神经网络架构,核心是自注意力机制(Self-Attention) | 误用:把"Transformer"当作"大模型" |
| Decoder-Only | 只用解码器生成序列(如 GPT、LLaMA、Qwen) | 误用:与 Encoder-Only(BERT)混淆 |
| MoE(混合专家) | 多个子网络(专家)按需路由,激活参数远小于总参数 | 误用:"激活参数小" ≠ "显存小" |
| MoE 路由(Router) | 根据输入 token 选择激活哪几个专家 | 误用:把"路由"理解为"分类" |
| 同参数量 | 训练参数总数,决定模型大小 | 误用:把"同参数量"当作"文件大小" |
| 稠密模型(Dense) | 每个 token 都会激活全部参数 | 误用:与 MoE 区分不清 |
| ReZero / ReLU | 激活函数 / 残差连接变体 | 误用:把 ReZero 误当 ReLU |
| Layer Norm | 对层输入标准化,稳定训练 | 误用:与 Batch Norm 等同 |
| 残差连接(Residual) | 跳过若干层,让梯度 / 信息流更短 | 误用:把"跳层"当作"删层" |
| 位置编码(Positional Encoding) | 让 Transformer 感知 token 顺序(旋转 / 正弦 / 可学习) | 误用:把"位置编码"理解为"输入顺序" |
| 旋转位置编码(RoPE) | 用旋转矩阵编码位置信息,跨长度泛化更好 | 误用:把 RoPE 当作"分页编码" |
| 注意力头注意力(Attention Head) | QKV 矩阵被切分为多个头,各自独立计算 | 误用:"头"数与"GPU 核"数混淆 |
| Head Dim | 每个注意力头的维度,决定了单次注意力的内存占用 | 误用:与 embedding dim 混同 |
| MLP 层 | Transformer 块内的两层全连接(FFN / FFN 变体) | 误用:把整个 Transformer 叫 MLP |
| 交叉注意力(Cross-Attention) | Q 来自 Encoder,K/V 来自 Decoder(如 LVLM) | 误用:把 Encoder-Decoder 全部叫 cross-attention |
| 自注意力(Self-Attention) | Q/K/V 都来自同一序列 | 误用:把"注意力" = "记忆" |
| Embedding 词嵌入 | 把 token 映射到连续向量,是模型的"记忆" | 误用:把 embedding 当作"词向量" |
| Tokenizer | 把文本切成 token 表(字节对编码 / BPE / SentencePiece) | 误用:"切字" ≠ "切 token" |
| Token 多 | 已训练好的"单位",是词嵌入查表单位 | 误用:把"token"当"句子" |
| 上下文窗口(Context Window) | 模型一次能"读"到的最大 token 数 | 误用:把"上下文窗口"当作"最长回复" |
| Context Length | 单次推理时能携带的最大 token 数 | 误用:与"训练长度"混淆 |
| Pretraining(预训练) | 用大量语料无监督训练出基础模型 | 误用:把"预训练" = "第一阶段" |
| Instruction Tuning(指令微调) | 用问答对训练,让模型遵循指令 | 误用:把"指令微调"当作"从 0 开始训" |
| SFT(监督微调) | 用带标签数据微调,比指令微调范围更大 | 误用:把"SFT"叫成"训练" |
| LoRA(低秩适配) | 只微调低秩增量矩阵,大幅降低微调成本 | 误用:把 LoRA 当作"少样本学习" |
1.2 推理与部署(20 个)
| 术语 | 一句话解释 | 常见误用 |
|---|---|---|
| 推理(Inference) | 用训练好的模型做前向计算,产出 token 序列 | 误用:把"推理"当"训练" |
| 生成(Generation) | 逐 token 自回归地生成输出 | 误用:把"生成"与"翻译"混同 |
| 逐 token 生成(Autoregressive) | 每次只生成 1 个 token,基于之前全部历史 | 误用:把"逐 token"当作"快速" |
| 解码策略(Decoding) | 控制"下一步选哪个 token":greedy / beam / top-p / top-k | 误用:"解码" = "编码"混淆 |
| Temperature | 控制输出概率分布的"锐度",1.0 以下偏确定, | 误用:把数值当"速度" |
| Top-P(核采样) | 只从累积概率达到 P 的 token 池里采样 | 误用:"P" = "概率"读错 |
| Top-K | 只从概率最高的 K 个 token 里采样 | 误用:"K" = "K-means" |
| Beam Search | 同时探索多个候选路径,适合翻译 / 代码 | 误用:把 beam 当"快速" |
| Greedy Decoding | 每步选概率最大的 token,确定性最强 | 误用:把 greedy 当"最优" |
| PagedAttention | 把 KV Cache 分页,减少内存碎片,提升并发吞吐 | 误用:"分页" = "分页不存"耐 |
| Batch Size | 单次推理 / 训练的 token 处理数量 | 误用:"batch" = "批次大小"机械翻译 |
| Continuous Batching | 动态拼接新请求,提升 GPU 利用率 | 误用:"连续" = "不停" |
| Speculative Decoding | 用小模型先猜 N 步,大模型一次验证,加快速度 | 误用:"投机" = "猜" |
| Quantization(量化) | 把权重 / 激活从 FP32/FP16 降到 INT8/INT4 | 误用:"量化" = "压模型" |
| AWQ(激活感知量化) | 按激活权重重要性做 4-bit 量化 | 误用:把 AWQ 当作"官方量化" |
| GGUF | llama.cpp 的量化格式,按 Q2/Q4/Q8 分精度 | 误用:把 GGUF 当作"模型格式"通用名 |
| Tensor Parallel | 把模型层切到多卡,每卡存一部分层 | 误用:"张量并行" = "层并行" |
| Pipeline Parallel | 把多层分到多卡,像流水线一样并行 | 误用:"流水线" = "顺序处理" |
| NCCL | NVIDIA 集体通信库,多卡带宽与同步核心 | 误用:把 NCCL 当作"驱动" |
| MoE All-Reduce | MoE 路由后多卡合并专家的通信算子 | 误用:"all-reduce" = "reduce-all" |
1.3 上下文与记忆(15 个)
| 术语 | 一句话解释 | 常见误用 |
|---|---|---|
| Context Window | 模型一次能"读完"的最大 token 数(4K / 8K / 32K / 128K) | 误用:与"上下文窗口长度"混用 |
| KV Cache | 把已计算的 Key/Value 向量存起来,避免重算 | 误用:"KV 缓存" = "GPU 缓存" |
| 滑窗注意力 | 只关注最近的 K 个 token,限制注意力范围 | 误用:"滑窗" = "截断" |
| 注意力池化(Attention Pooling) | 对序列做特征池化,用于检索 / 向量化 | 误用:"池化" = "批量" |
| 截断(Truncation) | 超长输入被裁掉,丢失信息 | 误用:"截断" = "变短" |
| Summary 记忆 | 用摘要代替原始历史,节省上下文 | 误用:"摘要记忆" = "压缩记忆" |
| 短期记忆(Short-term) | 当前对话窗口内的内容 | 误用:"短期" = "几小时" |
| 长期记忆(Long-term) | 跨会话的持久化记忆(向量库 / 数据库) | 误用:"长期" = "几个月" |
| 工作记忆(Working Memory) | 处理中"活跃使用"的信息,类比人脑工作记忆 | 误用:"工作" = "职场" |
| 记忆压缩(Memory Compression) | 把记忆压成低维 / 摘要,牺牲精度换空间 | 误用:"压缩" = "删除" |
| 检索增强(Retrieval-Augmented) | 先把相关信息检索出来,再喂给模型 | 误用:"增强" = "增强能力" |
| Context Cache | 服务端缓存同前缀的 KV Cache,命中可省 10-30 倍成本 | 误用:"上下文缓存" = "会话缓存" |
| 命中率(Hit Rate) | 缓存命中次数 / 总请求次数 | 误用:"命中率" = "准确率" |
| Prompt 前缀(Prompt Prefix) | 多个请求共享的头部 token,适合做缓存 | 误用:"前缀" = "开头文字" |
| Semantic Windowing | 按语义分块,比固定 token 数切分更稳 | 误用:"语义" = "字面" |
1.4 评估与对齐(18 个)
| 术语 | 一句话解释 | 常见误用 |
|---|---|---|
| Benchmark | 一组标准测试集,衡量模型"成绩" | 误用:"基准" = "起点" |
| Perplexity(PPL) | 语言模型对文本的"惊讶程度",越低越好 | 误用:"困惑度" = "困惑" |
| Accuracy(准确率) | 预测正确比例 | 误用:"准确" = "好" |
| F1 Score | 精确率与召回率的调和平均 | 误用:"F1" = "partial" |
| Recall(召回率) | 相关项被检出的比例 | 误用:"召回" = "回忆" |
| Exact Match(EM) | 预测与标准答案完全一致 | 误用:"精确匹配" = "完全一样" |
| ROUGE | 摘要评估指标,基于重叠度 | 误用:"摘要" = "总结" |
| Elo / GPT-Eval | 模型两两对战,用 Elo 排名 | 误用:"对战" = "比赛" |
| Human Eval | 人类打分,主观但更贴近"好" | 误用:"人工评估" = "人工打分" |
| LLM-as-Judge | 用大模型当评委给别的模型打分 | 误用:"LLM 判" = "自动评估" |
| RLHF(基于人类反馈的强化学习) | 先训 reward model,再用 RL 优化模型 | 误用:"强化学习" = "人类偏好" |
| DPO(直接偏好优化) | 不训 reward model,直接对齐偏好 | 误用:"DPO" = "RLHF 简化" |
| 宪法 AI(Constitutional AI) | 用一组"原则"约束模型行为 | 误用:"宪法" = "规则" |
| PPO(近端策略优化) | RLHF 主力算法,多步迭代 | 误用:"PPO" = "RL 算法" |
| REINFORCE | 早期 RL 策略梯度算法 | 误用:"REINFORCE" = "强化" |
| IPS(逆倾向得分) | 纠正"采样偏差"的 RL 估计方法 | 误用:"IPS" = "倾向" |
| KL 散度 | 两个概率分布差异,RLHF 常用作正则项 | 误用:"KL" = "距离" |
| 奖励模型(Reward Model) | 根据人类偏好训练出来的"打分器" | 误用:"奖励" = "奖励金" |
1.5 应用与架构(25 个)
| 术语 | 一句话解释 | 常见误用 |
|---|---|---|
| LLM 网关(LLM Gateway) | 统一入口,负责路由、限流、计量、审计 | 误用:"网关" = "API 客户端" |
| 路由(Routing) | 按请求特征分发到不同模型 / 端点 | 误用:"路由" = "转发" |
| 负载均衡(Load Balancing) | 把流量分散到多实例 | 误用:"负载均衡" = "分流量" |
| 限流(Rate Limiting) | 控制每秒 / 每分钟请求数 | 误用:"限流" = "调慢" |
| 熔断(Circuit Breaking) | 上游故障时自动断开,避免雪崩 | 误用:"熔断" = "断网" |
| 降级(Fallback) | 主服务挂了走备用方案 | 误用:"降级" = "差服务" |
| MCP(Model Context Protocol) | 统一的"模型 - 工具"通信协议(Anthropic 2025) | 误用:"MCP" = "插件" |
| 函数调用(Function Calling) | 模型输出结构化的"调用工具"指令 | 误用:"函数" = "方法" |
| 工具调用(Tool Calling) | 模型调用外部工具(API / 数据库 / 搜索) | 误用:"工具" = "插件" |
| 结构化输出(Structured Output) | 强制模型输出符合 JSON Schema 格式 | 误用:"结构化" = "表格化" |
| RAG(检索增强生成) | 先检索相关资料再让模型生成 | 误用:"RAG" = "增强" |
| 向量数据库(Vector DB) | 专存高维向量,支持相似检索(Milvus / Qdrant / pgvector) | 误用:"向量库" = "图库" |
| Embedding Model(嵌入模型) | 把文本 / 图像 / 音频映射为向量 | 误用:"嵌入模型" = "模型" |
| Colbert | 多向量交互检索模型,适合语义级搜索 | 误用:"Colbert" = "向量库" |
| Indexing Layer | 向量化 / 建索引层 | 误用:"索引" = "目录" |
| Chunking(分块) | 把长文本切成小块,方便向量化和检索 | 误用:"分块" = "切片" |
| Overlap(重叠) | 相邻块之间重复的 token 数,保证上下文衔接 | 误用:"overlap" = "重复" |
| Re-ranking | 对初检结果再排一次,提升 top-k 精度 | 误用:"重排" = "重复排序" |
| 意图识别(Intent Detection) | 判断用户想要做什么(客服 / 搜索 / 创作) | 误用:"意图" = "想法" |
| 对话管理(Dialogue Management) | 管理对话状态,控制轮次与跳转 | 误用:"管理" = "控制" |
| 多轮对话(Multi-turn) | 同一会话里跨多轮,模型用历史记忆 | 误用:"多轮" = "多任务" |
| Agent(智能体) | 能自主决策 + 调用工具 + 处理多步任务的实体 | 误用:"Agent" = "聊天机器人" |
| Multi-Agent(多智能体) | 多个 Agent 协作完成复杂任务 | 误用:"多 Agent" = "多模型" |
| Orchestration(编排) | 多个 Agent / 任务之间的协调与调度 | 误用:"编排" = "排序" |
| Observability(可观测性) | 指标 + 追踪 + 日志,能"看到"系统什么状态 | 误用:"可观测" = "可监控" |
1.6 安全与合规(17 个)
| 术语 | 一句话解释 | 常见误用 |
|---|---|---|
| Prompt Injection(提示注入) | 恶意输入注入 prompt,让模型偏离原意 | 误用:"提示注入" = "注入提示" |
| 越狱(Jailbreak) | 绕过安全限制让模型输出违规内容 | 误用:"越狱" = "反过滤" |
| 数据脱敏(Data Masking) | 把敏感字段替换成占位符 | 误用:"脱敏" = "删除" |
| RAG 越界攻击 | 通过 RAG 检索结果让模型输出训练数据 | 误用:"越界" = "超出" |
| 输出过滤(Output Filter) | 对模型输出做规则 / 模型双重过滤 | 误用:"过滤" = "删除" |
| 内容审核(Content Moderation) | 检测违规内容,用于用户 UGC | 误用:"审核" = "检查" |
| 偏见(Bias) | 模型对群体 / 性别的系统性偏差 | 误用:"偏见" = "偏好" |
| 幻觉(Hallucination) | 模型输出内容不存在 / 不准确 | 误用:"幻觉" = "胡说" |
| 可解释性(Interpretability) | 能说出模型为什么这么答 | 误用:"解释" = "说明" |
| 公平性(Fairness) | 对平稳评估,确保群体公平 | 误用:"公平" = "平等" |
| 隐私计算(Privacy-Preserving) | 在保护数据前提下做计算(联邦 / 同态加密) | 误用:"隐私" = "暗中" |
| 数据出境(Data Cross-border) | 数据跨越国境,受中国法规限制(2026-09 节点) | 误用:"出境" = "出公网" |
| 训练数据追溯(Provenance) | 记录模型训练数据的来源,用于版权合规 | 误用:"溯源" = "查服务器" |
| 输出授权(License) | 模型输出的使用权状态(商业 / 教育 / 研究) | 误用:"授权" = "激活" |
| 模型水印(Model Watermark) | 给生成内容打隐藏标记,识别来源 | 误用:"水印" = "logo" |
| 供应链安全(Supply-chain) | 模型 / 框架 / 数据集的引入风险 | 误用:"供应链" = "供应商" |
| 合规(Compliance) | 满足行业法规(GDPR / 个保法 / 数据安全法) | 误用:"合规" = "合法" |
二 使用建议
- 查词速度:遇到一个术语,先查中英对照,再看"常见误用",快速判断是表述错误还是概念混淆。
- 术语使用规则:同篇文章里同一个术语必须统一名称(如"KV Cache"不能写成"KV 缓存"),英文首字母大写规范(如 RoPE / MoE / RAG)。
- 学习顺序建议:①-2 → 4 → ⑤,先打基础(模型架构 + 推理),再上应用层,最后到安全合规。
- 误用自检:写技术文章前,可以列术语表 + 误用列,对照排查。
- 更新节奏:大模型领域术语每 6 个月需要一次更新(例如 "MoE 路由" 2024 上半年还不常见,2026 已经普及)。
关键词
大模型术语词典概念速查2026Q3 000043