人工智能
Artificial Intelligence(AI)让机器模拟、延伸和扩展人类智能的科学与技术,涵盖感知、学习、推理、规划、语言理解与创造等能力。该概念于 1956 年达特茅斯会议正式提出,此后经历多轮高潮与低谷,当前以机器学习和大模型为代表进入新一轮高速发展期。
AI 专业术语速查手册 · 2026
按领域整理的人工智能专业名词与具体解释,覆盖基础概念、机器学习、深度学习、大语言模型与生成式 AI、自然语言处理、计算机视觉、强化学习、工程化与伦理治理,适合学习、写作与日常工作快速查证。
认识人工智能的基本定义、发展脉络与通用词汇,是理解后续所有领域的地基。
让机器模拟、延伸和扩展人类智能的科学与技术,涵盖感知、学习、推理、规划、语言理解与创造等能力。该概念于 1956 年达特茅斯会议正式提出,此后经历多轮高潮与低谷,当前以机器学习和大模型为代表进入新一轮高速发展期。
人工智能的核心子领域:不依赖人工编写规则,而是让算法从数据中自动发现规律并泛化到新数据。学习过程围绕三要素展开——数据(学习素材)、模型(假设空间)、优化算法(求解方式),监督学习、无监督学习、强化学习是其三大范式。
机器学习的子领域,基于多层神经网络自动学习数据的分层特征表示:浅层捕捉低级特征,深层组合出抽象语义。得益于算力与数据爆发,深度学习在图像、语音、自然语言等任务上大幅超越传统方法,也是大模型的技术底座。
只在特定任务上达到甚至超过人类水平的 AI,如人脸识别、语音助手、推荐系统。它不具备跨任务的通用能力,目前所有已商用的 AI 系统都属于弱人工智能。
具备与人类相当通用智能的 AI:能理解、学习并胜任任意智力任务,且可跨领域迁移能力。AGI 是 AI 研究的长期目标,学界与产业界对其实现时间与路径存在广泛争议,尚未实现。
在几乎所有领域都远超最聪明人类的智能形态,属于理论性概念。围绕它展开的"智能爆炸""控制问题"等讨论是 AI 安全领域的重要议题,学界对其可能性与风险尚无定论。
1950 年艾伦·图灵提出的智能判定思想实验:若一台机器在与人类进行文字对话时,人类无法分辨对方是机器还是真人,就认为该机器具有智能。它首次把"智能"转化为可操作的检验标准,但也因只考察对话表现而备受讨论。
早期基于规则的 AI 系统:把领域专家的知识整理成"如果-那么"规则库,通过推理引擎在特定领域(如医疗诊断、设备故障排查)给出建议。它是符号主义 AI 的代表,后来被数据驱动的机器学习逐渐取代。
用"实体—关系—实体"三元组描述客观知识的结构化图数据,节点是实体、边是关系,如「北京—首都—中国」。它支持语义检索、推理与多跳问答,是搜索引擎、推荐系统和问答系统的知识底座,也是 RAG 的重要知识来源。
描述数据样本的可测量属性,例如文本中的词频、图像中的像素值、用户画像中的年龄与行为字段。特征的质量直接决定模型效果上限——传统机器学习中"特征工程"的重要性常高于模型选择本身。
对"输入→输出"映射关系的学习结果,本质上是一组参数化的数学函数(如神经网络权重)。训练完成后,模型被固定(或持续更新)并用于对新数据做预测,是 AI 应用的核心载体。
用训练好的模型对新输入进行预测的过程,与"训练"相对。推理阶段的延迟、吞吐与成本是工程化的关键指标,衍生出量化、蒸馏、推理加速等一系列优化技术。
强调"智能必须依托身体与物理世界的交互才能获得"的 AI 方向:智能体通过感知、行动与反馈的循环在真实环境中学习。代表应用是人形机器人与自动驾驶,被视为通往 AGI 的重要路径。
模型规模增大到某一临界点后,突然表现出小模型不具备的能力(如多步推理、指令遵循),且无法按小模型的趋势简单外推预测。它是规模法则在大模型时代的核心现象,也是当前研究热点。
模型性能随参数量、训练数据量与算力增加呈可预测幂律增长的经验规律。它奠定了大模型"堆参数、堆数据、堆算力"的技术路线,也引出了对算力瓶颈与数据枯竭的担忧。
解决特定问题的有限、明确的步骤序列,是计算机科学的核心概念。在 AI 语境中指模型训练与推理所依据的计算流程(如梯度下降、Transformer 前向计算),同一目标可由不同算法实现,效率与效果各异。
从数据中学习的核心范式与经典算法:学习方式、常见任务、关键现象与评估方法。
使用"输入—正确答案"成对标注数据训练模型,学习输入到输出的映射。按输出类型分为两类:分类(离散类别)与回归(连续数值)。它是最成熟、应用最广的学习范式,但依赖昂贵的人工标注。
只用无标签数据训练,让模型自行发现数据的内在结构与规律。典型任务包括聚类(自动分组)、降维(压缩特征)与异常检测(发现离群样本),常用于探索性分析和标注成本过高的场景。
同时使用少量标注数据与大量未标注数据训练:先用少量标签约束方向,再利用无标签数据的分布结构提升泛化。它在标注成本高、数据量大的工业场景中非常实用。
从无标注数据中自动构造"伪标签"进行学习,例如让模型预测文本中被遮挡的词、或预测图像的旋转角度。它无需人工标注却能学到通用表示,是 GPT、BERT 等大模型预训练的核心范式。
预测样本所属离散类别的监督任务,如垃圾邮件识别、图像类别判断。评估指标包括准确率、精确率、召回率、F1 分数与 AUC 等,不同指标适用于不同业务侧重(如欺诈检测更看重召回率)。
预测连续数值的监督任务,如房价、销量、温度预测。常用均方误差(MSE)衡量预测与真实值的差距,线性回归、决策树回归、神经网络都可作为回归模型。
无监督学习中最典型的任务:把相似样本自动归入同一组,使组内尽量相似、组间尽量不同。K-Means、DBSCAN、层次聚类是常见算法,广泛用于用户分群、图像分割的预处理。
模型在训练集上表现极好、在未见数据上表现差的现象——它"死记硬背"了训练样本而非学会可泛化的规律。缓解手段包括增加数据、正则化、早停、Dropout、数据增强与交叉验证。
模型过于简单,连训练数据都拟合不好,通常由模型容量不足、特征不充分或训练不充分导致。与过拟合相对,需要通过增大模型、补充特征、延长训练来改善。
把模型误差分解为偏差(预测的系统性偏离真实值)与方差(对训练数据波动的敏感度):模型越简单偏差越大、方差越小,越复杂则相反。二者此消彼长,实践中需要在表达能力与稳定性之间寻找平衡点。
把数据切分为多份,轮流将其中一份作为验证集、其余作训练集,多次训练取平均结果,以更稳健地评估模型泛化能力。最常用的是 K 折交叉验证(如 5 折、10 折),可有效减少评估偏差。
在损失函数中加入对模型复杂度的惩罚项,抑制权重过大、防止过拟合。常见形式有 L1(使权重稀疏)与 L2(使权重平滑),深度学习中的 Dropout、权重衰减也属于正则化思想。
度量模型预测与真实标签之间差距的函数,训练的目标就是最小化损失。分类任务常用交叉熵损失,回归任务常用均方误差(MSE);损失函数的设计直接决定模型优化的方向。
最核心的优化算法:沿损失函数负梯度方向反复迭代更新参数,使损失逐步下降直至收敛。按每次更新的样本量分为批量、随机(SGD)与小批量梯度下降;Adam、SGD 带动量等是其主流变体。
梯度下降中每次参数更新的步长。学习率过大会导致损失震荡甚至发散,过小则收敛缓慢。实践中常用学习率调度(如余弦退火)动态调整,是调参时最关键的超参数之一。
人工设计、筛选与转换特征以提升模型效果的过程,包括缺失值处理、编码、归一化、组合与降维等。在传统机器学习中,特征工程的质量往往比调参更影响最终效果;深度学习则用自动表示学习部分替代了这项工作。
以"特征判断—分支"结构逐层划分数据的树状模型,每个叶节点给出预测结果。它可解释性强、无需特征缩放,是随机森林、GBDT、XGBoost 等集成模型的基础构件。
集成学习(Bagging)的经典实现:训练多棵决策树,每棵树用随机抽样的数据子集和特征子集,最终投票或取平均。它通过降低方差显著提升鲁棒性,对异常值与噪声不敏感,常用于表格数据。
寻找能使类别间隔最大化的超平面进行分类的经典算法,擅长小样本、高维数据。通过核技巧(如 RBF 核)可把数据映射到高维空间,处理线性不可分问题。
组合多个基学习器以获得优于单个模型的整体性能。两大路线:Bagging(并行训练、降低方差,如随机森林)与 Boosting(串行训练、降低偏差,如 AdaBoost、GBDT、XGBoost)。
训练前由人设定的配置项,如网络层数、学习率、批大小、正则化强度,区别于训练过程中自动学到的模型参数。超参数通常通过网格搜索、随机搜索或贝叶斯优化进行调优。
汇总分类预测结果与真实情况对应关系的表格,包含真正例(TP)、假正例(FP)、真负例(TN)、假负例(FN)四类计数,是计算精确率、召回率、F1、特异性等指标的源头。
对原始数据做变换(图像旋转裁剪、文本同义替换、噪声注入等)生成更多变体样本,扩大训练集并提升模型泛化能力。它是缓解过拟合与标注数据不足的常用手段。
由程序或模型人工生成、而非真实采集的数据。它可补充稀缺场景、保护隐私(如医疗影像、驾驶场景),但需警惕与真实分布存在偏差导致模型失真。
训练中持续监控验证集指标,一旦不再提升即提前终止训练,防止过拟合并节省算力。它是最简单有效的正则化手段之一,几乎所有深度学习训练都会使用。
用概率代理模型(如高斯过程)引导超参数搜索的调参方法:在探索未知区域与利用已知最优之间权衡,通常几十轮即可逼近最优超参数,效率远高于网格搜索。
从数据中发现显著偏离正常模式的样本的任务,常用于欺诈识别、故障预警、工业质检与网络安全。常用方法包括统计阈值、孤立森林、自编码器重建误差等,多属于无监督或半监督场景。
最经典的线性降维方法:通过正交变换把高维数据投影到方差最大的若干主成分方向上,保留主要信息的同时压缩特征维度。广泛用于数据可视化、特征压缩与去相关。
神经网络的基础构件、主流架构与训练技术,理解 Transformer 之前先掌握这一层。
由大量"神经元"(加权求和后经激活函数)分层连接而成的计算模型,每个神经元学习数据的局部规律,多层组合表达复杂函数。训练即自动学习各连接的权重,是深度学习的通用构件。
1957 年提出的最简单神经网络:单层神经元对输入加权求和后经阶跃函数输出,可完成线性二分类。但它无法处理 XOR 等线性不可分问题,这一局限直接推动了多层网络与反向传播的出现。
含输入层、若干隐藏层与输出层的全连接网络,隐藏层配合非线性激活函数后,理论上可逼近任意连续函数(万能逼近定理)。它是深度学习最基础的架构,Transformer 中的前馈层本质就是 MLP。
通过卷积核在局部区域滑动提取特征、逐层组合抽象,天然契合图像等网格结构数据。经典结构为"卷积层+池化层+全连接层",AlexNet、ResNet 等均基于此,是计算机视觉的基石架构。
按时间步共享权重、逐位处理序列数据(文本、语音、时间序列)的网络,把前一步的隐藏状态传入下一步。它天然适合序列建模,但存在长距离依赖下的梯度消失问题。
RNN 的主流改进:引入输入门、遗忘门、输出门与记忆单元,让网络学会选择性记住或遗忘信息,有效缓解长序列下的梯度消失。曾长期是机器翻译、语音识别的标配,后被 Transformer 取代。
LSTM 的简化变体:把三个门合并为更新门与重置门,参数量更少、训练更快,在多数任务上效果与 LSTM 接近。适合对部署与训练成本敏感的场景。
2017 年谷歌提出的基于自注意力的网络架构,摒弃循环结构,可并行训练并直接建模任意距离的依赖关系。它是 GPT、BERT 及几乎所有大语言模型的底层架构,被公认为当前深度学习的基石。
让模型在解码时动态分配"注意力权重",聚焦输入中与当前输出最相关的部分,而非等权看待所有信息。它最初用于提升机器翻译效果,后成为 Transformer 的核心思想。
序列内部各位置两两计算关联权重:每个 token 通过查询(Query)、键(Key)、值(Value)三个向量,聚合全序列信息。它使每个词都能直接参考整个上下文,是 Transformer 建模长距离依赖的关键。
并行运行多组自注意力,每组从不同表示子空间捕捉不同类型的依赖关系(如语法关系、指代关系),最后拼接融合。多头机制显著增强了 Transformer 的表达能力。
训练神经网络的核心算法:利用链式法则从输出层向输入层逐层计算损失对各参数的梯度,再配合梯度下降更新权重。现代深度学习框架(PyTorch、TensorFlow)的自动求导即其工程化实现。
为神经元输出引入非线性的函数,没有它多层网络将退化为线性变换。常见选择:ReLU(计算快、缓解梯度消失)、Sigmoid(输出 0–1,用于二分类概率)、Tanh(输出 -1–1)、Softmax(多分类概率分布)。
在训练中把每一层的小批量输入标准化为均值 0、方差 1 的分布,再学习缩放与平移参数。它显著加速收敛、允许使用更大学习率,并带有轻微正则化效果,是卷积网络标配技术。
通过"跳跃连接"把输入直接加到层输出上,让梯度能直达浅层,解决深层网络训练退化问题,使数百层网络成为可能。ResNet 思想也被 Transformer 中的残差结构广泛采用。
把离散符号(词、商品、用户 ID)映射为稠密低维连续向量,使语义相近的对象在向量空间中距离更近。嵌入是词向量、推荐系统向量召回、大模型输入表示的基础技术。
深度学习中的通用数据结构,即多维数组:0 维为标量、1 维为向量、2 维为矩阵、3 维及以上为高维张量(如图像为"高×宽×通道")。数据以张量形式批量流经网络,GPU 加速也以张量运算为单位。
把在某个任务(通常是大数据集)上学到的知识迁移到相关新任务,例如用 ImageNet 预训练的模型微调做医学影像分类。它能显著降低新任务对数据与算力的需求,是大模型落地的通用路径。
先在通用大规模数据上训练模型、学习通用的语言或视觉表示,是"预训练+微调"范式的前半段。大模型的核心能力(语法、知识、推理)主要在这一阶段获得,成本极高。
在预训练模型基础上,用目标任务的数据继续训练少量轮次,使通用模型适配特定领域或风格。相比从头训练成本极低,是模型定制化的主流方式;LoRA 等参数高效微调可进一步降低资源消耗。
让一个小模型(学生)学习大模型(教师)的输出分布与软标签,以接近大模型的性能而体积显著更小。它是模型压缩与部署优化的常用手段,也用于把大模型能力"浓缩"进小模型。
为 Transformer 注入 token 位置信息的机制(正弦位置编码、可学习位置编码、旋转位置编码 RoPE 等),因为自注意力本身不感知顺序。它让模型能利用词的先后关系理解语义,RoPE 已成为主流大模型的标准选择。
由编码器与解码器组成的无监督网络:先压缩输入到低维隐表示再重建,学习数据的高效表示。可用于降维、去噪与异常检测,VAE 是其生成式扩展。
直接在图上学习节点与边表示的网络,通过聚合邻居信息迭代更新节点特征。适用于社交网络分析、分子性质预测、知识图谱推理等非欧氏结构数据。
把网络拆分为多个"专家"子网络,每次输入只激活其中一小部分,在总参数量巨大时保持单次计算量可控。MoE 是当前超大模型(如 GPT-4、Mixtral)降低训练与推理成本的关键架构。
对单个样本的整层激活做标准化(区别于批归一化按批次统计),不受批大小影响、训练更稳定,是 Transformer 的标准配置。
实现参数更新策略的算法组件,决定"沿梯度方向走多远"。SGD 带动量、Adam、AdamW 是主流选择,其中 AdamW 是训练大模型的默认配置。
对特征图做下采样(取局部最大值或均值)以缩小尺寸、增强平移不变性并扩大感受野,是 CNN 的经典组件(如最大池化、平均池化)。
深层网络训练中,梯度在反向传播时逐层衰减趋近于零(消失)或指数级放大(爆炸)的现象,导致浅层参数几乎无法更新或训练发散。缓解手段包括合理的参数初始化、ReLU 系激活函数、批/层归一化、残差连接与梯度裁剪。
当前 AI 最活跃的前沿:大模型原理、生成技术、提示与对齐方法,以及配套的工程概念。
基于 Transformer、参数量达数十亿至万亿级、在海量文本上预训练的语言模型。它具备理解、生成、推理、对话与少样本学习等涌现能力,是 ChatGPT 等对话产品与各类 AI 应用的技术核心。
以"生成新内容"为核心能力的 AI 技术总称,可产出文本、图像、音频、视频与代码。代表技术包括大语言模型、扩散模型与 GAN,2022 年以来因 ChatGPT、Stable Diffusion 等产品进入大众视野。
OpenAI 提出的大语言模型系列名称,全称为"生成式预训练 Transformer":先在海量文本上自监督预训练,再经指令微调与人类反馈对齐(RLHF),最终具备对话、写作与推理能力。该系列定义了"预训练+对齐"的主流路线。
模型处理文本的最小单元,可以是单词、子词或字符。文本先被分词器切分为 token 序列再输入模型,计费、上下文长度、生成速度都以 token 为单位衡量——例如中文一个字常对应 1–2 个 token。
模型单次推理能同时容纳的输入加输出 token 上限。窗口越大,可处理的对话历史、文档与代码越长;从早期 GPT 的 2K 到如今的 128K、1M,上下文窗口是大模型能力升级的重要指标。
用户输入给模型的指令或文本,决定模型生成的方向与质量。一个清晰的提示词通常包含角色设定、任务要求、约束条件与输出格式,是使用大模型的主要交互方式。
设计、优化提示词以稳定获得高质量输出的方法论,包括角色扮演、示例引导(few-shot)、思维链、结构化输出等技术。它不是简单的"提问技巧",而是驾驭模型能力的系统工程。
模型未经该任务任何样本训练也能直接完成,例如让 LLM 直接翻译从未见过的语言组合、或按指令分类未见过的新类别。它依赖模型预训练阶段积累的泛化能力,是大模型区别于传统模型的重要特性。
在提示词中给出几个输入输出示例后再让模型完成任务,模型通过模仿示例即可适配新任务,无需更新参数。它是提示工程中最常用的技巧,能显著提升复杂任务的准确率。
引导模型把复杂推理分解为一步步可见的中间推理过程,再给出最终答案。这一技巧能显著提升数学、逻辑与多步规划任务的表现,是"推理模型"(如 o1 系列)的设计基础。
模型生成看似流畅合理、但事实错误或凭空捏造的内容。它源于模型基于概率续写而非查证事实,是当前大模型落地(尤其医疗、金融等强事实场景)的主要风险之一,RAG 与联网搜索是常用缓解手段。
先从外部知识库(文档、数据库、知识图谱)检索与问题相关的内容,再拼接入提示词让模型基于检索结果生成答案。它无需重新训练即可注入实时与私有知识,同时显著缓解幻觉,是知识库问答的主流方案。
用大量"指令—回答"配对数据对预训练模型进行监督微调,让模型学会遵循人类指令、对齐任务意图。它是把"续写文本的预训练模型"变成"听从指令的助手"的关键一步。
先让人类对模型的多组输出打分排序,训练一个奖励模型,再用强化学习(如 PPO)按奖励优化模型,使其输出更符合人类偏好。它是 ChatGPT 高质量对话体验的关键技术,也是对齐研究的重要工具。
让 AI 的目标、行为与人类意图和价值观保持一致的研究方向,具体目标包括有用性(乐于助人)、无害性(拒绝有害请求)与诚实性(不编造)。RLHF、宪法 AI、可解释性等都是对齐的技术路径。
模型同时处理与理解多种信息形态——文本、图像、音频、视频。多模态大模型(如 GPT-4V、Gemini)能看图说话、识图理解,是 AGI 方向的重要一步,也催生了文生图、文生视频等应用。
生成模型的主流技术:训练时给数据逐步加噪至纯噪声,生成时学习逐步去噪还原出数据。它是 Stable Diffusion、Midjourney、Sora 等文生图、文生视频模型的底层原理,生成质量显著优于 GAN。
由生成器与判别器博弈构成的生成模型:生成器学习伪造样本,判别器学习分辨真伪,二者对抗训练后生成器能产出以假乱真的图像。曾是图像生成主流,如今在多数场景被扩散模型取代。
把数据编码到低维隐空间(学习其概率分布)再解码重建的生成模型,可从隐空间采样生成新样本。它既能压缩表示又能量化不确定性,也是扩散模型等现代生成模型的理论基础之一。
根据文字描述直接生成图像的生成式 AI 应用,代表模型有 Stable Diffusion、Midjourney、DALL·E 等。应用覆盖设计、营销、影视概念图等场景,提示词质量与采样参数直接影响成图效果。
根据文字或图片生成动态视频,代表系统包括 Sora、可灵、即梦等。相比文生图,它需要同时建模时间维度的连贯运动,是生成式 AI 当前最前沿的方向之一。
能自主理解目标、规划步骤、调用工具并与环境交互以完成多步任务的 AI 系统。大模型赋予其推理与决策能力,Agent 可联网搜索、操作软件、执行代码,是 AI 从"问答"走向"做事"的关键形态。
可复用的模块化智能体能力单元:通常由自然语言描述、调用接口与执行流程封装而成,智能体可按需动态发现、加载并执行。与"工具调用"(单个函数/API)相比,Skill 是更高层、可组合的能力包(如"做 PPT""深度研究"),也是智能体能力标准化与跨平台共享的重要方向。
2025 年爆火的开源个人 AI 智能体项目(曾用名 Moltbot / Clawdbot):像"AI 管家"一样接管电脑,由大模型驱动规划,可操作浏览器、应用与桌面完成多步自动化任务。因 GitHub 星标增速惊人而广受关注,也让"本地个人 AI 智能体"成为行业热点话题。
模型识别用户意图后,输出调用外部工具(搜索引擎、API、代码执行器)的结构化调用指令,再将工具返回结果融入回答。它是智能体落地的基础能力,让模型突破"只会生成文本"的边界。
把模型权重从高精度(FP16/BF16)压缩到低精度(INT8/INT4)以减小体积与显存占用、加速推理的技术。现代量化(如 GPTQ、AWQ)可在精度损失很小的情况下让大模型跑在消费级显卡上。
控制模型输出随机性的采样参数:温度趋近 0 时输出确定、保守、可复现,适合事实类任务;温度较高时输出更多样、有创意,适合文案与头脑风暴。它是使用 LLM 时最常调整的参数。
只从累计概率达到阈值 p 的最小候选词集合中采样,与温度参数共同控制生成的多样性与稳定性。p 越小候选越少、输出越保守,二者配合可精细调节模型"胆量"。
模型边生成边把 token 逐块实时返回给用户,而非等待全部生成完毕。它大幅降低首字延迟,让对话体验更自然,是 ChatGPT 等产品的标配交互方式,工程上由 SSE 等协议实现。
用标准化数据集与指标评估模型能力,如 MMLU(综合知识)、GSM8K(数学推理)、HumanEval(代码)、MMLU-Pro 等。基准分数用于横向比较模型,但存在"刷榜"与饱和问题,需结合真实场景评估。
利用 AI 自动生成文字、图像、音频、视频、代码等内容的生产方式,区别于人工生产内容(PGC/UGC)。它是生成式 AI 的应用层形态,已渗透营销、设计、影视、办公与电商等场景。
Anthropic 于 2024 年底提出的开放协议,统一 AI 应用与外部数据源、工具之间的连接方式,常被比作"AI 界的 USB-C"。通过 MCP,模型可标准化地发现与调用工具、读写数据,是智能体生态互操作的关键标准。
模型仅凭提示词中给出的示例与说明即可完成新任务,不更新任何参数。少样本、零样本学习都属于上下文学习,是大模型最具代表性的涌现能力之一。
逐个预测下一个 token、并把上一步输出拼回输入继续生成的文本生成方式。绝大多数 LLM(GPT 系列)采用自回归解码,训练目标即"预测下一个词",配合 KV 缓存可高效生成。
冻结原模型权重、只训练少量低秩矩阵来近似权重更新的参数高效微调方法,可训练参数量减少 99% 以上。多个 LoRA 可插拔复用、互不干扰,已成为开源模型微调的事实标准。
只更新极少量参数(LoRA、Prefix-Tuning、Adapter 等)即可适配下游任务的微调范式,大幅降低显存与存储成本,便于在同一基座模型上并行部署多个任务。
通过"深度思考"——在内部生成大量推理步骤、自我检验再作答——提升复杂任务准确率的模型(如 OpenAI o1 系列)。推理时计算量显著增加,代表"慢思考"路线,通常通过强化学习训练获得。
让 AI 学习环境的内在规律与演化规则、能在"脑中"模拟"如果…会怎样"的模型。它被视为视频生成与具身智能的统一底座,代表如 Sora 等视频世界模型。
多个各司其职的 AI 智能体协作或竞争完成复杂任务(如规划者、执行者、审查者分工配合)。通过角色分工与相互校验,整体能力常优于单个全能智能体。
让模型按约定格式(JSON、表格、XML 等)返回结果的能力,便于程序直接解析与集成。常通过 JSON 模式、函数调用或格式约束实现,是 LLM 工程化落地的关键能力。
在对话开始前设定模型角色、行为规范与能力边界的指令,通常由开发者注入、用户不可见。它是产品控制模型风格、回答范围与安全约束的主要手段。
智能体或对话系统跨轮次保留并利用信息的能力,分短期记忆(当前上下文窗口内)与长期记忆(向量库、知识库等外部存储,可跨会话检索)。记忆是 Agent 在长任务中保持连贯、学习用户偏好的关键组件。
让机器理解与生成人类语言的技术体系,大模型时代之前 NLP 的经典任务与技术积累。
让计算机理解、生成和处理人类语言的技术领域,覆盖分词、词性标注、翻译、问答、情感分析、文本生成等任务。早期依赖规则与统计方法,深度学习与预训练模型已大幅刷新各项任务效果。
把连续文本切分为最小处理单元的过程。中文分词常按词切分(如 jieba),英文按空格与标点;大模型则普遍采用 BPE、WordPiece 等子词切分,以平衡词表大小与未登录词问题。
把词映射为稠密低维向量,使语义相近的词在向量空间中距离更近,并可进行"国王—男性+女性≈女王"式的语义运算。经典方法有 Word2Vec、GloVe,是大模型嵌入层的前身。
谷歌 2018 年提出的双向 Transformer 编码器预训练模型,通过"掩码语言模型"与"下一句预测"学习深度双向上下文表示。它是 NLP 预训练范式的里程碑,至今仍是文本理解类任务的重要基座。
自动将一种语言翻译为另一种语言的技术。现代系统为神经机器翻译(NMT):以端到端的序列到序列模型直接学习"源语言→目标语言"映射,大模型已使其在多数语对上达到接近人工的水平。
从文本中识别具有特定含义的实体及其类别,如人名、地名、机构名、日期、金额等。它是信息抽取、知识图谱构建、搜索与风控的基础任务。
给文本中的每个词标注其语法词性(名词、动词、形容词等),是句法分析与语义理解的基础环节。深度模型已使其准确率接近上限,更多作为中间特征使用。
判断文本表达的情感倾向(正面/负面/中性,或更细粒度的情绪),广泛用于舆情监控、电商评价分析与品牌口碑监测。大模型时代也常通过提示词直接完成,无需专门训练。
自动回答用户问题的系统,分抽取式(从给定文档中定位答案片段)与生成式(基于知识生成答案)。大模型与 RAG 组合已成为现代问答系统的标准形态。
语音识别(ASR)把语音转为文字,语音合成(TTS)把文字转为自然语音,二者构成完整的人机语音交互链路,支撑语音助手、实时字幕、有声内容等应用。
自动把长文本压缩为保留核心信息的短文,分抽取式(直接摘取原文句子)与生成式(重新组织语言)。大模型已使其在新闻、报告、会议纪要等场景广泛落地。
用于训练与评估模型的大规模文本集合。语料的质量、规模与领域分布直接决定模型能力与偏见倾向,是大模型工程最基础的资源。
衡量语言模型对文本预测不确定性的指标:模型赋予真实文本的概率越高、困惑度越低,表示拟合越好。它是语言模型训练中的常用监控指标。
让计算机"看懂"图像与视频:从识别、检测、分割到生成的核心任务。
让计算机从图像与视频中提取信息、理解内容的技术领域,覆盖分类、检测、分割、跟踪、生成等任务。深度学习尤其是 CNN 与 Transformer(ViT)大幅推动了视觉能力的提升,是自动驾驶、安防、医疗影像的基石。
判断整张图像属于哪个类别,如"猫/狗""正常/病变"。它是视觉任务中最基础的一类,经典网络包括 AlexNet、ResNet、ViT;ImageNet 曾长期是视觉研究的主战场。
在图像中同时定位多个目标(用边界框框出)并识别其类别,如行人、车辆、商品。代表方法有 YOLO 系列(单阶段、速度快)与 Faster R-CNN(两阶段、精度高),是安防、自动驾驶、新零售的核心技术。
对图像的每一个像素进行分类,输出像素级语义标签(道路、行人、天空),让机器理解"哪里是什么"。它是自动驾驶场景理解、医学影像分析的基础技术。
在语义分割基础上进一步区分同一类别的不同个体,例如不仅标出"三辆车",还要区分车 A、车 B、车 C。代表方法 Mask R-CNN,用于精细场景理解与图像编辑。
在视频序列中持续定位同一目标的位置并保持其身份,即使目标移动、遮挡或外观变化。它支撑智能监控、自动驾驶多目标追踪与视频分析。
检测并对齐人脸、提取人脸特征向量、与库中身份比对的技术,用于手机解锁、门禁考勤、安防核验。大规模应用时需关注隐私合规、偏见与深度伪造攻击等风险。
从随机噪声、文字描述或条件信息生成全新图像的技术,代表包括 GAN 与扩散模型。文生图已能生成高质量写实与创意图像,应用于设计、电商、影视与内容创作。
从低分辨率图像重建出细节更丰富的高分辨率图像,用于老照片修复、监控画面增强、视频画质提升。扩散模型与 GAN 使重建细节更真实。
从图像、扫描件、拍摄照片中识别并提取文字的技术,支撑票据识别、身份证件录入、文档数字化与拍照翻译等应用。
从图像或视频中定位人体/物体的关键点(关节、五官)并推断姿态的技术,用于动作识别、健身指导、人机交互与影视动捕。
对视频进行语义分析(动作识别、事件检测、视频问答),需同时建模空间与时间两个维度,是多模态大模型的重要能力方向。
从多张图像、视频或深度传感器数据恢复物体与场景的三维几何和纹理,用于自动驾驶、AR/VR、文物保护与数字孪生。代表方法包括多视图立体、NeRF 神经辐射场与 3D 高斯泼溅。
智能体通过与环境试错交互、依据奖励信号学习的范式,也是大模型对齐的关键技术。
智能体在与环境的试错交互中,依据奖励信号学习最优决策策略的学习范式,区别于"标注—学习"的监督学习。它擅长序贯决策问题(游戏、机器人控制),也是 RLHF 等大模型对齐方法的技术基础。
强化学习中做出决策并执行动作的主体。广义上指任何能感知环境、采取行动以达成目标的系统;大模型兴起后也常指能自主规划与调用工具的 AI 智能体。
智能体所处并与之交互的世界:接收智能体的动作,返回新的状态与奖励。环境可以是模拟器(围棋、游戏)、真实世界(机器人)或人类反馈(RLHF 中的偏好信号)。
状态是环境在某一时刻的可观测情况(如棋局局面),动作是智能体在该状态下可做的选择(如落子位置)。策略即"状态→动作"的映射,是强化学习要学习的目标。
环境对智能体动作的即时反馈数值,告诉它"这一步好不好"。强化学习的核心目标是最大化长期累计奖励,因此奖励函数的设计直接决定智能体学到的行为。
智能体在给定状态下选择动作的规则,是强化学习的直接学习对象,可表示为查表、概率分布或神经网络。策略优化的目标是从随机初始化逐步逼近最优策略。
评估某个状态(或状态—动作组合)未来累计奖励期望的函数,回答"待在这里到底有多好"。价值函数为策略优化提供引导信号,是许多 RL 算法(DQN 等)的核心组件。
经典的免模型强化学习算法:迭代更新"状态—动作"价值表(Q 表),不依赖环境模型即可逼近最优策略。它在小规模状态空间中效果出色,高维场景则由深度 Q 网络(DQN)扩展。
用深度神经网络逼近策略或价值函数,解决高维状态空间(图像、复杂环境)下的强化学习问题。代表成果包括 DQN、PPO 与 AlphaGo,使 RL 从棋类走向真实复杂任务。
强化学习的核心难题:探索是尝试未知动作以获取新信息,利用是选择当前已知最优动作获取奖励。二者需要平衡——过于保守会错过更优策略,过于激进则浪费已知收益。
OpenAI 提出的策略梯度算法,通过裁剪目标函数限制每次更新的幅度,兼顾训练稳定与样本效率。它是当前最主流的 RL 算法之一,也是大模型 RLHF 与推理强化学习的标准选择。
DeepMind 于 2016 年击败人类顶级围棋选手的系统,结合深度神经网络(策略网络+价值网络)与蒙特卡洛树搜索。它是强化学习与深度学习结合的标志性里程碑,极大推动了公众对 AI 的认知。
强化学习的数学框架:由状态、动作、转移概率、奖励与折扣因子五个要素描述序贯决策问题。几乎所有强化学习问题都可建模为 MDP,是理解 RL 算法的理论起点。
通过随机模拟逐步构建搜索树、在探索与利用之间权衡的决策算法,是 AlphaGo 的核心组件之一,适用于状态空间巨大的博弈与规划问题。
让智能体直接学习专家示范数据(行为克隆),或从示范中推断奖励函数(逆强化学习),无需手工设计奖励。它是机器人技能学习与自动驾驶的重要途径。
学会给模型输出打分、模拟人类偏好的模型,训练数据来自人类对多组输出排序。它是 RLHF 与对齐流程的中间环节,强化学习阶段的目标就是最大化其评分。
把模型从实验带到生产所需的技术栈:算力、训练、部署、评测与运维。
AI 训练与推理的核心算力芯片:GPU 以大规模并行计算著称,是深度学习默认算力;TPU 是谷歌为张量计算定制的专用芯片。算力供给是大模型竞赛的关键基础设施,也催生了算力租赁与集群调度产业。
把训练任务拆分到多台设备(多卡/多机)并行执行,解决单机显存与算力不足的问题,使千亿级大模型训练成为可能。核心挑战是并行策略设计与通信效率。
分布式训练最常用形式:每张卡持有完整模型副本,把训练数据批次拆分到各卡并行计算梯度,再同步(或异步)聚合更新。通信开销随卡数增长,可通过梯度压缩与 ZeRO 等技术优化。
模型大到单卡放不下时,把网络的不同层或参数分片放到多张卡上协同计算,包括流水线并行(按层切分)与张量并行(按权重矩阵切分),是大模型训练的标配技术。
机器学习运维:把数据管理、实验追踪、训练、评估、部署、监控与迭代组织成工程化流水线,让模型可靠、可复现地从实验室走向生产。类比 DevOps 之于软件开发。
把训练好的模型封装为可对外提供推理服务的接口(HTTP/gRPC 服务),关注延迟、吞吐、可用性与成本。常配合量化、蒸馏、批处理与 KV 缓存等技术优化推理性能。
应用程序编程接口:软件系统之间约定好的调用入口。大模型语境下指模型能力(对话、生成、嵌入、工具调用等)以标准化 HTTP 服务对外提供,开发者凭密钥按量调用即可集成 AI,无需自行部署模型;MCP 正是连接这些服务的新一代协议。
把流量随机分为实验组与对照组,用真实业务指标验证新模型或新策略是否确实更优。它是模型上线前的关键决策环节,可避免"离线指标好、线上效果差"的偏差。
集中管理、复用与版本化特征数据的系统,保证训练与线上推理使用一致的特征,避免"训练/推理偏差"。它是成熟机器学习平台(如推荐系统)的公共组件。
在靠近数据源的设备端(手机、摄像头、车机)直接完成推理,而非全部上云。它降低延迟、节省带宽并保护隐私,需要更轻量的模型与专用芯片支持。
统一管理模型版本、元数据、评估结果与上线状态的系统,实现模型全生命周期治理与可追溯,支持快速回滚与多环境发布,是 MLOps 平台的核心组件。
开放的模型交换格式,让模型在不同深度学习框架(PyTorch、TensorFlow)与推理引擎(ONNX Runtime、TensorRT)之间互转,提升模型部署的灵活性与可移植性。
以向量索引与相似度检索为核心优化的数据库(如 Milvus、Pinecone、Weaviate),支持海量向量快速近邻查询。它是 RAG 与语义搜索的检索底座。
基于向量相似度而非关键词匹配的检索方式:把查询与文档映射为向量,按语义相关度排序。它能理解同义改写与语义关联,是 RAG 召回阶段的核心。
用更精细的模型(如交叉编码器)对检索召回的前若干候选重新排序,以提升相关性精度。典型流水线为"粗召回 + 精重排",兼顾速度与效果。
自回归解码时缓存已生成 token 的键值(Key-Value)矩阵,避免重复计算,是大模型推理加速与长上下文支持的关键技术;其显存开销也是推理优化的核心挑战。
面向大模型推理优化的工程框架(如 vLLM、TensorRT-LLM、SGLang),提供连续批处理、PagedAttention、算子融合等加速能力,显著提升吞吐并降低延迟。
从采集、清洗、标注到特征化的数据处理流水线,保证训练数据质量与可复现性。它是 MLOps 的基础设施,也是高质量模型的前提条件。
提供张量运算、自动求导与训练 API 的软件库,如 PyTorch、TensorFlow、JAX。框架屏蔽底层实现细节,研究者可快速搭建、训练与部署模型,是深度学习工程化的基础工具。
记录与管理模型实验(超参数、代码版本、指标、产物)的系统化实践,工具如 MLflow、Weights & Biases。它保证实验可复现、可对比,是 MLOps 与团队协作的必备环节。
线上真实数据分布随时间偏离训练数据分布的现象(含特征漂移与概念漂移),会导致模型效果逐渐退化。应对手段包括监控分布指标、定期重训与补充标注。
对重复出现的提示词前缀(系统提示、长文档上下文等)缓存其计算结果,命中时跳过重复计算,显著降低长上下文请求的延迟与成本。主流大模型 API 均已提供该能力。
让 AI 可信、可控、负责任地落地:可解释性、偏见、安全与隐私保护。
让模型的决策过程与依据可被人类理解的技术,常用方法包括 SHAP、LIME、注意力可视化等。在医疗、金融、司法等高风险领域,可解释性既是合规要求,也是建立信任的前提。
训练数据中的偏差被模型学习甚至放大,导致对特定群体不公平的结果,如招聘模型歧视、人脸识别对深肤色人群误判。治理需从数据采集、算法设计、评测与流程多个环节入手。
研究如何让 AI 系统可靠、可控、不产生意外危害的领域,涵盖鲁棒性测试、红队对抗、对齐问题、失控风险防范等。随大模型能力增强,AI 安全从学术议题上升为产业与监管议题。
用深度学习生成的高度逼真假内容(换脸视频、伪造语音、合成照片),可能被用于诈骗、造谣与名誉侵害。防范手段包括检测技术、内容溯源水印与平台治理规则。
通过向数据或查询结果注入受控噪声,使攻击者难以推断某个个体是否在数据集中,在保护个体隐私的同时保留统计可用性。苹果、谷歌等公司已在产品中应用。
数据不离开本地,多个参与方只交换模型梯度或参数共同训练模型的范式,兼顾隐私保护与联合建模。它常用于医疗、金融等数据敏感行业的跨机构协作。
以对抗方式系统性地寻找模型的漏洞、有害输出、越狱手段与偏见行为,模拟真实攻击者的思路。它是大模型上线前的标准安全测试环节,结果用于迭代加固。
识别并处置违规内容(色情、暴力、仇恨言论、虚假信息等)的机制。大模型时代审核从关键词规则走向"模型+人审"结合,同时承担对模型自身输出的安全过滤。
以公平、透明、可问责、隐私保护、安全可控为原则开发和部署 AI 的框架与实践,是企业在 AI 治理上的整体姿态,也越来越多地被纳入法律法规与行业标准。
在数据采集、存储、使用、共享与删除的全生命周期中保护个人信息不被滥用的原则与合规要求,涉及《个人信息保护法》《数据安全法》等法规,以及脱敏、加密、最小化等技术手段。
通过精心构造的输入指令劫持模型行为的攻击方式,例如诱导模型泄露系统提示词、执行恶意指令或输出受限内容。它是 LLM 应用的主要安全威胁,需通过输入过滤、权限隔离与输出校验防御。
通过特殊提示词、角色扮演或编码技巧绕开模型的安全对齐限制,诱导其输出有害内容。攻击与防御持续对抗,红队测试是发现越狱漏洞的主要手段。
针对人工智能的法律法规与治理框架,如欧盟《人工智能法案》、中国《生成式人工智能服务管理暂行办法》。监管聚焦透明度、安全、版权与责任分配,正深刻影响 AI 产品的设计与部署方式。
在 AI 生成内容中嵌入人眼不可见但可机器检测的标识,用于内容溯源、版权保护与深度伪造治理,是 AIGC 治理的重要技术手段。
工具介绍
AI术语手册:按领域整理的人工智能专业术语手册,覆盖基础概念、机器学习、深度学习、大语言模型、自然语言处理、计算机视觉、强化学习、工程化与治理,每个词条均含具体解释。本手册基于公开行业资料与通用知识整理,解释为入门级综述,供学习参考。
推荐工具
为爱发电,您的支持是我们不断努力的动力