AI 术语表
中英对照,一句话释义 + 详细说明。看到不懂的词先来这儿查一遍,比被人用黑话糊弄好。
56 / 56 条
安
- 安全护栏Guardrail
加在模型前后的一层硬规则和检查,用来拦住风险输出与越权动作。
常见做法是输入过滤、输出校验和高风险动作确认三件事,可以写成规则,也可以交给另一个模型判断。它和术语表里的「护栏(Guardrails)」是同一件事的两面:一条讲机制,一条讲学校落地时要检查的环节。给智能体开放权限时,先想清楚它被允许做什么,而不只是它被要求说什么。
按
- 按量计费Usage-based Pricing
按输入输出的 token 数量或调用次数付费,用多少算多少。
按量计费通常通过 API 使用,灵活、适合程序集成与低频场景,但对不熟悉 token 的人比较容易超支。实践中给自己设一个用量或预算上限,比事后看账单更稳妥。
本
- 本地部署Local Deployment
把模型和依赖装在自己的电脑或服务器上运行,数据不出内网。
个人可以从量化小模型起步,用 Ollama 之类的工具很快跑起来。企业则要考虑并发、监控和权限管理,必要时用 vLLM 这类推理服务。它省下的是隐私风险和按量费用,花出去的是硬件与运维。
闭
- 闭源模型Closed-weight Model读完整概念 →
权重不公开,只能通过官方网页或接口使用,服务由厂商托管。
闭源的好处是能力通常更强、无需硬件投入、开箱即用。代价是数据需要上传、行为可能随厂商策略调整、长期成本随用量增长。企业使用前应先确认哪些内容不能出内网。
参
- 参数量Parameter Count
模型中可学习数值(权重)的总量,常用 B、M 表示规模,只是能力的粗略参考。
参数量决定了模型能容纳多少信息,但同样的参数量在架构、训练数据和训练方法不同的情况下,实际表现可能差很多。它同时影响显存占用与推理成本,所以选型时不能只看规模,还要看量化版本和部署方式。
低
- 低秩适配微调LoRA (Low-Rank Adaptation)
冻结原模型、只训练一小段附加参数来微调的轻量方法,个人也能上手。
它的思路是在原权重旁边加一条低维旁路,只训练这部分参数,训练量和存储量都远小于全量微调。这让个人用消费级显卡也能定制模型行为。使用时要加载对应的适配器文件,或把权重合并进主模型。
订
- 订阅制Subscription
按固定周期付费换取一定使用额度的计费方式,个人用户最常见。
订阅适合使用频率稳定、以对话和文件处理为主的场景,预算好规划,用量不紧张时体验最省心。缺点是重度使用往往不划算,而且各家的额度规则会调整。选之前先按自己的真实使用节奏估一下更稳妥。
多
- 多模态Multimodal读完整概念 →
模型同时理解或生成文字、图片、音频等多种信息形式的能力。
多模态模型通常先把图片等模态转成主模型能处理的表示,再统一理解和输出。日常最常见的用法是看报错截图、读扫描件、把拍下的票据转成表格。需要注意的是,能上传文件并不等于具备真正的图像推理能力。
工
- 工具调用Tool Use / Function Calling
模型输出结构化指令,由外部程序真正执行、再把结果返回给模型的机制。
模型本身并不执行动作,它只是生成一份「请调用某函数、参数如下」的请求,真正的操作由你的代码完成。这正是 Agent 能查资料、发邮件、读写文件的原因。涉及删除、支付、对外发送的动作必须加确认环节。
核
- 核采样Top-p (Nucleus Sampling)
只在累计概率最高的一组候选词里挑下一个词,常与温度一起调节。
使用它时,模型先按概率排序,取累计概率达到设定阈值的那一组候选,再在其中抽样。相当于硬性排除了一批不太可能的词,输出会更连贯。实践中温度和 top-p 一般调一个就够,同时乱调反而难预测。
护
- 护栏Guardrails
在模型前后加的一整套检查与限制,用来拦住风险输出和越权操作。
护栏通常由输入过滤、输出校验和高风险动作确认三层组成,可以是硬规则,也可以交给另一个模型判断。给 Agent 开放权限时最重要的一环是限制它能做什么,而不只是限制它说什么。规则写得越具体越好用。
幻
- 幻觉Hallucination读完整概念 →
模型一本正经地编造不存在的引用、条款或数字的现象。
根源在于模型是在预测「下一个像样的词」,而不是在查证事实,所以编出来的内容往往格式规整、语气自信。具体数字、法条编号、引文是高发区。要求它标注不确定只是缓解,关键内容仍要回到原文核对。
- 幻觉率Hallucination Rate读完整概念 →
衡量模型编造内容比例的指标,行业里并没有统一的算法和统计口径。
不同机构会用不同的题集、判定方式(人工核对还是模型判别)和抽样规模来计算,数字之间往往不能直接比较。看厂商公布的数据时,要同时看它测了什么、样本多大、题目是否公开。把它当成一个参考量级,而不是可以跨产品比分的指标。
混
- 混合专家模型Mixture of Experts
把模型拆成多组专家网络、每个 token 只调用其中少数几组的架构。
混合专家模型的总参数量可以很大,但每个 token 只激活一小部分,因此能在控制计算量的同时扩大容量。对使用者的含义是:这类模型常有可下载的权重,本地跑的硬件门槛比同规模的稠密模型更低。
基
- 基于文档生成Grounding
要求回答必须来自指定材料范围,并尽量标出对应出处,减少自由发挥。
做法通常是把材料放进上下文或先检索出来,再明确要求只依据这些内容作答。接上检索增强生成后范围更可控。它并不能消除幻觉,只是让错误更难跑到看不见的地方,关键数字仍然要回到原文核对。
检
- 检索增强生成Retrieval-Augmented Generation读完整概念 →
先检索你的资料,再让模型基于检索结果作答,用来接入私有资料并给出出处。
典型流程是切分、建索引、检索相关片段,再把片段和问题一起交给模型。相比重新训练,它落地快、资料可以随时更新。效果好坏主要取决于切分与检索质量,而不是模型本身。详见概念页「检索增强生成」。
开
- 开放权重Open Weight
模型参数文件公开可下载,可本地运行、可微调,但要遵守对应许可证。
它和严格意义上的开源不完全是一回事:训练代码、数据和流程通常并不公开。实际含义是你的资料可以留在本机,用 Ollama 之类的工具就能跑起来。不同许可证对商用、再分发和衍生模型的要求差别很大,落地前必须逐条阅读。
- 开源模型Open-weight Model读完整概念 →
权重公开可下载,可本地部署、微调或商用,但要遵守对应许可证。
常见做法是用 Ollama、LM Studio 或 vLLM 在本地跑 Qwen、Llama 这类模型,数据不出本机。代价是显卡、内存和维护都要自己承担。不同许可证对商用与再分发要求差别很大,落地前务必逐条阅读。
扩
- 扩散模型Diffusion Model
通过逐步去噪从噪声中生成图像或视频的模型路线,与语言模型思路不同。
它的过程像反复擦拭铅笔稿再重画:从一张纯噪声图开始,一步步去掉噪点得到成品。Midjourney、Stable Diffusion 都走这条路线。训练成本高、生成步数直接影响速度,是它的典型特点。
量
- 量化Quantization
把模型参数从高精度压成低精度,以节省显存并提升推理速度的压缩技术。
常见做法是把权重降到更低的位宽,体积随之明显下降,推理速度也可能变快。代价是精度损失,个别任务(如复杂代码)会受影响。选本地模型时,量化档位往往比参数规模更影响实际体验。
零
- 零样本Zero-shot
不给示例,只靠任务描述就让模型直接完成任务的方式。
现代模型在很多常见任务上零样本就能用,这也是它的门槛低的原因。零样本对格式和口径的控制力不如给了示例的情况。要求稳定抽取数据时,通常还是补上示例更保险。
- 零样本Zero-shot
不给示例,只靠一句任务描述就让模型直接完成任务的方式。
现代模型在很多常见任务上零样本就能用,这也是 AI 门槛低的原因。但它对输出格式和口径的控制力不如给了示例的情况。要求稳定抽取数据时,还是补上样例更保险。
模
- 模型上下文协议Model Context Protocol读完整概念 →
让 AI 应用以统一方式连接数据库、文件与外部工具的开放协议。
MCP 把「AI 该怎么访问外部资源」标准化,客户端和服务端按同一份规范对接,同一批工具可以被多个应用复用。它解决的是互通性,不解决权限与审计,后者仍要自己配置。详见概念页「模型上下文协议」。
批
- 批量接口Batch API
把一批请求攒在一起提交、由服务方在低峰时段统一处理的调用方式。
适合给一批材料做同一类处理,比如逐份摘要、分类或改写,代价是要等一段时间才能拿到结果。多数厂商为批量处理给出更低的价格,但通常设有提交截止时间和结果领取期限。临时任务、个人整理还是走普通接口更省事。
破
- 破译提示Jailbreak Prompt
试图绕过模型安全限制、诱导其输出本不该回答内容的提示词。
这类提示通常借助角色扮演、虚构前提或分步绕过等手法,成功率会随模型版本更新而变化。了解它主要是为了识别风险:公网环境和第三方账号尤其容易被拿来试探。不要拿它去处理公司机密。
嵌
- 嵌入Embedding读完整概念 →
把内容转成一串能表示语义关系的数值,相似内容在空间里距离更近。
嵌入的结果就是一串由几百到几千个数值组成的向量,让「意思相近」变成可计算的数学问题,常用余弦相似度来比较。它是语义搜索、去重、聚类和检索增强生成的共同基础,本身不可读,必须配合向量数据库或其他索引才能被检索到。更换嵌入模型通常要重建索引并重新评估效果。
人
- 人类反馈强化学习Reinforcement Learning from Human Feedback
先让人给模型回答打分,再用这些偏好信号训练模型以贴近人类偏好的方法。
流程通常分两步:先让模型生成多个候选,再由标注人员排序或改写,最后用这些偏好训练模型。这也是模型变得「会聊天、有分寸」的主要来源之一。成本较高,因此中小团队很少从头自建这套流程。
上
- 上下文窗口Context Window读完整概念 →
模型单次能同时看到的文本总量上限,包含系统指令、历史对话与本轮输入。
装不下的部分会被裁掉或压缩成摘要,长对话因此会「忘记」开头。窗口大并不代表每处都被认真读取,中段内容被忽略的情况仍会出现。上传文件通常也不等于全文逐字读过。
少
- 少样本示例Few-shot
在提示词里给出几个输入输出样例,让模型照着格式和口径回答。
给两三个样例往往比写一大段形容词更有效,这是最容易上手、成本也最低的技巧。样例要覆盖真实场景中的典型情况与边界情况,格式保持一致。它只是参考,需求本身有歧义时同样会被误读。
- 少样本示例Few-shot
在提示词里先给两三个输入输出样例,让模型照着格式和口径回答。
这是最容易上手、成本也最低的技巧,往往比一大段形容词更有效。样例要覆盖真实场景里会遇到的情况,并保持格式完全一致。它只是最有力的参考,需求本身有歧义时同样会被误读。
思
速
- 速率限制Rate Limit
服务商对单位时间内的调用次数或 token 用量设的上限,超出就可能被拒绝。
常见表现是收到限流提示,或者响应明显变慢,多数情况下稍等重试就能继续。同时发出的请求还会互相挤占配额,所以控制并发通常比单纯多开几个任务更有效。做自动化前要先了解额度规则,并准备好重试和失败处理。
随
- 随机种子Seed
固定生成过程的初始随机数,设定后同一提示词能得到可复现的输出。
模型生成本质是采样,种子相同则采样序列相同,配合固定的温度就能得到一致结果。做批量对比、回归测试或复现实验时,建议把种子固定下来。它也是部分绘图工具「同一个角色能不能画得一样」的关键参数。
提
- 提示词注入Prompt Injection
攻击者把指令藏在网页、文档或图片里,试图劫持 AI 行为的攻击手法。
当 Agent 会自动读取网页或文件时,正文里藏的「忽略之前的指令」就可能被执行。防御思路是分层权限、关键动作人工确认、限制可读来源。给 AI 开放联网和文件权限时,这是必须评估的风险。
推
- 推理Inference
训练完成后的实际使用过程,包含模型处理输入并生成输出的全部环节。
推理速度受参数量、量化程度、批量大小和硬件影响,直接决定响应快慢与账单高低。本地部署时说的「跑得动」,本质上就是推理资源够不够。这个词也常用来指模型的逻辑推理能力,看上下文即可区分。
微
- 微调Fine-tuning读完整概念 →
用特定数据继续训练已有模型,让它稳定掌握某种格式、口吻与任务模式。
它更擅长改变行为习惯,而不是往模型里灌新知识;确实需要更新事实时,用检索增强生成更合适。低秩适配(LoRA)这类轻量做法让个人也能上手,只需训练一小段附加参数。详见概念页「微调」。
温
- 温度Temperature读完整概念 →
控制输出随机性的参数,越低越稳定保守,越高越发散有创意。
它改变的是选词分布,并不增加知识,调高反而更容易跑题和编造。抽取数据、写代码应该压低,写创意文案可以放开。它不能替代提示词里的风格与格式要求,两者作用不同。
- 温度Temperature
控制生成随机性的旋钮:低则稳定保守,高则发散有创意,同时出错概率也上升。
它调的是选词分布,不会增加知识或判断力。抽取信息、写代码这类需要稳定输出的任务应该压低,写创意文案可以放开。它不能替代提示词里的风格与格式要求,两者管的不是一件事。更完整的说明见概念页「温度」。
文
- 文字识别OCR读完整概念 →
把图片、扫描件、拍照件里的文字转成可复制、可检索的文本。
多数「看图」功能的第一步就是它,纸质试卷和手写通知的录入基本靠这一步。识别结果需要人工核对,尤其是手写字、公式和小字。含学生姓名或成绩的扫描件交给外部服务前,先确认学校的规定。详见概念页「文字识别」。
系
- 系统提示词System Prompt
对话开始前设定模型角色、语气与硬性规则的指令,优先级高于普通对话内容。
系统提示词常用来固定身份、输出格式和安全边界,多数产品不开放直接编辑,只能通过自定义指令或项目规则间接影响。它也常被称为系统指令,优先级高于普通对话内容。把它和用户输入区分开,有助于判断「为什么我这次的要求它没照做」。
- 系统提示词System Prompt读完整概念 →
对话开始前设定 AI 身份、语气与边界的指令,优先级高于普通对话内容。
可以理解为给 AI 发的岗位说明书:身份怎么演、话说得多客气、哪些要求必须拒绝,都写在这里。多数产品不开放直接编辑,只能通过自定义指令、角色或项目设定间接影响。分清它和你自己说的话,是判断「为什么这次要求它没照做」的第一步。
向
- 向量Embedding读完整概念 →
把一段内容变成一串能表示语义关系的数值,意思相近的内容在空间里更靠近。
它让「意思相近」变成可以计算的相似度问题,常用余弦相似度来比较。语义搜索、去重和检索增强生成都建立在它之上,本身不可读,必须配合索引或向量数据库才能被检索到。详见概念页「嵌入(向量表示)」。
应
- 应用程序接口API
让程序调用模型能力的标准入口,也是把 AI 接进现有系统的常规方式。
通过 API 你可以自己控制提示词、批量执行任务并处理返回值,是产品化集成的基础。相比网页版,它少了人工确认环节,但也意味着错误不会被你看到,需要自己加校验。做自动化前应先考虑限流、失败重试和成本监控。
预
- 预训练Pretraining
在大规模通用语料上先训练出基础能力,之后再针对具体任务做调整的阶段。
预训练阶段模型只学一件事:接着上文把下文预测出来,语言能力、知识雏形和通用推理都在这一步形成。之后的微调与对齐都是在这个底座上做的小幅修正。可以类比为先完成通识教育,再进入专业岗位。
长
- 长上下文Long Context
模型一次能处理远超普通文档篇幅的材料,用于分析整本书或超长会话。
长上下文让整份合同、年报或手册可以直接丢进去做问答,NotebookLM 是典型代表。代价是成本与响应时间上升,而且注意力会被稀释,关键信息最好同时写进正文。把整个资料库硬塞进去,不如按需检索几段。
知
- 知识蒸馏Distillation
让小模型模仿大模型的输出行为,从而以更低成本接近部分能力。
训练时把大模型的输出当作参考答案喂给小模型,小模型就能在较小参数量下学到接近的行为。业界不少轻量模型都是这样来的。它牺牲的是能力上限,换来的是速度和成本优势。
直
- 直接偏好优化Direct Preference Optimization
跳过强化学习环节、直接用偏好数据训练模型的一种对齐方法。
它用「更好的回答 / 更差的回答」成对数据直接做优化,省去了训练奖励模型和多轮采样,流程更简单也更稳定。这是对齐路线上常见的替代方案,效果如何很依赖偏好数据的质量。
智
- 智能体工作流Agent Workflow读完整概念 →
把目标拆成步骤、规定每步可调用哪些工具、并留出人工确认节点的固定执行流程。
流程越固定越可靠,适合批量重复的整理、汇总和对接类任务。真正需要临场判断的环节仍要留给人,或交给另一个模型复核。常见设计是让智能体负责收集和起草,把执行与对外发送留给人工确认。详见概念页「Agent 智能体」。
中
- 中转服务API Relay / Proxy
把请求转发到上游模型的第三方服务,往往更便宜,但多一层数据风险。
中转常以聚合多个模型、折价充值为卖点,个人用着方便,但你的全部输入输出都会经过它,属于第三方可见范围。涉及公司资料、账号凭据或未公开内容时应谨慎,选之前问清日志留存和数据去向。
注
- 注意力机制Attention
模型处理每个词时,动态决定该重点关注上下文哪些部分的一种加权计算方式。
注意力会给上下文中的每个位置打分,再按分数加权汇总,从而建立词与词之间的关联。自注意力是其中一种,位置完全落在序列内部。早期研究常把它类比为「可微分的关键词匹配」。
R
- RAG 检索RAG Retrieval
RAG 中从资料库里挑出相关片段交给模型的那一步,决定了答案依据什么。
常见做法是先按向量相似度取候选,再用关键词或重排模型调整顺序,最后取前几条作为上下文。召回不到正确片段时,再强的模型也只能胡答。所以排查知识库问题时,应该先看检索结果对不对,再去调提示词。
- ReAct 推理-行动循环ReAct
让模型交替进行「思考下一步」与「调用工具」,直到任务完成的思路。
ReAct 把智能体拆成思考、行动、观察三个动作循环往复,工具返回的结果会再次进入上下文供模型判断。现代多数 Agent 框架都遵循类似模式。它很吃上下文预算,循环几轮后旧内容容易丢失,必要时要做压缩或重启。
t
- token 成本Price per 1K Tokens
按输入和输出的 token 数量分别计价,用来估算一次任务大概要花多少钱。
各家对输入和输出分别标价,同一个模型的网页订阅和接口计费也不是一套数字。中文通常比英文更占 token,同样一件事换个写法价格就会不同。定价会随版本和活动调整,做预算时应以官方当前的计费页为准,不要照搬旧数字。
T
- Token 计量单位Token读完整概念 →
模型切分文本后的最小计量单位,长度、计费与延迟都按它计算。
token 由模型自带的分词器切分,英文里一个词常拆成两三个,中文一个字可能占一两个。它同时决定上下文窗口能装下多少内容。看懂它,就能解释为什么同一段提示词换个写法,价格会明显不同。
- Transformer 架构Transformer
目前主流大模型底层的神经网络结构,靠注意力机制处理序列之间的关联。
Transformer 让序列里任意两个位置可以直接交换信息,因此能并行训练,也擅长捕捉长距离依赖。它是 GPT、BERT 系列以及绝大多数现代视觉与语音模型的共同底座。理解它有助于判断「模型为什么会漏掉长文里的中段信息」这类问题。