60个AI术语里最危险的不是‘不懂’,而是半懂:把类比词典升级成可验证的AI概念地图
AI术语内容很容易火。 因为它满足一种很真实的需求:普通人不想先读十篇论文,只想知道 Token、Agent、RAG、MCP、DPO、Test-time Compute 到底是什么。 AH-0392 的原文用了大量生活类比,把 60 个概念压成一句话解释。它的优点是降低门槛。 它最大的风险也来自这里: 类比很容易让人“感觉懂了”,但类比不是定义。 如果一个术语以后会影响你选模型、搭系统
60个AI术语里最危险的不是“不懂”,而是半懂:把类比词典升级成可验证的AI概念地图
AI术语内容很容易火。
因为它满足一种很真实的需求:普通人不想先读十篇论文,只想知道 Token、Agent、RAG、MCP、DPO、Test-time Compute 到底是什么。
AH-0392 的原文用了大量生活类比,把 60 个概念压成一句话解释。它的优点是降低门槛。
它最大的风险也来自这里:
> 类比很容易让人“感觉懂了”,但类比不是定义。
如果一个术语以后会影响你选模型、搭系统、判断论文、购买服务,半懂比完全不懂更危险。
所以这篇不再做“60个术语背诵表”。
我们把它升级成一张:
> AI Concept Map:Definition / What it changes / What it does not mean / Evidence / Version
---
一、先建立第一条规则:Analogy ≠ Definition
例如:
“Token 是模型的砖块。”
这个类比能帮助入门,
但技术上 Token 是 tokenizer 把文本或其他输入映射成的离散单元。
不同模型:
tokenizer不同; 中文/英文切分不同; 同一句话 token 数也可能不同。
所以 Token 更准确的理解是:
> 模型输入/输出序列中的离散表示单位,同时也是许多API计量的一部分。
不是“工作量”的统一物理单位。
---
二、Context Window 不是“模型一次最多能干多少活”
原文把 Context Window 类比成工作空间。
这个比喻方向没错。
但容易外推成:
“上下文越长,任务完成能力越强。”
不成立。
Context Window 主要约束:
模型单次推理可条件化的信息规模。
它不保证:
全部内容都被同等利用; 长文中间信息不会丢; 工具链状态不会漂; 复杂任务不会失败。
所以:
> Context Window ≠ Useful Work Capacity
1M context 也不等于:
能可靠完成 1M token 的长任务。
---
三、Parameter Count ≠ “脑容量”
参数是模型中训练得到的数值权重。
把它比成“神经元连接”可以帮助直觉,
但不能据此得出:
参数越大就一定越聪明。
模型质量还受到:
架构; 训练数据; 训练目标; 后训练; 推理策略; 工具; 量化; 蒸馏
影响。
尤其 MoE 模型还有:
Total Parameters; Active Parameters
两个不同数字。
所以:
> Parameter Count ≠ Intelligence Score
---
四、Multimodal 不是“它真的像人一样看懂世界”
Multimodal 模型能处理多种模态:
文本; 图片; 音频; 视频; 结构化数据等。
但“支持图片输入”不等于:
视觉能力对所有任务都稳定。
要继续问:
OCR怎样? 图表理解怎样? 空间关系怎样? 视频时间理解怎样?
功能标签只是入口,
能力仍需任务级 eval。
---
五、Emergent Ability 必须保留争议
原文解释为:
“模型练大了突然会没教过的本事。”
这是著名叙事,
但学术上并非没有争议。
2023 年 Schaeffer 等人的论文提出:
部分看似突然出现的“涌现”,可能来自不连续评价指标,而不是模型能力真的在某个规模点突然跳变。
这不意味着:
所有 emergence 都不存在。
真正正确的写法是:
> Emergent ability 是一种观察到的尺度行为现象,其“突然性”可能受到指标和测量方式影响。
所以:
Emergent Ability Claim Requires Metric Boundary
---
六、Hallucination 也不能只写成“AI胡说八道”
幻觉是模型生成:
与事实、输入或可验证来源不一致的内容。
但它并不只是:
“模型不知道”。
还可能来自:
训练分布; 不确定性; 检索失败; 错误工具结果; 提示上下文冲突; 生成目标
等。
因此:
RAG 可以降低某些知识型错误,
但:
> RAG ≠ Hallucination Elimination
如果检索文档本身错了,
RAG 会把错话说得更有引用感。
---
七、Knowledge Cutoff 也不是“毕业那天”
这是非常好的入门类比,
但现代产品经常包含:
Search; Connectors; RAG; tools; 实时数据库。
所以要区分:
Model Internal Knowledge Cutoff
与:
Product Current Information Access。
一个模型内部知识旧,
产品仍可能通过搜索获得最新事实。
---
八、Pre-training / Post-training / SFT 需要分层
Pre-training:
通常通过大规模数据训练基础模型能力。
Post-training:
是一个更大的上位概念,
可包含:
SFT; Preference Optimization; RL; Safety tuning
等。
所以:
> SFT 是 Post-training 的一种方法,不是两者并列互斥概念。
---
九、LoRA 不是“增加模型内容”
LoRA 是参数高效微调方法。
它通过低秩参数更新,
减少需要训练的参数量和显存成本。
它可以改变:
风格; 任务行为; 特定领域能力。
但不能简单写成:
“给模型增加知识”。
知识注入是否成功,
还要测试:
记忆; 泛化; 灾难性遗忘; 冲突。
---
十、RLHF 不是“绩效考核”
类比上容易理解,
技术上一般是:
human preference → reward/feedback signal → policy optimization。
而今天对齐技术远不只有:
RLHF。
还有:
DPO; RLAIF; RLVR; 各种 policy optimization。
所以不要把:
所有后训练
统称 RLHF。
---
十一、DPO 不是“效果差不多,但更省事”
DPO 的经典论文确实提出:
不用显式训练 reward model 再跑传统 RL policy optimization,
而是直接通过 preference pairs 优化。
论文展示了:
更简单; 稳定; 在若干任务上可匹配或优于 PPO-based RLHF。
但不能升级成:
“DPO 在任何场景都效果一样”。
后续研究已经显示:
数据分布和优化目标不同,
DPO也存在明显边界。
所以:
> DPO ≠ Universal Drop-in Replacement for RLHF
---
十二、Distillation 不是“抄作业”
蒸馏可以用 teacher model 的:
logits; probability; responses; intermediate features
去训练 student。
“拿别人的答案训练”只是其中一种形式。
更重要的是:
蒸馏能压缩行为,
但:
不会保证完整复制 teacher 的所有能力。
---
十三、Alignment 也不能写成“教模型做人”
Alignment 是:
使模型行为与特定人类意图、规则、价值或政策更一致。
真正的难点是:
“谁的价值?” “什么任务?” “如何权衡?” “怎样验证?”
所以 alignment 本身不是一个完成态。
---
十四、Reasoning 不是简单“模型把知识拿出来”
推理是一个比“检索记忆”更复杂的能力类别。
涉及:
多步计算; 约束满足; 规划; 推断; 搜索。
而且:
模型生成很长的“思维过程”
并不自动证明:
它真的推理得更对。
---
十五、Chain of Thought 最容易被误教
原文说:
“让模型把心算过程写出来。”
作为早期 prompt technique 这很直观。
但现代推理模型可能:
内部进行隐藏推理; 只输出结论/摘要; 产品不暴露完整内部链条。
因此普通用户更应该要求:
> 可验证的答案、关键假设、证据和检查步骤。
不是要求模型展示所有内部思维。
---
十六、Reasoning Model 不是一个严格统一产品类别
市场上“推理模型”通常表示:
在回答阶段投入更多推理计算,
或经过强化训练提升复杂任务表现。
但没有一个行业监管式定义。
所以比较模型时不要只看:
是否被厂商贴“Reasoning”标签。
看:
任务表现。
---
十七、Test-time Compute:原文最值得保留,也最需要加条件
2024 年 Snell 等论文确实研究了:
如何在推理阶段增加计算。
在部分问题上,
当小模型已有非零成功率时,
合理分配 test-time compute 可以击败参数量约 14 倍的更大模型。
但这不是:
“小模型多想一会永远赢大模型”。
论文同时强调:
效果取决于任务难度和推理策略。
所以:
> Test-time Compute Gain Is Task-dependent
---
十八、Temperature 不是“真实性旋钮”
Temperature 调整 sampling distribution 的随机性。
在许多任务里:
低温让输出更稳定; 高温让候选更发散。
但:
低 temperature ≠ 更真实。
一个模型如果基础判断是错的,
temperature=0
可以非常稳定地重复错误。
---
十九、Top-p / Top-k 也不是“从几个答案中随机选”
它们作用于:
下一个 token 的候选分布。
不是先生成几个完整答案再选一个。
这类简化虽然好懂,
但会形成错误的生成机制想象。
---
二十、System Prompt 不一定“用户永远看不见”
System Prompt 是消息/指令层级的一种。
不同产品有:
system; developer; user; tool
等控制层。
具体可见性由 harness 产品决定。
所以不能把:
“系统提示词”
定义成:
“用户看不到的提示词”。
---
二十一、Prompt Engineering 的价值也在下降和迁移
早期主要是:
怎么把一句话写得更好。
今天生产系统更多变成:
Prompt + Context + Tool + Schema + Eval + Workflow + Permission。
所以:
> 提示词只是系统的一层。
---
二十二、Jailbreak:不要把它定义成“让AI说不该说的话”
更准确:
通过输入、上下文、工具或交互方式,
诱导系统违反预期安全或控制策略。
它既是:
安全研究对象,
也可能是:
恶意绕过方法。
alphahole 的内容只保留防御和测试价值。
---
二十三、Function Calling:模型不是直接“真的发邮件”
模型通常输出:
结构化 tool call。
真正执行动作的是:
宿主系统/harness。
所以:
> Model Suggests Action ≠ Tool Executes Action
权限和责任属于工具层。
---
二十四、MCP 的全名必须写对
MCP:
Model Context Protocol
不是随意改写成“模型扩展协议”。
它提供标准方式,
让 AI 应用与:
tools; resources; prompts; external systems
连接。
但:
MCP 本身不自动保证工具安全。
---
二十五、Skills 绝不是“一段固定提示词脚本”
现代 Agent Skill 可以包含:
触发规则; 流程; 工具; 脚本; 资源; 验收; 失败策略; 版本。
在 alphahole 里继续采用:
Skill Contract。
Trigger / Anti-trigger / Inputs / Workflow / Permissions / Human Gate / Output / Acceptance / Failure / Evals。
---
二十六、Embedding / Vector DB / RAG 要彻底分开
Embedding:
把对象映射到向量空间。
Vector DB:
存储/索引向量,并支持相似检索。
RAG:
利用检索结果辅助生成。
三者不是:
同一个“记忆系统”。
RAG甚至可以:
不用向量数据库。
---
二十七、MoE:总参数与激活参数必须分开
Mixture-of-Experts:
在模型内部引入多个 expert,
每个 token/步骤只激活部分专家。
其核心目标之一是:
扩大总模型容量,
同时控制每次计算成本。
“MoE 2.0 时间维度稀疏性”不是一个足够稳定、普遍接受的标准术语,
所以不进入基础词典。
---
二十八、Quantization 不只是“牺牲一点精度”
量化把权重、激活等数值表示降到更低 bit precision。
影响包括:
显存; 速度; 硬件兼容; 质量。
不同任务/模型的质量损失差异很大。
---
二十九、Long Context 不是一个单独技术
可通过:
RoPE scaling; 位置编码改进; 训练策略; 检索; 压缩
等形成。
所以“Long Context”更像能力/产品特性类别。
---
三十、Guardrails 不是“正能量过滤器”
生产系统中的 guardrails 包括:
安全; 权限; 输入输出验证; 法律; 业务规则; 风险阈值。
不能把它缩成:
内容审查。
---
三十一、Red Teaming 也不只是上线前体检
AI red teaming 包括:
寻找安全漏洞; 滥用路径; prompt injection; 数据泄露; 工具越权; 模型错误。
而且:
上线后仍然需要持续测试。
---
三十二、Benchmark 是测量工具,不是模型身份证
任何 benchmark 都有:
数据集; 评分; 污染; 任务分布
边界。
高 benchmark ≠ 你的 workflow 更好。
---
三十三、Leaderboard 更不能直接决定购买
真正决策要加入:
Cost; Latency; Tool use; Reliability; Context; Data policy; Failure mode。
---
三十四、Throughput 和 Latency 不一样
Latency:
单请求等待时间。
Throughput:
单位时间整体处理能力。
高 throughput 的系统,
单请求也可能不快。
---
三十五、Tokenizer 会影响成本与上下文效率
同一段中文:
不同 tokenizer
可能产生不同 token 数。
因此跨模型算成本,
不要只比较:
$/1M tokens。
还要比较:
相同真实任务的总输入输出量。
---
三十六、Attention 是 Transformer 核心,但“自动抓重点”过度拟人
Attention 计算 token 表示之间的依赖权重。
它不是:
人类意义的注意力。
类比可以帮助入门,
不能把机制拟人化成理解。
---
三十七、Human-in-the-loop 不等于“所有事情都人工看一遍”
好的 HITL 是:
风险分层。
Low consequence:
自动。
Medium:
抽检。
High consequence:
批准后执行。
否则:
人工会成为瓶颈。
---
三十八、Open / Closed 最容易误写
“权重公开”只是:
Open-weight。
真正开源还要看:
License; training code; data; commercial rights; modification rights。
所以:
> Open-weight ≠ Open-source
---
三十九、API 也不是“门牌号+暗号”
API 是程序之间的接口契约。
包括:
Endpoint; Request schema; Auth; Rate limit; Errors; Version; Data policy。
API Key 只是:
一种 authentication credential。
---
四十、World Model 还没有唯一行业定义
通常指:
模型学习/表示环境动态,
用于预测、规划或控制。
不同论文:
视觉 world model; 机器人 world model; generative environment model
定义都可能不同。
所以不要写成:
“AI真正理解物理世界的模型”。
---
前沿趋势部分:最需要 Evidence Label
基础术语可以稳定多年。
但“2026趋势”必须带:
Source; Date; Claim type。
---
四十一、Embodied AI
它不是“AGI的物理形态”这个定论。
更安全定义:
> 研究具身智能体如何通过身体、传感和环境交互完成感知、决策与控制。
人形机器人只是其中一种。
---
四十二、Physical AI
这是产业和研究里越来越常见的术语,
用于描述 AI 与物理世界交互:
机器人; 自动驾驶; 工业系统等。
但不要把某位 CEO 的市场规模判断当:
科学定义。
---
四十三、Multi-Agent System
多个 Agent 协作是一个真实架构方向。
但:
> “2026 是企业多Agent规模化元年”
属于产业判断,
不是验证事实。
多Agent还有:
协调成本; 错误传播; 共享上下文; 权限复杂度。
---
四十四、Agentic Workflow 的 L1/L2/L3 不是统一标准
“Workflow Agent → Reasoning Agent → Multi-agent”
可以作为某篇作者自己的框架。
不能作为:
AI行业官方成熟度分级。
---
四十五、Foundation Model
这是已经广泛使用的术语。
核心强调:
大规模训练; 广泛下游任务; 可适配/迁移。
不能简单说:
“什么都会一点的底座”。
---
四十六、RLVR
Reinforcement Learning with Verifiable Rewards:
通过可验证结果产生奖励信号。
最适合:
数学; 代码; 形式验证; 可自动判对错任务。
但可验证 reward 也可能被:
reward hacking。
---
四十七、Causal World Model
这是研究方向,
不是已经形成统一成熟产品类别。
“理解为什么发生”是研究目标,
不是默认已经做到。
---
四十八、Visuotactile:不要被夸张数字带跑
视触觉是:
通过视觉传感器观察柔性材料变形,
从而估计:
接触; 力; 纹理; 滑移等。
具体“每平方厘米多少触点”
高度依赖设备定义、分辨率和算法,
不能作为视触觉通用事实。
---
四十九、Sudo R1:这条原文有真实来源,但要精确写
Sudo 官方 2026 发布材料报告:
约98% first-attempt success;
两次内接近100%;
60分钟连续测试;
训练使用仿真数据;
覆盖未见物体和复杂视觉条件。
这属于:
VENDOR_REPORTED_EVALUATION
不是:
“整个机器人行业已经实现近100%通用操作”。
---
五十、所以:
> Vendor Benchmark ≠ Independent General Capability
真正独立验证还需要:
第三方; 更多任务; 不同现场; 长期运行; 故障率; 维护成本。
---
五十一、Sim-to-Real 也不能定义成“纯仿真训练”
Sim-to-Real 是:
从模拟环境训练/验证,
再迁移到真实系统的一类方法。
可以:
纯仿真;
也可以混合真实数据。
---
五十二、AGI 最不该写成“终极圣杯”
AGI 仍然没有:
统一、法律或科学界唯一标准定义。
常见语义是:
跨任务、跨领域的广泛通用能力。
所以应该保留:
定义争议。
---
最后,给alphahole一套可维护AI术语格式
每个词只允许六个字段:
1. Definition
尽可能技术准确。2. Analogy
给初学者的类比。3. Does Not Mean
最容易误解什么。4. Why It Matters
什么时候影响真实工作。5. Evidence
官方文档/论文。6. Verified Date
尤其前沿词和产品词。---
产品化:AI Concept Boundary Map
这个内容真正有机会变成一个长期工具。
不是:
“背60个名词”。
而是用户点开:
RAG
就看到:
定义; 相邻概念; 典型误解; 什么时候用; 什么时候不用; 原始资料; 最新更新。
---
V3怎么测?
找20名:
产品; 运营; 开发; 内容创作者。
让他们先看普通“术语一句话词典”,
再看 Boundary Map。
用真实问题测试:
“上下文100万是不是一定更适合长任务?” “参数越大是不是越聪明?” “RAG是不是能解决幻觉?” “开源模型能不能随便商用?” “低temperature是不是更真实?”
如果误判没有显著下降,
就说明:
我们只是做了更长的词典,
没有做成真正的判断工具。
---
结论
AI时代最容易制造的认知幻觉之一是:
> 我知道这个词,所以我懂这个东西。
真正有用的术语学习不是记住:
MCP = 某某协议。
而是知道:
它解决什么问题; 它不解决什么问题; 相邻概念怎么区别; 结论依赖哪些条件; 什么时候必须重新核验。
术语不是知识终点。
术语只是你进入正确问题的入口。