Skip to content

技术英语:术语表与使用方式

先说结论

你不需要"学英语",你需要"用英语"。 这两件事的差别,和你不需要"学数学"、 只需要"读懂工程里的数学符号"完全一样。

前沿技术材料是英文的,这一点无法回避:论文、官方文档、报错信息、GitHub issue、 模型卡、release notes。但这门"技术英语"是一个很窄的子集

你需要你不需要
读懂文档和论文的结构口语流利
读懂报错信息(最高频、收益最直接)写作地道
写简短的 issue / commit / 注释听懂无字幕演讲
认领域术语(约 300 个词覆盖 90% 阅读)通用英语词汇量

不要单独报英语课、不要背单词书。 那和"先补完数学再做工程"是同一个陷阱: 它是一个没有完成信号的无限期项目,会持续产生"我在进步"的错觉。 唯一正确的做法是把它绑在工程任务上——你每读一篇文档,英语就自动练了一次。

具体做法(四条,按收益排序)

  1. 报错信息永远读原文。 不要复制去搜中文。这是最高频、反馈最快、最不可替代的英语练习。 一年下来这一项就够用了。
  2. 先整段读,不要逐词查。 一段读不懂就整段扔进翻译,看懂后回看英文,找出是哪个词卡住你。 逐词查会毁掉速度,让你永远停在第一页。
  3. 论文只读 Abstract → 图表 → Conclusion。 正文的证明部分对你没用, 读它是为了知道"它解决了什么问题、结论是什么、代价是什么"。
  4. 建术语表,不建单词本。 遇到不认识的核心术语就加一行到下面这张表。 加满 100 行左右,读英文文档就不再有阻力了。

核心术语表

用法:遇到不认识的术语就往下加。不要抄词典定义,写"它在做什么"。

LLM 基础

术语中文一句话说明
token词元模型处理的最小单位,计费和上下文长度都按它算
embedding嵌入 / 向量表示把文本压成一串数字,让"意思相近"变成"距离相近"
inference推理用训练好的模型跑一次输出(不是逻辑学那个推理)
context window上下文窗口一次能塞给模型的最大 token 数
temperature温度控制采样的随机程度;调低更确定,调高更发散
top-p / nucleus sampling核采样只从累积概率前 p 的候选里采样
logits未归一化分数softmax 之前的原始输出,还没变成概率
prompt / completion提示 / 补全输入 / 输出
fine-tuning微调用自有数据继续训练已有模型
hallucination幻觉模型编造看似合理但不真实的内容
grounding有据可依让回答绑定到检索到的资料上,用来压幻觉
tokenizer分词器把文本切成 token 的组件

检索(RAG)

术语中文一句话说明
chunk / chunking切块 / 分块把长文档切成可检索的小段
retrieval检索从语料里挑出与问题相关的片段
rerank重排对初筛结果重新排序,提升精度
recall@k前 k 命中率正确答案有没有出现在前 k 个结果里
MRR平均倒数排名第一个正确结果排得越靠前分越高
nDCG归一化折损累计增益考虑排序位置的检索质量指标
ANN近似最近邻用索引换速度的近似检索
cosine similarity余弦相似度用向量夹角衡量相似程度
BM35经典关键词检索算法,常与向量检索混用
hybrid search混合检索关键词 + 向量一起用

Agent 与工具

术语中文一句话说明
tool calling / function calling工具调用模型输出结构化的"我要调哪个函数"
ReAct推理+行动让模型交替"想一步、做一步"的循环范式
agent loopAgent 主循环模型输出 → 执行工具 → 结果回填 → 继续
trajectory轨迹一次任务中所有步骤的完整记录
planner / executor规划器 / 执行器一个负责拆任务,一个负责干
orchestration编排协调多个步骤或多个 Agent
guardrail护栏限制模型行为边界的机制
fallback降级主路径失败时的备用路径
idempotent幂等重复执行结果一致(重试安全的前提)
retry / backoff重试 / 退避失败后延时重试,避免雪崩
sandbox沙箱限制代码执行权限的隔离环境

评测与可观测性

术语中文一句话说明
eval / benchmark评测 / 基准用固定数据集衡量系统表现
ground truth标准答案人工标注的正确答案
LLM-as-a-judge模型当裁判用模型给模型打分(必须先校准)
regression回归退化新改动让原本能过的指标变差
trace / span链路 / 跨度请求级 / 步骤级的调用记录
telemetry遥测埋点采集的运行数据
baseline基线用来对比的参照结果
latency / throughput延迟 / 吞吐单次多快 / 单位时间能处理多少
TTFT首 token 延迟从发出请求到吐第一个字的时间
p9999 分位最慢的那 1% 有多慢(比平均值更值得盯)

推理与部署

术语中文一句话说明
quantization量化用更低位宽表示权重,省显存
batching批处理多个请求合并计算,提吞吐但增延迟
KV cache键值缓存缓存已算过的注意力状态,避免重复计算
prefill / decode预填充 / 解码处理输入的阶段 / 逐字生成的阶段
OOM显存/内存溢出Out Of Memory
vLLM高吞吐推理服务框架
serving服务化把模型部署成可调用的服务
concurrency并发同时处理的请求数

记录方式

每读完一篇英文文档/论文,在私有仓库的草稿区记一行:读了什么 → 解决了什么问题 → 新增了什么术语。 不需要写读后感,那不是你的目的。