Appearance
技术英语:术语表与使用方式
先说结论
你不需要"学英语",你需要"用英语"。 这两件事的差别,和你不需要"学数学"、 只需要"读懂工程里的数学符号"完全一样。
前沿技术材料是英文的,这一点无法回避:论文、官方文档、报错信息、GitHub issue、 模型卡、release notes。但这门"技术英语"是一个很窄的子集:
| 你需要 | 你不需要 |
|---|---|
| 读懂文档和论文的结构 | 口语流利 |
| 读懂报错信息(最高频、收益最直接) | 写作地道 |
| 写简短的 issue / commit / 注释 | 听懂无字幕演讲 |
| 认领域术语(约 300 个词覆盖 90% 阅读) | 通用英语词汇量 |
不要单独报英语课、不要背单词书。 那和"先补完数学再做工程"是同一个陷阱: 它是一个没有完成信号的无限期项目,会持续产生"我在进步"的错觉。 唯一正确的做法是把它绑在工程任务上——你每读一篇文档,英语就自动练了一次。
具体做法(四条,按收益排序)
- 报错信息永远读原文。 不要复制去搜中文。这是最高频、反馈最快、最不可替代的英语练习。 一年下来这一项就够用了。
- 先整段读,不要逐词查。 一段读不懂就整段扔进翻译,看懂后回看英文,找出是哪个词卡住你。 逐词查会毁掉速度,让你永远停在第一页。
- 论文只读 Abstract → 图表 → Conclusion。 正文的证明部分对你没用, 读它是为了知道"它解决了什么问题、结论是什么、代价是什么"。
- 建术语表,不建单词本。 遇到不认识的核心术语就加一行到下面这张表。 加满 100 行左右,读英文文档就不再有阻力了。
核心术语表
用法:遇到不认识的术语就往下加。不要抄词典定义,写"它在做什么"。
LLM 基础
| 术语 | 中文 | 一句话说明 |
|---|---|---|
| token | 词元 | 模型处理的最小单位,计费和上下文长度都按它算 |
| embedding | 嵌入 / 向量表示 | 把文本压成一串数字,让"意思相近"变成"距离相近" |
| inference | 推理 | 用训练好的模型跑一次输出(不是逻辑学那个推理) |
| context window | 上下文窗口 | 一次能塞给模型的最大 token 数 |
| temperature | 温度 | 控制采样的随机程度;调低更确定,调高更发散 |
| top-p / nucleus sampling | 核采样 | 只从累积概率前 p 的候选里采样 |
| logits | 未归一化分数 | softmax 之前的原始输出,还没变成概率 |
| prompt / completion | 提示 / 补全 | 输入 / 输出 |
| fine-tuning | 微调 | 用自有数据继续训练已有模型 |
| hallucination | 幻觉 | 模型编造看似合理但不真实的内容 |
| grounding | 有据可依 | 让回答绑定到检索到的资料上,用来压幻觉 |
| tokenizer | 分词器 | 把文本切成 token 的组件 |
检索(RAG)
| 术语 | 中文 | 一句话说明 |
|---|---|---|
| chunk / chunking | 切块 / 分块 | 把长文档切成可检索的小段 |
| retrieval | 检索 | 从语料里挑出与问题相关的片段 |
| rerank | 重排 | 对初筛结果重新排序,提升精度 |
| recall@k | 前 k 命中率 | 正确答案有没有出现在前 k 个结果里 |
| MRR | 平均倒数排名 | 第一个正确结果排得越靠前分越高 |
| nDCG | 归一化折损累计增益 | 考虑排序位置的检索质量指标 |
| ANN | 近似最近邻 | 用索引换速度的近似检索 |
| cosine similarity | 余弦相似度 | 用向量夹角衡量相似程度 |
| BM35 | — | 经典关键词检索算法,常与向量检索混用 |
| hybrid search | 混合检索 | 关键词 + 向量一起用 |
Agent 与工具
| 术语 | 中文 | 一句话说明 |
|---|---|---|
| tool calling / function calling | 工具调用 | 模型输出结构化的"我要调哪个函数" |
| ReAct | 推理+行动 | 让模型交替"想一步、做一步"的循环范式 |
| agent loop | Agent 主循环 | 模型输出 → 执行工具 → 结果回填 → 继续 |
| trajectory | 轨迹 | 一次任务中所有步骤的完整记录 |
| planner / executor | 规划器 / 执行器 | 一个负责拆任务,一个负责干 |
| orchestration | 编排 | 协调多个步骤或多个 Agent |
| guardrail | 护栏 | 限制模型行为边界的机制 |
| fallback | 降级 | 主路径失败时的备用路径 |
| idempotent | 幂等 | 重复执行结果一致(重试安全的前提) |
| retry / backoff | 重试 / 退避 | 失败后延时重试,避免雪崩 |
| sandbox | 沙箱 | 限制代码执行权限的隔离环境 |
评测与可观测性
| 术语 | 中文 | 一句话说明 |
|---|---|---|
| eval / benchmark | 评测 / 基准 | 用固定数据集衡量系统表现 |
| ground truth | 标准答案 | 人工标注的正确答案 |
| LLM-as-a-judge | 模型当裁判 | 用模型给模型打分(必须先校准) |
| regression | 回归退化 | 新改动让原本能过的指标变差 |
| trace / span | 链路 / 跨度 | 请求级 / 步骤级的调用记录 |
| telemetry | 遥测 | 埋点采集的运行数据 |
| baseline | 基线 | 用来对比的参照结果 |
| latency / throughput | 延迟 / 吞吐 | 单次多快 / 单位时间能处理多少 |
| TTFT | 首 token 延迟 | 从发出请求到吐第一个字的时间 |
| p99 | 99 分位 | 最慢的那 1% 有多慢(比平均值更值得盯) |
推理与部署
| 术语 | 中文 | 一句话说明 |
|---|---|---|
| quantization | 量化 | 用更低位宽表示权重,省显存 |
| batching | 批处理 | 多个请求合并计算,提吞吐但增延迟 |
| KV cache | 键值缓存 | 缓存已算过的注意力状态,避免重复计算 |
| prefill / decode | 预填充 / 解码 | 处理输入的阶段 / 逐字生成的阶段 |
| OOM | 显存/内存溢出 | Out Of Memory |
| vLLM | — | 高吞吐推理服务框架 |
| serving | 服务化 | 把模型部署成可调用的服务 |
| concurrency | 并发 | 同时处理的请求数 |
记录方式
每读完一篇英文文档/论文,在私有仓库的草稿区记一行:读了什么 → 解决了什么问题 → 新增了什么术语。 不需要写读后感,那不是你的目的。