Skip to content

术语对照表

omk 文档(包括博客、SKILL.md、CLI 输出、报告页)会混用一些 ML / 统计 / 测量学的业内通用英文术语 —— 这些词在英文社区里已经是事实标准,强行中文化反而显得在「翻译外文」。这份对照表给读者一个速查入口:每条给中文译名 + 一句话定义 + 在 omk 哪用到。

定位:读者速查表,不是设计规范。omk 维护者写新文档时遵循这份用语。

姊妹文档术语规范 (terminology-spec.md)(维护者内部决策归档)/ 统计严谨性 / 综合分构造效度


1. 统计 / 测量学

英文中文一句话定义在 omk 哪用到
bootstrap CI自助法置信区间对已注册 sampling unit 重采样得到的 percentile 置信区间,默认 1000 次Core Bootstrap-family Analysis
Δ (delta)分差 / 均值差treatment 与 control 的综合分均值差Bootstrap comparison estimate 与 Studio projection
95% CI95% 置信区间在相应假设下,构造过程具有 95% 的长期覆盖率;treatment-minus-control 区间不含 0 时方向显著Core Bootstrap-family Analysis
significant显著差异 / 显著已注册 comparison interval 在 family correction 后的有效 alpha 下不含 0Core Decision evidence
Pearson r皮尔逊相关系数1 = 完全同向,0 = 无关,-1 = 完全反向Judge-ensemble 或 Gold agreement diagnostic
MAD平均绝对差同一用例上 observed judge-member mean 之间的平均绝对差Judge Ensemble Analysis
Krippendorff αKrippendorff α / 一致性系数使用已注册 interval-distance 定义计算的一致性统计量显式 Gold comparison 或预注册 Agreement Analysis
effect size效应量已注册 score scale 上的 treatment-minus-control estimateBootstrap comparison 与 practical-effect gate
variance方差独立 run-mean composite 之间的离散程度Evaluation Series Analysis
holdout (set)外验集skill 显式没写过的独立验证用例,用来防样本驯化评测后置工作建议
construct validity构造效度测量是否真测了想测的东西(vs 测量误差)scoring.md:综合分构造效度论证
ad hoc临时拼装 / 没有原理论证的通常用来形容「先做出来再说」的实现选择scoring.md:综合分等权聚合是 ad hoc
sample-set overfitting样本驯化 / 用例过拟合评测集恰好被「答过案了」,分数虚高scoring.md / 测评博客 caveat 部分
length debias长度去偏校正 LLM 评委「答案越长打分越高」的已知偏差默认开;omk eval --no-debias-length 关闭

2. omk 评测概念

英文中文一句话定义在 omk 哪用到
artifact知识载体omk 的「被评测对象」统一抽象:skill / prompt / agent / workflow / baseline由实验角色决定(--control / --treatment / baseline),非单独 flag
executor执行器跑模型的方式:claude / codex / openai-api--executor 参数;执行环境指纹
ensemble (judge)集成评委 / 多评委多个 LLM 同时当评委独立打分,组合结果--judge-models claude:opus,claude:sonnet
judge评委LLM 当评委按 rubric 打分(zh 译作「评委」,不要译作「判官」)judge model 参数;evidence 表
rubric评分规则judge 打分时遵循的细则(应识别 X / 必须包含 Y / 至少 N 项 / ...)sample 配置的 rubric 字段
anchor锚点用人工标准校准 LLM judge 的方法--gold-dir 人工锚点
gate (layer gate)闸门 / 层门禁根据经过认证的 Composite-layer evidence 检查已注册 treatment layer 阈值Core release Decision
verdict判定PROGRESS / REGRESSION / CAUTIOUS / NOISE / UNDERPOWERED / SOLO 六种结论Core Report、CLI 路由与 Studio projection
sample (evaluation sample)评测用例omk user-facing zh 统一用「用例」(英文 sample 保留)eval-samples.json
eval-samples评测用例集 / 评测用例文件用例配置文件(每条含 prompt / rubric / assertion / capability)omk eval --samples
baseline (reserved variant)空知识载体变体(保留字)omk 保留该变体名;只有被选为 control 时才承担对照角色--control baseline
treatment实验组与对照组比较的实验角色;可以承载任意 artifact kind--treatment <name>
control对照组作为参照侧的实验角色;可以承载 baseline,也可以承载其它 artifact kind--control <name>
composite (score)综合分observed 且 present 的 fact / behavior / judge layer 等权均值,1–5 制;零 observed layer 时为 missingCore Composite table 与 Studio projection
fact (layer)事实层显式分类的 fact criterion 通过权重映射到 1–5Assertion-layer Analysis
behavior (layer)行为层显式分类的 behavior criterion 通过权重映射到 1–5Assertion-layer Analysis
judge (layer)LLM 评价层作为 judge source 绑定的 ensemble consensus 或 dimension aggregateComposite Analysis
dimension维度与一个 Metric 和上游 judge-ensemble result 一一绑定的 Analysis aggregateDimension Analysis
evidence coverage证据覆盖planned、observed、missing、invalid、failed、unavailable 与 not-started evidence 沿 lineage 保留Core Analysis 与 Decision gate
managed record受管记录omk install 建的 .omk/governance/managed/<id>.json 事实记录(源 / contentHash / 分发 / 证据 / 决定)omk install;证据门控管理
lifecycle生命周期(installed / measurable / stale)受管 skill 的读时状态:installed(无有效证据)→ measurable(eval 证据已绑)→ stale(内容漂移脱离证据)deriveManagedStateomk eval「→ measurable」
evidence (managed)证据eval 跑完追加进受管记录的 ManagedEvidenceRef,绑定它测的内容指纹(report id / 样本覆盖 / verdict / 可比性)omk eval 自动写入

3. 机器学习 / AI 通用

英文中文一句话定义
prompt提示词给 LLM 的输入文本
system prompt系统提示词在用户输入之前注入的背景指令;omk 评测时把整份 SKILL.md 作 system prompt 注入
agent智能体能调工具、多轮执行的 AI
workflow工作流多步骤的 AI 流程编排
skill知识载体(skill)omk 的核心评测对象之一,常以 SKILL.md 形式存在
tool call工具调用LLM 在执行中主动调用的外部函数
turn轮次一次「LLM 输出 + 用户/工具响应」的交互单元
context上下文LLM 在生成时看到的全部历史信息
fingerprint指纹用于跨 run 校验一致性与可比性的稳定 runtime 或 content identity
session trace会话轨迹一次完整 AI 对话的事件流(prompt / 工具调用 / 输出 / 评分),observe 解析的对象

4. omk 三阶段

omk 闭环分三阶段 —— doctor(前置健康检查)→ eval(离线 A/B + verdict)→ observe(生产 trace)—— 合起来覆盖知识评测 + 管理 + 洞察。完整心智模型见三阶段


5. 写作约定

omk 文档(README.zh / docs/zh / SKILL.md / CLI zh 字符串 / PR description)写作时遵循:

  • 业内通用术语英文保留:bootstrap CI / Δ / Pearson / executor / fingerprint 等。强行中文化会显得文章在「翻译外文」。
  • 第一次出现时给中文括注:例如「外验集(holdout set,即 skill 显式没写过的独立验证用例)」,第二次以后用中文。
  • omk 内部命名按 terminology-spec.md:artifact / executor / variant / verdict 等。
  • 特殊翻译规则
    • LLM judge → 评委(不要译作「判官」)
    • sample → 用例(不要用「样本」)
    • composite score → 综合分(不要用「总分」/「合成分」)
    • methodology audit → 测评可信度(不要用「方法学审计」,外行不懂)
  • 标点符号遵循 GB/T 15834:全角 ,。:;!?()「」,破折号 ——(双字符);半角仅限技术混排(代码块、文件路径、命令行、URL、英文术语括注)。