OMK · AI 应用的知识评测

Observe. Measure.
Know.

OMK,让 AI 应用的知识改动有据可依。
观测真实表现,量出版本差异,判断改动是否有效、版本能否发布。发布前用 doctor → eval → studio 做判断,发布后用 observe → sample → evolve 闭环。

npm 周下载 ··· CI passing MIT Node ≥ 22 相同模型 · 相同评测用例 · 只改知识载体
omk 知识载体评测闭环:知识载体、受控评测、证据报告、发布或迭代、真实使用、观测沉淀、评测集升级
一条受控发布链路,一条真实使用回流链路;版本之间不偷偷换模型。
Observe · Measure · Know

观测真实表现,量出版本差异,判断改动是否有效、版本能否发布

doctor、eval、studio、promote、observe、sample、evolve 不是孤立命令。它们把知识改动转成证据,也把线上缺口转成待复核草稿,复核后再进入下一轮固定评测集。

D

doctor 上线前

这份知识载体是否清楚到值得评测?doctor 先拦住结构、依赖、安全性和可测性问题,避免 A/B 评测浪费 token。

$ omk doctor my-skill --dimensions audit.yaml
  • 触发边界 / 文档 / 指令 / 依赖 / 工具 / 安全 / 示例
  • --repeat:并行采样 + k/n 共识
  • endpoint 自定义维度:调接口做深度审查
E

eval 发布时

v2 是否真的优于 v1?eval 固定模型和评测用例,只改变知识载体,再输出带置信区间和失败样本的一行 verdict。

$ omk eval --control v1 --treatment v2
  • Bootstrap CI / 长度去偏 / 饱和曲线默认开
  • Krippendorff α:给 gold 集自动算评委↔人工一致
  • 盲测 A/B · 多评委 ensemble · 多轮方差
O

observe 真实使用

真实使用暴露了什么?observe 把 session 日志转成知识缺口信号;from-traces 先生成草稿,人工复核后再沉淀为固定评测样本。

$ omk observe ~/.claude/sessions
  • 失败率 / 耗时 / 成本按知识载体拆解
  • 知识缺口进入待复核池
  • omk sample --from-traces 生成待复核用例草稿
护城河 · 测量可信度

严谨是底座,不是附加项

决定一个对比可信与否的,是这五处常被忽略的失真。omk 将每一道防线内建于底层,无需你逐个开启。

01
点估计把抽样波动误读为真实增益
Bootstrap 置信区间 内建
输出区间而非单点,显著性可直接判定。
02
复合均分掩盖单一维度的回退
三层独立评分 · 全过门槛 内建
事实 / 行为 / 评委任一不达标,即不予通过。
03
对照组读到被测载体本身
construct validity 失守
strict-baseline 隔离 内建
封闭技能自发现、Skill 工具、cwd 旁路三条通道。
04
评委对长答案存在系统性偏好
长度去偏评委 内建
评分剔除长度协变量,篇幅不再换分。
05
评委评分自身的信度无从度量
Krippendorff α 配 gold 即开
以人工标注为锚,量化评委↔人工一致性。

同类工具普遍只覆盖其中一两项。omk 的取舍:把可信度做进底层,而非留作选项。

选型对比

同一套标准下的横向对比

维度取自通用 LLMOps 评测选型轴(指标库 / judge / CI / 可观测 / 协作)+ 测量学的效度与信度 —— 不是为 omk 量身定的规则。omk 在好几条轴上并不占优,如实标出。

能力维度omkpromptfooDeepEvalLangSmith
测量可信度 · 测量学效度 / 信度
统计显著性(置信区间 / 检验)Bootstrap
评委 ↔ 人工 信度(一致性度量)Krippendorff α
评估偏差控制(长度去偏)默认
评估能力
断言 / 指标库广度30+
RAG 专项 metric3 项丰富
LLM-as-judge
工程 & 协作
CI/CD 集成(退出码路由)
上手速度 / 配置简洁极快
实验追踪 / Tracing强项
托管 SaaS 看板 / 团队协作
生态 & 集成
社区规模(GitHub stars, 2026-04)新生9k+12k+商业
原生 Claude Code skill
原生支持 部分 / 需配置 不支持

完整对比(8 工具 × 30+ 维,含 RAGAS / OpenAI Evals / lm-eval-harness / inspect-ai)见 对比文档,数据截至 2026-04,发现过时请提 PR 修正。结论:没有银弹 —— omk 的取舍是「把统计可信度做到默认」,要 SaaS 看板选 LangSmith、要学术基准选 lm-eval-harness。

$ omk install omk-agent-skill # 一次性安装
✓ 已写入本机检测到的 Claude Code / Codex
/omk eval # 评测当前项目的知识载体
/omk evolve # 一键:体检→生成用例→自迭代
/omk sample # 生成或补齐评测用例
> 帮我比较 v1 和 v2 的差异
↳ 推断意图 → omk eval --control v1 --treatment v2 …
Agent 集成

在你的 Coding Agent 里直接用

一行 omk install omk-agent-skill 把官方 Agent Skill 装进本机已检测到的 Claude Code / Codex(--to all 装到全部)。之后 Claude Code 里 /omk 开箱即用,Codex 等直接跑 omk CLI。

不用记命令 —— 用大白话说目标,agent 会从上下文定位 skill、选对命令。

把这个 skill 改得更稳,再和上一版比一比

下一次发布前,先让数据说话

5 分钟跑通第一个评测

从一个裸数字,到一个经得起追问的结论

不用改任何文件 —— omk init 脚手架两版 skill 和三条用例,omk eval 5 分钟内出 HTML 报告 + 一行 verdict。

$ omk init demo && cd demo && omk eval复制 ⧉
Skip to content