OMK,让 AI 应用的知识改动有据可依。
观测真实表现,量出版本差异,判断改动是否有效、版本能否发布。发布前用 doctor → eval → studio 做判断,发布后用 observe → sample → evolve 闭环。
doctor、eval、studio、promote、observe、sample、evolve 不是孤立命令。它们把知识改动转成证据,也把线上缺口转成待复核草稿,复核后再进入下一轮固定评测集。
这份知识载体是否清楚到值得评测?doctor 先拦住结构、依赖、安全性和可测性问题,避免 A/B 评测浪费 token。
$ omk doctor my-skill --dimensions audit.yaml
v2 是否真的优于 v1?eval 固定模型和评测用例,只改变知识载体,再输出带置信区间和失败样本的一行 verdict。
$ omk eval --control v1 --treatment v2
真实使用暴露了什么?observe 把 session 日志转成知识缺口信号;from-traces 先生成草稿,人工复核后再沉淀为固定评测样本。
$ omk observe ~/.claude/sessions
omk sample --from-traces 生成待复核用例草稿决定一个对比可信与否的,是这五处常被忽略的失真。omk 将每一道防线内建于底层,无需你逐个开启。
同类工具普遍只覆盖其中一两项。omk 的取舍:把可信度做进底层,而非留作选项。
维度取自通用 LLMOps 评测选型轴(指标库 / judge / CI / 可观测 / 协作)+ 测量学的效度与信度 —— 不是为 omk 量身定的规则。omk 在好几条轴上并不占优,如实标出。
| 能力维度 | omk | promptfoo | DeepEval | LangSmith |
|---|---|---|---|---|
| 测量可信度 · 测量学效度 / 信度 | ||||
| 统计显著性(置信区间 / 检验) | ✓ Bootstrap | — | — | — |
| 评委 ↔ 人工 信度(一致性度量) | ✓ Krippendorff α | — | — | — |
| 评估偏差控制(长度去偏) | ✓ 默认 | — | — | — |
| 评估能力 | ||||
| 断言 / 指标库广度 | ✓ 30+ | ✓ | ✓ | ◑ |
| RAG 专项 metric | ◑ 3 项 | ◑ | ✓ 丰富 | ◑ |
| LLM-as-judge | ✓ | ✓ | ✓ | ✓ |
| 工程 & 协作 | ||||
| CI/CD 集成(退出码路由) | ✓ | ✓ | ✓ | ◑ |
| 上手速度 / 配置简洁 | ◑ | ✓ 极快 | ◑ | ◑ |
| 实验追踪 / Tracing | — | — | ◑ | ✓ 强项 |
| 托管 SaaS 看板 / 团队协作 | — | — | ✓ | ✓ |
| 生态 & 集成 | ||||
| 社区规模(GitHub stars, 2026-04) | 新生 | 9k+ | 12k+ | 商业 |
| 原生 Claude Code skill | ✓ | — | — | — |
完整对比(8 工具 × 30+ 维,含 RAGAS / OpenAI Evals / lm-eval-harness / inspect-ai)见 对比文档,数据截至 2026-04,发现过时请提 PR 修正。结论:没有银弹 —— omk 的取舍是「把统计可信度做到默认」,要 SaaS 看板选 LangSmith、要学术基准选 lm-eval-harness。
一行 omk install omk-agent-skill 把官方 Agent Skill 装进本机已检测到的 Claude Code / Codex(--to all 装到全部)。之后 Claude Code 里 /omk 开箱即用,Codex 等直接跑 omk CLI。
不用记命令 —— 用大白话说目标,agent 会从上下文定位 skill、选对命令。
下一次发布前,先让数据说话。
不用改任何文件 —— omk init 脚手架两版 skill 和三条用例,omk eval 5 分钟内出 HTML 报告 + 一行 verdict。