Skip to content

CLI 评测输入编译规范

状态:本规范已成为 Evaluation Core vNext RFC 下的正式输入边界。Parse、Resolve、Compile、Runtime 装配、宿主 workflow、Core 执行与产物持久化共同组成权威 omk eval 路径。

一、目的与边界

CLI 宿主必须把 flag、eval.yaml、文件和本机资源翻译成同一份宿主无关的测量契约,不能在 Core sealed RunPlan 旁再建一套 plan。因此,输入处理固定为五种互不重叠的职责:

text
CLI flags/eval.yaml
        │ parse precedence and syntax

CliEvaluationRequest
        │ resolve files, artifacts, samples and host resources

ResolvedCliEvaluationInput + ResolvedHostResources
        │ pure deterministic compilation

EvaluationDefinition + MeasurementPolicy
RuntimeBindingRequest + EvaluationOrchestrationOptions
EvaluationPresentationOptions + static RunOptions metadata

        ├── Core prepare:schema/reference/capability/runtime identity/seal
        └── adapter preflight:doctor/credential/connectivity/physical environment
阶段负责禁止
ParseparseCliEvaluationRequest() 执行 CLI > eval.yaml > explicit host default、校验语法并记录来源归因读取文件系统/环境/网络/时钟,把 parser 注入的默认值当成显式 flag,创建 Runtime,计算测量 digest
Resolvematerialization、git pin、内容/目录树 digest、mock/workspace descriptor、locator 绑定调用 Core prepare、相信自报能力、产出 sealed plan
Compile纯映射到 canonical、schema-valid、静态语义完整的 Core contract 和宿主请求读取文件系统/环境/网络/时钟,创建 AbortSignal、writer、store 或 run ID
Core prepare重新校验契约,确认已验证的 Runtime capability/identity,封存唯一 RunPlan做 connectivity 或 doctor 检查
Adapter preflightcredential、connectivity、路径权限、doctor、物理环境健康度替代 Core capability 校验或改写 sealed measurement design

二、输出归属

  • EvaluationDefinition 负责数据投影、Target 行为、evaluator instrument、metric、实验设计、分析、比较和决策策略;
  • MeasurementPolicy 负责 execution/evaluation concurrency、timeout、retry、cache、evidence、failure、event delivery 和共享 Run 预算账本;
  • RuntimeBindingRequest v4 只保存从 Definition/已解析宿主资源派生的 implementation 和 resource lease requirement。Executor qualification 直接复用 canonical TargetDefinition.executionRequirements,不维护第二份近似语义。宿主 registry 可以解析 binding,但不能覆盖 execution requirement、model、effort、prompt variant、protocol、evaluator identity 或行为配置。完整装配契约见 Evaluation Runtime Adapter 规范
  • ResolvedHostResources 用稳定 resource ID 和 digest 绑定 effect locator。它不是 Core schema,也不进入 canonical measurement JSON;
  • EvaluationOrchestrationOptions 负责 dry-run、resume locator、batch、独立 Series repeat、preflight 开关、diagnostic 后处理、gold post-hoc workflow 和受管证据追加;
  • Sample bundle 的 requires 会连同 baseDirectoryLocator 规范化成宿主侧 dependencyRequirements,供后续 doctor/preflight workflow 消费;相对文件与 preflight 命令因此继续锚定 sample bundle 根目录。该宿主上下文不进入 Core 测量 digest,也不能被静默丢弃;
  • EvaluationPresentationOptions 负责输出 locator、索引范围、语言、server、verbose、layered view 和 CLI exit 展示。这些字段都不能改变 DecisionResult
  • 静态 RunOptions metadata 可以保存可序列化的 annotation 和 summary。只有真正启动 Run 时,orchestrator 才创建 run ID、取消信号、EventWriter 和 buffer。

架构中刻意不存在 HostExecutionPlan。唯一名为 Plan 的对象由 Core prepare 生成并封存。

三、身份、lineage 与资源安全

行为身份和来源 lineage 是两条不同轴:

  • Target config 保存 artifact、mock、sandbox、model 与 effort 等 Target-wide behavior fact。canonical executionControls 单独保存 workspace 与工具授权的 Target 默认值和 Sample override;其中的 workspace descriptor 不包含 locator;
  • Target executionRequirements 是从 resolved behavior 与全部 effective sample control 派生的聚合 capability 请求:显式 system instruction 使用、copy-on-write workspace、native MCP config、pre-tool-call mock interception、tool allow-list、skill discovery policy 和 sandbox ID。它进入 Definition 与 ExecutionPlan identity,只有 Core prepare 可以把它与 Runtime feature 做匹配;它绝不把聚合 workspace 或工具权限授予某个 Trial;
  • Host resources 保存 locator、resolved commit、仓库来源和 materialization 证据。同一内容在绝对/相对路径或不同机器间移动,不会让 execution identity 失效;
  • 行为变化会改变 Definition digest。只有 lineage 变化时,后续由显式 comparability/provenance policy 判断,不能偷偷塞进 Target config。

Mock rule 和 payload 是相互独立的 secret、digest-bound descriptor。原始 toolmatch 不进入 Core 或静态 Target JSON;Runtime adapter 只能在业务进程启动前,通过 run-scoped verified lease 读取它们。sampleIds、strict mode、rule descriptor 和有序 payload descriptor 仍是 canonical Target 行为,因此修改规则字节或返回顺序都会改变测量身份。sampleId 由 Core 交给 adapter,绝不拼入模型 prompt。Compile 还要求每个引用角色匹配对应的宿主资源类型:artifact、workspace、MCP config、mock rule、mock payload、evaluator content 和 gold dataset 即使 descriptor 恰好相同,也不能相互替代。Runtime adapter 在使用前必须重新校验 digest。缺少 interception、allowed-tool、skill-discovery、MCP、cancellation、seed 或 sandbox capability 时,Core prepare 必须 fail closed;adapter 不能删除 mock,也不能降级成真实外部调用。不同 Sample 的 cwdallowedTools 会编译成 canonical sample override,永远不做 union;adapter 只能收到准确的 effective Trial control。

ResolvedHostResources v3 要求 descriptor.size 必填,并把 pinned Git verification 表达为 {verificationKind, verifiedDigest, commitId}commitId 必须是规范化的 40–64 位小写十六进制对象身份,branch 或 tag 名不是 pin。仅文件的 MCP config、mock rule、mock payload 和 evaluator content 资源必须使用 content-digest;mock rule 还必须使用 application/json。MCP config 与两类 mock control 资源都必须标记为 secret。workspace 必须使用 tree-digestpinned-git;pinned Git 仅适用于 artifact 和 workspace。gold classification 与 gold-dataset kind 必须同时成立。旧结构会被直接拒绝,不提供 compatibility reader。

Dataset 投影保护 Gold 边界:Executor 只看到 input + executionContext;evaluator 可以读取 expected + evaluationContext;analysis 只读取显式 membership 和 analysis context。Gold locator 只留在宿主资源中。Post-hoc gold compare 标记为 exploratory,不能冒充 preregistered decision。

四、测量映射

  • control/treatment 角色只进入 Comparison,artifact 内容属于 Target 行为;
  • assertion、rubric 评委、dimension、composite 和 RAG metric 仍是不同的 Evaluator/Metric/AnalysisGraph 概念。Evaluator template 持有算法 implementationId、instrument 与 runtime prompt variant;judge member 只持有 provider executor、model、effort 与 ensemble identity;
  • 评委成员显式携带 instrument、ensemble member、replicate group 和 replicate index。分析代码不得解析 evaluator ID 推断层级;
  • holdout/cohort membership 只进入 analysis,并在执行前固定;
  • bootstrap、correction、threshold 和 trivial-difference gate 是 AnalysisGraph 或 DecisionPolicy 中的 Definition 事实;
  • 每个 treatment 都有独立、显式的 paired control comparison,多 treatment 请求不能压成一个含混的 treatment identity;
  • 确定性 assertion evaluator 在 criterion 不适用时产出显式 structural-missing observation。LLM assertion 与 rubric dimension 则封存 canonical applicableSampleIds;Core 会从 plan identity、coverage、execution 与 analysis 中排除不适用的 Evaluator coordinate,不能误评到其它 sample;
  • 生产设计使用 paired block 与 seedCoupling: uncontrolled:当前 provider adapter 都不具备精确 sampling seed control。宿主可以确定性随机化 coordinate 顺序,但不能声称模型随机性已经耦合;
  • length debias 改变 rubric evaluator config;排版/语气中性化恒开;
  • 旧 total USD 映射为共享 Run provider-cost limit;per-sample USD 和毫秒映射为 per-coordinate provider-cost/active-duration limit。不得用宿主 AbortController 或事后改写 report 实现。

重复层级必须显式:

概念契约
Trial同一 sealed Run 内重复 Target measurement
Retry attempt同一 coordinate 的基础设施恢复
Judge replicate同一 instrument 的重复观测
Ensemble member不同的评委 instrument/Runtime
--repeatEvaluation Series 中的独立 Run
Batch child不同 artifact workflow,不是 Series replicate

--repeat > 1 时,orchestrator 在 Resolve 前分配唯一的 seriesInstanceId。Compile 把这份宿主持有的实例身份与完整 Series 设计绑定,包括 measurement design、repeat count、comparison scope 和 minimum status,并由此派生 Core 最终使用的 seriesId。编译器不会从时钟或随机源创造身份;同一实例 ID 被错误复用于不同设计时,也不会映射成同一个 Series。

4.1 Cache 与 replay

Fresh measurement 是默认语义。规范 policy 始终分别携带两个字段:

yaml
cache:
  executionMode: disabled # disabled | replay-only | transparent-deterministic
  evaluationMode: disabled # disabled | reuse

executionModeevaluationMode 分别进入对应的 Core contract digest。任何非 disabled 模式还必须在宿主持有的 orchestration.cacheSources 中声明对应阶段的 source locator;locator 不进入 Core canonical JSON。Runtime adapter 必须把这份指定 source 装配为对应 cache port,不得换成环境选择或全局默认 source。

replay-only 是 fail-closed 只读路径。coordinate 缺失、source 不可用、entry 损坏或 identity 不匹配都会终止运行,绝不回退为实时 Target 调用。Replay record 沿用原 trial identity、Runtime identity、usage、cost 和 provenance;既不新增 native invocation,也不增加独立 replicate。在 Series 具备显式 effective-independent-sample 模型前,Compile 会拒绝任何非 disabled cache mode 与独立 Series repeat 组合,也会拒绝在同一请求中混用 cache reuse 与 resume。只有 Core prepare 验证 execution 为 deterministic 且 Runtime identity 为 verified 时,才能使用 transparent-deterministic。Evaluation reuse 与 Execution 独立,并继续绑定完整 evaluation contract,包括 evaluator/model/prompt variant、replicate identity、Gold-facing input、metric 和 evidence policy。

当前产品 CLI 的 Execution 与 Evaluation cache 均固定为 disabled,既有续跑契约不变。Core 与 Runtime 保留各自独立的缓存契约;产品入口尚未通过 CLI 参数或 eval 配置开放缓存复用。

五、确定性与校验

parseCliEvaluationRequest() 是 raw CLI/config 输入的纯规范化边界。宿主只传入用户显式提供的 flag、已完成语法校验的 EvalConfig,以及带来源信息的环境选择默认值。CLI 和 config 候选值必须先经过同一组规范字段校验,再应用优先级。只有本阶段真实存在的值才能产生 provenance;后续派生值只在实际派生时记录来源。不得把 Oclif 自动注入的默认值冒充用户显式 CLI 输入。Judge 开关必须先于 judge-model 解析确定,因此 no-judge 请求不会因一份不再使用的错误评委来源而失败。

compileCliEvaluationInput() 只接收已解析、可序列化的 IR,不执行任何 I/O,并返回 deep-frozen 输出。它在产出前调用 Core 公开的 normalizeEvaluationDefinition()validateDefinitionSemantics():schema 校验、类集合字段的 canonical 排序、引用完整性和静态语义校验由同一个 owner 定义。Core 边界会在 Runtime qualification 前再次校验这些契约。对象属性顺序、嵌套 membership/cohort filter 顺序、宿主 locator 写法、CLI/YAML 来源和 lineage 不影响 Definition/Policy digest;实际行为字节变化则必须影响 digest。

Parse 和 Compile 错误使用宿主 CliEvaluationInputError,包含稳定 code,以及可选的 source/field path。Core 静态校验失败会把原始 Core code/details 保留在宿主错误中,但不会让 Core Run 错误越过尚未开始 Run 的边界。它们不是 Core EvaluationError。Compile 不接受 Runtime 自报能力;只有 Core prepare 有权做 capability qualification。

六、迁移边界

本层已经是正式生产边界。omk eval 把这里产出的 contract 交给 Runtime 装配与 Core 宿主 workflow,并持久化 Core Plan、Bundle 和 Report。已删除的旧 pipeline 不会双跑或 shadow run,后续层也不会重新解析 CLI 输入。

当前边界输出 omk.cli-evaluation-request/v3omk.resolved-cli-evaluation-input/v6omk.resolved-host-resources/v3omk.runtime-binding-request/v5。Request v3、resolved input v6 和 binding request v5 会把 eval.yaml 中可选的宿主声明 judge deployment revision 传入 evaluator Runtime qualification。更早的 request 结构不会被接受。

--no-cache 与配置字段 noCache 已移除,因为它们已不改变产品行为。请从命令和 eval.yaml 中删除,无需替代选项。Core 缓存契约和当前测量 policy digest 保持不变,旧 cache 文件不会被读取。

七、完整输入 registry

Declarative registry 对每个正式 omk eval flag 和每个机器可枚举的 EvalConfig path 进行分类。CI 对两组 source key 做严格集合比较,任何未分类新字段都会失败。下表由 yarn build:docs 从 registry 生成。

来源字段规范字段优先级规范默认值(来源)OwnerDigest 阶段Runtime qualification错误/迁移
CLI--batchorchestration.batch300false (documented)OrchestrationnoneCLI_INPUT_INVALID
retain
CLI--bootstrapdefinition.analysisGraph.bootstrap300true (documented)DefinitionanalysisCLI_INPUT_INVALID
retain
CLI--bootstrap-samplesdefinition.analysisGraph.bootstrap.resamples3001000 (documented)DefinitionanalysisCLI_INPUT_INVALID
retain
CLI--budget-per-sample-mspolicy.budget.perCoordinateActiveDurationMs300MeasurementPolicyrunCLI_INPUT_INVALID
retain
CLI--budget-per-sample-usdpolicy.budget.perCoordinateProviderCostUSD300MeasurementPolicyrunCLI_INPUT_INVALID
retain
CLI--budget-usdpolicy.budget.totalProviderCostUSD300MeasurementPolicyrunCLI_INPUT_INVALID
retain
CLI--concurrencypolicy.executionConcurrency3001 (documented)MeasurementPolicyexecutionCLI_INPUT_INVALID
retain
CLI--configorchestration.configLocator300OrchestrationnoneCLI_INPUT_INVALID
retain
CLI--controldefinition.targets.control300DefinitionexecutionCLI_INPUT_INVALID
retain
CLI--control-cwdresources.controlWorkspaceLocator300OrchestrationnoneCLI_INPUT_INVALID
retain
CLI--dry-runorchestration.dryRun300false (documented)OrchestrationnoneCLI_INPUT_INVALID
retain
CLI--effortdefinition.targetRuntime.effort300"low" (documented)Definitionexecutionmodel-effortCLI_INPUT_INVALID
retain
CLI--executordefinition.targetRuntime.implementationId300— (environment-selection)Definitionexecutionexecutor-protocol
model-effort
CLI_INPUT_INVALID
retain
CLI--globalpresentation.indexScope300"project" (documented)PresentationnoneCLI_INPUT_INVALID
retain
CLI--gold-dirorchestration.gold.resourceLocator300OrchestrationnoneCLI_INPUT_INVALID
retain
CLI--holdout-ratiodefinition.dataset.analysisCohorts300DefinitionanalysisCLI_INPUT_INVALID
retain
CLI--judge-modelsdefinition.judges.members300— (environment-selection)Definitionevaluationevaluator-instrument
model-effort
CLI_INPUT_INVALID
retain
CLI--judge-repeatdefinition.judges.replicateCount3001 (documented)DefinitionevaluationCLI_INPUT_INVALID
retain
CLI--langpresentation.language300"zh" (environment-selection)PresentationnoneCLI_INPUT_INVALID
retain
CLI--layered-statspresentation.layeredView300false (documented)PresentationnoneCLI_INPUT_INVALID
retain
CLI--mcp-configresources.mcpConfigLocator300Orchestrationnonetool-mock-sandboxCLI_INPUT_INVALID
retain
CLI--modeldefinition.targetRuntime.model300— (environment-selection)Definitionexecutionmodel-effortCLI_INPUT_INVALID
retain
CLI--no-debias-lengthdefinition.judges.lengthDebias300true (documented)DefinitionevaluationCLI_INPUT_INVALID
retain
CLI--no-diagnosticorchestration.diagnostic300"enabled-outside-core" (documented)OrchestrationnoneCLI_INPUT_INVALID
retain
CLI--no-evidenceorchestration.managedEvidence300"append" (documented)OrchestrationnoneCLI_INPUT_INVALID
retain
CLI--no-gatepresentation.exitMode300"gate" (documented)PresentationnoneCLI_INPUT_INVALID
rename → --report-only
CLI--no-judgedefinition.judges.enabled300true (documented)DefinitionevaluationCLI_INPUT_INVALID
retain
CLI--no-servepresentation.serve300true (documented)PresentationnoneCLI_INPUT_INVALID
retain
CLI--no-strict-baselinedefinition.baselineIsolation300true (documented)DefinitionexecutionCLI_INPUT_INVALID
CLI_INPUT_BASELINE_ISOLATION_CONFLICT
retain
CLI--output-dirpresentation.outputDirectoryLocator300PresentationnoneCLI_INPUT_INVALID
retain
CLI--repeatorchestration.independentSeries.repeatCount3001 (documented)OrchestrationrunCLI_INPUT_INVALID
retain
CLI--report-onlypresentation.exitMode300"gate" (documented)PresentationnoneCLI_INPUT_INVALID
retain
CLI--resumeorchestration.resumeSourceLocator300OrchestrationnoneCLI_INPUT_INVALID
retain
CLI--retrypolicy.retryCount3000 (documented)MeasurementPolicyexecutionCLI_INPUT_INVALID
retain
CLI--samplesorchestration.samplesLocator300OrchestrationnoneCLI_INPUT_INVALID
retain
CLI--skill-dirorchestration.skillDirectoryLocator300"skills" (documented)OrchestrationnoneCLI_INPUT_INVALID
retain
CLI--skip-connectivityorchestration.preflight.connectivity300"required" (documented)OrchestrationnoneCLI_INPUT_INVALID
retain
CLI--skip-doctororchestration.preflight.doctor300"required" (documented)OrchestrationnoneCLI_INPUT_INVALID
retain
CLI--strict-baselinedefinition.baselineIsolation300true (documented)DefinitionexecutionCLI_INPUT_INVALID
CLI_INPUT_BASELINE_ISOLATION_CONFLICT
retain
CLI--thresholddefinition.decisionPolicy.threshold300— (derived)DefinitiondecisionCLI_INPUT_INVALID
retain
CLI--timeoutpolicy.executionTimeoutMs300120000 (documented)MeasurementPolicyexecutionCLI_INPUT_INVALID
retain
CLI--treatmentdefinition.targets.treatments300DefinitionexecutionCLI_INPUT_INVALID
retain
CLI--treatment-cwdresources.treatmentWorkspaceLocators300OrchestrationnoneCLI_INPUT_INVALID
retain
CLI--trivial-diffdefinition.decisionPolicy.trivialDifference300— (derived)DefinitiondecisionCLI_INPUT_INVALID
retain
CLI--verbosepresentation.verbose300false (documented)PresentationnoneCLI_INPUT_INVALID
retain
eval.yamlbootstrapdefinition.analysisGraph.bootstrap200true (documented)DefinitionanalysisCLI_INPUT_INVALID
retain
eval.yamlbootstrapSamplesdefinition.analysisGraph.bootstrap.resamples2001000 (documented)DefinitionanalysisCLI_INPUT_INVALID
retain
eval.yamlbudgetpolicy.budget200MeasurementPolicyrunCLI_INPUT_INVALID
retain
eval.yamlbudget.perSampleMspolicy.budget.perCoordinateActiveDurationMs200MeasurementPolicyrunCLI_INPUT_INVALID
retain
eval.yamlbudget.perSampleUSDpolicy.budget.perCoordinateProviderCostUSD200MeasurementPolicyrunCLI_INPUT_INVALID
retain
eval.yamlbudget.totalUSDpolicy.budget.totalProviderCostUSD200MeasurementPolicyrunCLI_INPUT_INVALID
retain
eval.yamlconcurrencypolicy.executionConcurrency2001 (documented)MeasurementPolicyexecutionCLI_INPUT_INVALID
retain
eval.yamldecisiondefinition.decisionPolicy200DefinitiondecisionCLI_INPUT_INVALID
retain
eval.yamldecision.minimumComparisonUnitsdefinition.decisionPolicy.sampleSize.minimumComparisonUnits20020 (documented)DefinitiondecisionCLI_INPUT_INVALID
retain
eval.yamldecision.powerdefinition.decisionPolicy.sampleSize200DefinitiondecisionCLI_INPUT_INVALID
retain
eval.yamldecision.power.assumptionSourcedefinition.decisionPolicy.sampleSize.assumptionSource200DefinitiondecisionCLI_INPUT_INVALID
retain
eval.yamldecision.power.expectedDifferenceStandardDeviationdefinition.decisionPolicy.sampleSize.expectedDifferenceStandardDeviation200DefinitiondecisionCLI_INPUT_INVALID
retain
eval.yamldecision.power.minimumDetectableDifferencedefinition.decisionPolicy.sampleSize.minimumDetectableDifference200DefinitiondecisionCLI_INPUT_INVALID
retain
eval.yamldecision.power.targetPowerdefinition.decisionPolicy.sampleSize.targetPower2000.8 (documented)DefinitiondecisionCLI_INPUT_INVALID
retain
eval.yamldecision.thresholddefinition.decisionPolicy.threshold200— (derived)DefinitiondecisionCLI_INPUT_INVALID
retain
eval.yamldecision.trivialDifferencedefinition.decisionPolicy.trivialDifference200— (derived)DefinitiondecisionCLI_INPUT_INVALID
retain
eval.yamleffortdefinition.targetRuntime.effort200"low" (documented)Definitionexecutionmodel-effortCLI_INPUT_INVALID
retain
eval.yamlexecutordefinition.targetRuntime.implementationId200— (environment-selection)Definitionexecutionexecutor-protocol
model-effort
CLI_INPUT_INVALID
retain
eval.yamlgoldDirorchestration.gold.resourceLocator200OrchestrationnoneCLI_INPUT_INVALID
retain
eval.yamlholdoutRatiodefinition.dataset.analysisCohorts200DefinitionanalysisCLI_INPUT_INVALID
retain
eval.yamljudgeModelsdefinition.judges.members200— (environment-selection)Definitionevaluationevaluator-instrumentCLI_INPUT_INVALID
retain
eval.yamljudgeModels[].deploymentRevisiondefinition.judges.members[].deploymentRevision200Definitionevaluationmodel-effortCLI_INPUT_INVALID
retain
eval.yamljudgeModels[].executordefinition.judges.members[].executorId200Definitionevaluationevaluator-instrumentCLI_INPUT_INVALID
retain
eval.yamljudgeModels[].modeldefinition.judges.members[].model200Definitionevaluationmodel-effortCLI_INPUT_INVALID
retain
eval.yamljudgeRepeatdefinition.judges.replicateCount2001 (documented)DefinitionevaluationCLI_INPUT_INVALID
retain
eval.yamllengthDebiasdefinition.judges.lengthDebias200true (documented)DefinitionevaluationCLI_INPUT_INVALID
retain
eval.yamlmcpConfigresources.mcpConfigLocator200Orchestrationnonetool-mock-sandboxCLI_INPUT_INVALID
retain
eval.yamlmodeldefinition.targetRuntime.model200— (environment-selection)Definitionexecutionmodel-effortCLI_INPUT_INVALID
retain
eval.yamlnoDiagnosticorchestration.diagnostic200"enabled-outside-core" (documented)OrchestrationnoneCLI_INPUT_INVALID
retain
eval.yamlnoJudgedefinition.judges.enabled200true (documented)DefinitionevaluationCLI_INPUT_INVALID
retain
eval.yamlrepeatorchestration.independentSeries.repeatCount2001 (documented)OrchestrationrunCLI_INPUT_INVALID
retain
eval.yamlsamplesorchestration.samplesLocator200OrchestrationnoneCLI_INPUT_INVALID
retain
eval.yamlskipDoctororchestration.preflight.doctor200"required" (documented)OrchestrationnoneCLI_INPUT_INVALID
retain
eval.yamlstrictBaselinedefinition.baselineIsolation200true (documented)DefinitionexecutionCLI_INPUT_INVALID
retain
eval.yamltimeoutMspolicy.executionTimeoutMs200120000 (documented)MeasurementPolicyexecutionCLI_INPUT_INVALID
retain
eval.yamlvariantsdefinition.targets200DefinitionexecutionCLI_INPUT_INVALID
retain
eval.yamlvariants[].allowedSkillsdefinition.targets[].behavior.allowedSkills200DefinitionexecutionCLI_INPUT_INVALID
retain
eval.yamlvariants[].artifactresources.targets[].artifactLocator200OrchestrationnoneCLI_INPUT_INVALID
retain
eval.yamlvariants[].cwdresources.targets[].workspaceLocator200OrchestrationnoneCLI_INPUT_INVALID
retain
eval.yamlvariants[].gitresources.targets[].gitSource200OrchestrationnoneCLI_INPUT_INVALID
retain
eval.yamlvariants[].git.refresources.targets[].gitSource.ref200OrchestrationnoneCLI_INPUT_INVALID
retain
eval.yamlvariants[].git.specresources.targets[].gitSource.spec200OrchestrationnoneCLI_INPUT_INVALID
retain
eval.yamlvariants[].git.urlresources.targets[].gitSource.url200OrchestrationnoneCLI_INPUT_INVALID
retain
eval.yamlvariants[].namedefinition.targets[].targetId200DefinitionexecutionCLI_INPUT_INVALID
retain
eval.yamlvariants[].roledefinition.targets[].experimentRole200DefinitionexecutionCLI_INPUT_INVALID
retain