返回目录

caliper

维护状态: 活跃

edonadei/caliper

轻量评估工具,追踪 Claude Code、Codex、Pi 等智能体上技能的成功率,验证技能是否真正有效。

前往 GitHub项目主页
$ npx skills@latest add edonadei/caliper

195

星标

19

Fork

Python

语言

MIT

许可证

2026-05-13

创建于

2026-09-28

最近推送

采用 MIT 许可的 Python 智能体技能评测框架,以 dsh 插件形式通过技能市场分发。用你真实的智能体(Claude Code、Codex、Pi、Hermes)跑评测规格,追踪成功率,做消融与对比,并查看每次尝试的 token / 时间成本。

DSH 适配

生态相关

作者声明

安全审计

未审计

最后核验

2026-09-01

许可证

MIT

01它能帮你完成什么?

  • 在发布前衡量一个智能体技能是否真的有效

    一个可长期追踪的 **成功率**,以及每次运行保存的 transcript 供检查

    为 Claude Code、Codex、Pi 或 Hermes 维护技能的开发者与团队,他们需要证据证明技能有用——以及它消耗了多少 token

  • 证明是技能(而非裸智能体)在起作用,并捕捉激活漂移

    通过 `caliper compare` 得到消融版与完整版的差异,外加一个按技能统计的激活计分板,显示技能何时在邻居的提示上被触发

    技能作者,他们需要在模型更新或一行提示改动后,确认技能仍正确触发并守在自己的职责范围内

02如何接入 DeepSeek Harness?

前置条件

  • Python 3.10+——CLI 安装步骤注明 `pipx install caliper-eval # requires Python 3.10+`
  • 安装并认证一个目标智能体 CLI——claude-code、codex、pi 或 hermes(Caliper 只通过 CLI 智能体运行技能;没有直连 API 的后端)

安装步骤

  1. 01

    安装技能(智能体路径):`npx skills@latest add edonadei/caliper`

    $ npx skills@latest add edonadei/caliper

  2. 02

    或直接安装 CLI(Python 路径):`pipx install caliper-eval # requires Python 3.10+`

  3. 03

    编写规格后运行:`caliper run my-skill.eval.yaml --k 3 # --ablate <skill> for a run to diff against`

  4. 04

    对比两次运行:`caliper compare .caliper/results/commit-commands/<evaluation-run>.json .caliper/results/commit-commands/<ablated-run>.json`

验证接入成功

作者未说明

03DSH 适配与能力边界

DSH 适配生态相关

通过技能市场(npx skills add)以 dsh 插件形式分发;为 Claude Code、Codex、Pi 和 Hermes 这些 DeepSeek Harness 运行的智能体后端评测技能

  • 基于规格的评测框架

    一份描述技能、判定方式与任务的 `.eval.yaml` 规格→一个可追踪的成功率,以及每次运行保存的 transcript

  • 消融与运行对比

    一份规格,加上一次 `--ablate <skill>` 运行和一次完整运行→`caliper compare` 逐任务对比两次运行

  • 内置智能体技能:evaluate-skill 与 grill-skill

    技能的 `SKILL.md`(grill-skill)或 `.eval.yaml`(evaluate-skill)→在智能体内部创建、运行、校验并管理评测;grill-skill 会生成一份 3 任务的规格

  • token 与耗时报告

    任意一次运行→每次尝试的 token 消耗与耗时,并按运行汇总

04适合谁?何时不该用?

适合

  • 为 Claude Code、Codex、Pi 或 Hermes 维护技能的开发者与团队,他们需要证据证明技能有用——以及它消耗了多少 token
  • 技能作者,他们需要在模型更新或一行提示改动后,确认技能仍正确触发并守在自己的职责范围内

不适合

  • Caliper 只通过 CLI 智能体运行技能,因此每个后端都能真正加载并运行技能。没有直连 API 的后端:要做按量计费的运行,需要为其中一个 CLI 配置 API key,而不是另选一个后端。
  • 在不支持的智能体上声明 `mcp:` 会直接报错而非静默跳过。 `pi` 原生不支持 `mcp:`;应把能力作为技能驱动的 CLI 工具来暴露,或者改用 claude-code / hermes / codex 运行评测。

05兼容性、维护与安全提示

  • Caliper 只通过 CLI 智能体运行技能,因此每个后端都能真正加载并运行技能。没有直连 API 的后端:要做按量计费的运行,需要为其中一个 CLI 配置 API key,而不是另选一个后端。
  • 在不支持的智能体上声明 `mcp:` 会直接报错而非静默跳过。 `pi` 原生不支持 `mcp:`;应把能力作为技能驱动的 CLI 工具来暴露,或者改用 claude-code / hermes / codex 运行评测。
  • Caliper 从不会把你的技能直接粘贴进提示词。它会把技能安装到智能体查找技能的位置,让智能体自己决定,因此一次运行同时衡量描述(会不会触发?)与正文(有没有用?)。
2026-05-132026-08-30v0.11.0

MIT · 最新发布 v0.11.0(2026-08-29);仓库最后推送于 2026-08-30

06常见问题

如何在 DeepSeek Harness 中安装 Caliper?

通过技能市场以技能形式添加:`npx skills@latest add edonadei/caliper`;或直接用 `pipx install caliper-eval` 安装 CLI(需要 Python 3.10+)。如果缺失,`evaluate-skill` 技能会自动安装 Caliper。

Caliper 能为哪些智能体评测技能?

Claude Code、Codex、Pi 和 Hermes。Caliper 只通过 CLI 智能体运行技能——没有直连 API 的后端——因此你需要为其中一个 CLI 配置 API key(如 `ANTHROPIC_API_KEY` / `OPENAI_API_KEY`)来做按量计费的运行。

怎么证明是技能在起作用,而不是裸智能体?

先用 `--ablate <skill>`(移除该技能)跑一次规格并保留这次运行,再用 `caliper compare` 与完整运行对比。差异会按任务展示通过率与 token 变化,从而隔离出技能的真实贡献。

Caliper 只统计通过率,还是也统计成本?

两者都统计。它会记录每次尝试的 token 消耗与耗时,并按运行汇总,因此同样得分的两次运行也能比较花费。美元成本刻意不统计——token 才是用量信号。

评测规格能用 MCP 服务器吗?

可以,用可选的 `mcp:` 块——但 `pi` 原生不支持 `mcp:`,在不支持的智能体上声明 `mcp:` 会直接报错而非静默跳过。对 pi,应把能力作为技能驱动的 CLI 工具来暴露。

08数据与来源

  • 作者声明github.com91590cd87976…

    npx skills@latest add edonadei/caliper

页面基于项目公开文档、仓库元数据和 DSH Plugins 的结构化解析生成;最后核验于 2026-09-01。发现错误?提交更正。

🏆

最佳 DeepSeek Harness 插件

从全目录挑出的 12 个值得优先安装的插件,覆盖各个分类。

DSH Plugins 是独立的 DeepSeek Harness 插件市场,与 DeepSeek 官方无关,也不代表官方背书。第三方插件未经安全审计,安装前请审查源码。

每周获取最新的 DeepSeek Harness 插件,绝不滥发。