采用 MIT 许可的 Python 智能体技能评测框架,以 dsh 插件形式通过技能市场分发。用你真实的智能体(Claude Code、Codex、Pi、Hermes)跑评测规格,追踪成功率,做消融与对比,并查看每次尝试的 token / 时间成本。
DSH 适配
生态相关
作者声明
安全审计
未审计
最后核验
2026-09-01
许可证
MIT
01它能帮你完成什么?
在发布前衡量一个智能体技能是否真的有效
一个可长期追踪的 **成功率**,以及每次运行保存的 transcript 供检查
为 Claude Code、Codex、Pi 或 Hermes 维护技能的开发者与团队,他们需要证据证明技能有用——以及它消耗了多少 token
证明是技能(而非裸智能体)在起作用,并捕捉激活漂移
通过 `caliper compare` 得到消融版与完整版的差异,外加一个按技能统计的激活计分板,显示技能何时在邻居的提示上被触发
技能作者,他们需要在模型更新或一行提示改动后,确认技能仍正确触发并守在自己的职责范围内
02如何接入 DeepSeek Harness?
前置条件
- Python 3.10+——CLI 安装步骤注明 `pipx install caliper-eval # requires Python 3.10+`
- 安装并认证一个目标智能体 CLI——claude-code、codex、pi 或 hermes(Caliper 只通过 CLI 智能体运行技能;没有直连 API 的后端)
安装步骤
- 01
安装技能(智能体路径):`npx skills@latest add edonadei/caliper`
$ npx skills@latest add edonadei/caliper
- 02
或直接安装 CLI(Python 路径):`pipx install caliper-eval # requires Python 3.10+`
- 03
编写规格后运行:`caliper run my-skill.eval.yaml --k 3 # --ablate <skill> for a run to diff against`
- 04
对比两次运行:`caliper compare .caliper/results/commit-commands/<evaluation-run>.json .caliper/results/commit-commands/<ablated-run>.json`
验证接入成功
作者未说明
03DSH 适配与能力边界
通过技能市场(npx skills add)以 dsh 插件形式分发;为 Claude Code、Codex、Pi 和 Hermes 这些 DeepSeek Harness 运行的智能体后端评测技能
基于规格的评测框架
一份描述技能、判定方式与任务的 `.eval.yaml` 规格→一个可追踪的成功率,以及每次运行保存的 transcript
消融与运行对比
一份规格,加上一次 `--ablate <skill>` 运行和一次完整运行→`caliper compare` 逐任务对比两次运行
内置智能体技能:evaluate-skill 与 grill-skill
技能的 `SKILL.md`(grill-skill)或 `.eval.yaml`(evaluate-skill)→在智能体内部创建、运行、校验并管理评测;grill-skill 会生成一份 3 任务的规格
token 与耗时报告
任意一次运行→每次尝试的 token 消耗与耗时,并按运行汇总
04适合谁?何时不该用?
适合
- 为 Claude Code、Codex、Pi 或 Hermes 维护技能的开发者与团队,他们需要证据证明技能有用——以及它消耗了多少 token
- 技能作者,他们需要在模型更新或一行提示改动后,确认技能仍正确触发并守在自己的职责范围内
不适合
- Caliper 只通过 CLI 智能体运行技能,因此每个后端都能真正加载并运行技能。没有直连 API 的后端:要做按量计费的运行,需要为其中一个 CLI 配置 API key,而不是另选一个后端。
- 在不支持的智能体上声明 `mcp:` 会直接报错而非静默跳过。 `pi` 原生不支持 `mcp:`;应把能力作为技能驱动的 CLI 工具来暴露,或者改用 claude-code / hermes / codex 运行评测。
05兼容性、维护与安全提示
- Caliper 只通过 CLI 智能体运行技能,因此每个后端都能真正加载并运行技能。没有直连 API 的后端:要做按量计费的运行,需要为其中一个 CLI 配置 API key,而不是另选一个后端。
- 在不支持的智能体上声明 `mcp:` 会直接报错而非静默跳过。 `pi` 原生不支持 `mcp:`;应把能力作为技能驱动的 CLI 工具来暴露,或者改用 claude-code / hermes / codex 运行评测。
- Caliper 从不会把你的技能直接粘贴进提示词。它会把技能安装到智能体查找技能的位置,让智能体自己决定,因此一次运行同时衡量描述(会不会触发?)与正文(有没有用?)。
MIT · 最新发布 v0.11.0(2026-08-29);仓库最后推送于 2026-08-30
06常见问题
如何在 DeepSeek Harness 中安装 Caliper?
通过技能市场以技能形式添加:`npx skills@latest add edonadei/caliper`;或直接用 `pipx install caliper-eval` 安装 CLI(需要 Python 3.10+)。如果缺失,`evaluate-skill` 技能会自动安装 Caliper。
Caliper 能为哪些智能体评测技能?
Claude Code、Codex、Pi 和 Hermes。Caliper 只通过 CLI 智能体运行技能——没有直连 API 的后端——因此你需要为其中一个 CLI 配置 API key(如 `ANTHROPIC_API_KEY` / `OPENAI_API_KEY`)来做按量计费的运行。
怎么证明是技能在起作用,而不是裸智能体?
先用 `--ablate <skill>`(移除该技能)跑一次规格并保留这次运行,再用 `caliper compare` 与完整运行对比。差异会按任务展示通过率与 token 变化,从而隔离出技能的真实贡献。
Caliper 只统计通过率,还是也统计成本?
两者都统计。它会记录每次尝试的 token 消耗与耗时,并按运行汇总,因此同样得分的两次运行也能比较花费。美元成本刻意不统计——token 才是用量信号。
评测规格能用 MCP 服务器吗?
可以,用可选的 `mcp:` 块——但 `pi` 原生不支持 `mcp:`,在不支持的智能体上声明 `mcp:` 会直接报错而非静默跳过。对 pi,应把能力作为技能驱动的 CLI 工具来暴露。
07相关的 DSH 工作流
deepseek-reasonix
作者 esengine
专为 DeepSeek 打造的终端 AI 编程智能体,围绕前缀缓存稳定性设计,可常驻运行。
mnemon
作者 mnemon-dev
LLM 监督的持久记忆系统,基于图结构召回、跨会话知识共享,单个二进制文件,兼容 DeepSeek Harness 等运行时。
phi
作者 pulseaiclub
来自 pi 的编码智能体,支持无限提供方、子智能体、行内编辑与权限门控。
sivtr
作者 ariestar
A unified agent memory workspace for human and agent | 一个统一的agent记忆工作空间
08数据与来源
npx skills@latest add edonadei/caliper
页面基于项目公开文档、仓库元数据和 DSH Plugins 的结构化解析生成;最后核验于 2026-09-01。发现错误?提交更正。
最佳 DeepSeek Harness 插件
从全目录挑出的 12 个值得优先安装的插件,覆盖各个分类。
