採用 MIT 授權的 Python 智慧型體技能評測框架,以 dsh 套件形式透過技能市場分發。用你真實的智慧型體(Claude Code、Codex、Pi、Hermes)跑評測規格,追蹤成功率,做消融與對比,並查看每次嘗試的 token / 時間成本。
DSH 整合
生態系相關
作者聲明
安全稽核
未稽核
最後核實
2026-09-01
授權條款
MIT
01它能幫你完成什麼?
在發布前衡量一個智慧型體技能是否真的有效
一個可長期追蹤的 **成功率**,以及每次執行儲存的 transcript 供檢查
為 Claude Code、Codex、Pi 或 Hermes 維護技能的開發者與團隊,他們需要證據證明技能有用——以及它消耗了多少 token
證明是技能(而非裸智慧型體)在起作用,並捕捉啟用漂移
透過 `caliper compare` 得到消融版與完整版的差異,外加一個依技能統計的啟用計分板,顯示技能何時在鄰居的提示上被觸發
技能作者,他們需要在模型更新或一行提示改動後,確認技能仍正確觸發並守在自己的職責範圍內
02如何將外掛接入 DeepSeek Harness?
先決條件
- Python 3.10+——CLI 安裝步驟註明 `pipx install caliper-eval # requires Python 3.10+`
- 安裝並認證一個目標智慧型體 CLI——claude-code、codex、pi 或 hermes(Caliper 只透過 CLI 智慧型體執行技能;沒有直連 API 的後端)
安裝步驟
- 01
安裝技能(智慧型體路徑):`npx skills@latest add edonadei/caliper`
$ npx skills@latest add edonadei/caliper
- 02
或直接安裝 CLI(Python 路徑):`pipx install caliper-eval # requires Python 3.10+`
- 03
撰寫規格後執行:`caliper run my-skill.eval.yaml --k 3 # --ablate <skill> for a run to diff against`
- 04
對比兩次執行:`caliper compare .caliper/results/commit-commands/<evaluation-run>.json .caliper/results/commit-commands/<ablated-run>.json`
驗證整合成功
作者未說明
03DSH 整合程度與能力邊界
透過技能市場(npx skills add)以 dsh 套件形式分發;為 Claude Code、Codex、Pi 和 Hermes 這些 DeepSeek Harness 執行的智慧型體後端評測技能
基於規格的評測框架
一份描述技能、判定方式與任務的 `.eval.yaml` 規格→一個可追蹤的成功率,以及每次執行儲存的 transcript
消融與執行對比
一份規格,加上一次 `--ablate <skill>` 執行和一次完整執行→`caliper compare` 逐任務對比兩次執行
內建智慧型體技能:evaluate-skill 與 grill-skill
技能的 `SKILL.md`(grill-skill)或 `.eval.yaml`(evaluate-skill)→在智慧型體內部建立、執行、校驗並管理評測;grill-skill 會生成一份 3 任務的規格
token 與耗時報告
任意一次執行→每次嘗試的 token 消耗與耗時,並依執行彙總
04適合誰?何時不該用?
適合
- 為 Claude Code、Codex、Pi 或 Hermes 維護技能的開發者與團隊,他們需要證據證明技能有用——以及它消耗了多少 token
- 技能作者,他們需要在模型更新或一行提示改動後,確認技能仍正確觸發並守在自己的職責範圍內
不適合
- Caliper 只透過 CLI 智慧型體執行技能,因此每個後端都能真正載入並執行技能。沒有直連 API 的後端:要做按量計費的執行,需要為其中一個 CLI 設定 API key,而不是另選一個後端。
- 在不支援的智慧型體上宣告 `mcp:` 會直接報錯而非靜默跳過。 `pi` 原生不相容 `mcp:`;應把能力作為技能驅動的 CLI 工具來暴露,或者改用 claude-code / hermes / codex 執行評測。
05相容性、維護與安全提醒
- Caliper 只透過 CLI 智慧型體執行技能,因此每個後端都能真正載入並執行技能。沒有直連 API 的後端:要做按量計費的執行,需要為其中一個 CLI 設定 API key,而不是另選一個後端。
- 在不支援的智慧型體上宣告 `mcp:` 會直接報錯而非靜默跳過。 `pi` 原生不相容 `mcp:`;應把能力作為技能驅動的 CLI 工具來暴露,或者改用 claude-code / hermes / codex 執行評測。
- Caliper 從不會把你的技能直接貼進提示詞。它會把技能安裝到智慧型體查找技能的位置,讓智慧型體自己決定,因此一次執行同時衡量描述(會不會觸發?)與正文(有沒有用?)。
MIT · 最新發布 v0.11.0(2026-08-29);倉庫最後推送於 2026-08-30
06常見問題
如何在 DeepSeek Harness 中安裝 Caliper?
透過技能市場以技能形式加入:`npx skills@latest add edonadei/caliper`;或直接用 `pipx install caliper-eval` 安裝 CLI(需要 Python 3.10+)。若缺失,`evaluate-skill` 技能會自動安裝 Caliper。
Caliper 能為哪些智慧型體評測技能?
Claude Code、Codex、Pi 和 Hermes。Caliper 只透過 CLI 智慧型體執行技能——沒有直連 API 的後端——因此你需要為其中一個 CLI 設定 API key(如 `ANTHROPIC_API_KEY` / `OPENAI_API_KEY`)來做按量計費的執行。
怎麼證明是技能在起作用,而不是裸智慧型體?
先用 `--ablate <skill>`(移除該技能)跑一次規格並保留這次執行,再用 `caliper compare` 與完整執行對比。差異會依任務顯示通過率與 token 變化,從而隔離出技能的真實貢獻。
Caliper 只統計通過率,還是也統計成本?
兩者都統計。它會記錄每次嘗試的 token 消耗與耗時,並依執行彙總,因此同樣分數的兩次執行也能比較花費。美元成本刻意不統計——token 才是用量信號。
評測規格能用 MCP 伺服器嗎?
可以,用選用的 `mcp:` 區塊——但 `pi` 原生不相容 `mcp:`,在不支援的智慧型體上宣告 `mcp:` 會直接報錯而非靜默跳過。對 pi,應把能力作為技能驅動的 CLI 工具來暴露。
07相關的 DSH 工作流程
deepseek-reasonix
作者 esengine
專為 DeepSeek 打造的終端 AI 程式設計智慧體,圍繞字首快取穩定性設計,可常駐執行。
mnemon
作者 mnemon-dev
LLM 監督的持久記憶系統,基於圖結構召回、跨會話知識共享,單個二進位制檔案,相容 DeepSeek Harness 等執行時。
phi
作者 pulseaiclub
來自 pi 的編碼智慧體,支援無限提供方、子智慧體、行內編輯與許可權門控。
sivtr
作者 ariestar
A unified agent memory workspace for human and agent | 一個統一的agent記憶工作空間
08資料與來源
npx skills@latest add edonadei/caliper
此頁面根據專案公開文件、儲存庫中繼資料與 DSH Plugins 的結構化解析所產生;最後核實於 2026-09-01。發現錯誤?提交更正。
最佳 DeepSeek Harness 外掛
從全目錄挑出的 12 個值得優先安裝的外掛,涵蓋各個分類。
