返回目錄

caliper

維護狀態: 活躍

edonadei/caliper

輕量評估工具,追蹤 Claude Code、Codex、Pi 等智慧體上技能的成功率,驗證技能是否真正有效。

前往 GitHub專案首頁
$ npx skills@latest add edonadei/caliper

202

星數

22

Fork

Python

語言

MIT

授權條款

2026-05-13

建立於

2026-10-03

最近推送

採用 MIT 授權的 Python 智慧型體技能評測框架,以 dsh 套件形式透過技能市場分發。用你真實的智慧型體(Claude Code、Codex、Pi、Hermes)跑評測規格,追蹤成功率,做消融與對比,並查看每次嘗試的 token / 時間成本。

DSH 整合

生態系相關

作者聲明

安全稽核

未稽核

最後核實

2026-09-01

授權條款

MIT

01它能幫你完成什麼?

  • 在發布前衡量一個智慧型體技能是否真的有效

    一個可長期追蹤的 **成功率**,以及每次執行儲存的 transcript 供檢查

    為 Claude Code、Codex、Pi 或 Hermes 維護技能的開發者與團隊,他們需要證據證明技能有用——以及它消耗了多少 token

  • 證明是技能(而非裸智慧型體)在起作用,並捕捉啟用漂移

    透過 `caliper compare` 得到消融版與完整版的差異,外加一個依技能統計的啟用計分板,顯示技能何時在鄰居的提示上被觸發

    技能作者,他們需要在模型更新或一行提示改動後,確認技能仍正確觸發並守在自己的職責範圍內

02如何將外掛接入 DeepSeek Harness?

先決條件

  • Python 3.10+——CLI 安裝步驟註明 `pipx install caliper-eval # requires Python 3.10+`
  • 安裝並認證一個目標智慧型體 CLI——claude-code、codex、pi 或 hermes(Caliper 只透過 CLI 智慧型體執行技能;沒有直連 API 的後端)

安裝步驟

  1. 01

    安裝技能(智慧型體路徑):`npx skills@latest add edonadei/caliper`

    $ npx skills@latest add edonadei/caliper

  2. 02

    或直接安裝 CLI(Python 路徑):`pipx install caliper-eval # requires Python 3.10+`

  3. 03

    撰寫規格後執行:`caliper run my-skill.eval.yaml --k 3 # --ablate <skill> for a run to diff against`

  4. 04

    對比兩次執行:`caliper compare .caliper/results/commit-commands/<evaluation-run>.json .caliper/results/commit-commands/<ablated-run>.json`

驗證整合成功

作者未說明

03DSH 整合程度與能力邊界

DSH 整合生態系相關

透過技能市場(npx skills add)以 dsh 套件形式分發;為 Claude Code、Codex、Pi 和 Hermes 這些 DeepSeek Harness 執行的智慧型體後端評測技能

  • 基於規格的評測框架

    一份描述技能、判定方式與任務的 `.eval.yaml` 規格→一個可追蹤的成功率,以及每次執行儲存的 transcript

  • 消融與執行對比

    一份規格,加上一次 `--ablate <skill>` 執行和一次完整執行→`caliper compare` 逐任務對比兩次執行

  • 內建智慧型體技能:evaluate-skill 與 grill-skill

    技能的 `SKILL.md`(grill-skill)或 `.eval.yaml`(evaluate-skill)→在智慧型體內部建立、執行、校驗並管理評測;grill-skill 會生成一份 3 任務的規格

  • token 與耗時報告

    任意一次執行→每次嘗試的 token 消耗與耗時,並依執行彙總

04適合誰?何時不該用?

適合

  • 為 Claude Code、Codex、Pi 或 Hermes 維護技能的開發者與團隊,他們需要證據證明技能有用——以及它消耗了多少 token
  • 技能作者,他們需要在模型更新或一行提示改動後,確認技能仍正確觸發並守在自己的職責範圍內

不適合

  • Caliper 只透過 CLI 智慧型體執行技能,因此每個後端都能真正載入並執行技能。沒有直連 API 的後端:要做按量計費的執行,需要為其中一個 CLI 設定 API key,而不是另選一個後端。
  • 在不支援的智慧型體上宣告 `mcp:` 會直接報錯而非靜默跳過。 `pi` 原生不相容 `mcp:`;應把能力作為技能驅動的 CLI 工具來暴露,或者改用 claude-code / hermes / codex 執行評測。

05相容性、維護與安全提醒

  • Caliper 只透過 CLI 智慧型體執行技能,因此每個後端都能真正載入並執行技能。沒有直連 API 的後端:要做按量計費的執行,需要為其中一個 CLI 設定 API key,而不是另選一個後端。
  • 在不支援的智慧型體上宣告 `mcp:` 會直接報錯而非靜默跳過。 `pi` 原生不相容 `mcp:`;應把能力作為技能驅動的 CLI 工具來暴露,或者改用 claude-code / hermes / codex 執行評測。
  • Caliper 從不會把你的技能直接貼進提示詞。它會把技能安裝到智慧型體查找技能的位置,讓智慧型體自己決定,因此一次執行同時衡量描述(會不會觸發?)與正文(有沒有用?)。
2026-05-132026-08-30v0.11.0

MIT · 最新發布 v0.11.0(2026-08-29);倉庫最後推送於 2026-08-30

06常見問題

如何在 DeepSeek Harness 中安裝 Caliper?

透過技能市場以技能形式加入:`npx skills@latest add edonadei/caliper`;或直接用 `pipx install caliper-eval` 安裝 CLI(需要 Python 3.10+)。若缺失,`evaluate-skill` 技能會自動安裝 Caliper。

Caliper 能為哪些智慧型體評測技能?

Claude Code、Codex、Pi 和 Hermes。Caliper 只透過 CLI 智慧型體執行技能——沒有直連 API 的後端——因此你需要為其中一個 CLI 設定 API key(如 `ANTHROPIC_API_KEY` / `OPENAI_API_KEY`)來做按量計費的執行。

怎麼證明是技能在起作用,而不是裸智慧型體?

先用 `--ablate <skill>`(移除該技能)跑一次規格並保留這次執行,再用 `caliper compare` 與完整執行對比。差異會依任務顯示通過率與 token 變化,從而隔離出技能的真實貢獻。

Caliper 只統計通過率,還是也統計成本?

兩者都統計。它會記錄每次嘗試的 token 消耗與耗時,並依執行彙總,因此同樣分數的兩次執行也能比較花費。美元成本刻意不統計——token 才是用量信號。

評測規格能用 MCP 伺服器嗎?

可以,用選用的 `mcp:` 區塊——但 `pi` 原生不相容 `mcp:`,在不支援的智慧型體上宣告 `mcp:` 會直接報錯而非靜默跳過。對 pi,應把能力作為技能驅動的 CLI 工具來暴露。

08資料與來源

  • 作者聲明github.com91590cd87976…

    npx skills@latest add edonadei/caliper

此頁面根據專案公開文件、儲存庫中繼資料與 DSH Plugins 的結構化解析所產生;最後核實於 2026-09-01。發現錯誤?提交更正。

🏆

最佳 DeepSeek Harness 外掛

從全目錄挑出的 12 個值得優先安裝的外掛,涵蓋各個分類。

DSH Plugins 是獨立的 DeepSeek Harness 外掛市集,與 DeepSeek 官方無關,也不代表官方背書。第三方外掛未經安全稽核,安裝前請審查原始碼。

每週取得最新的 DeepSeek Harness 外掛,絕不濫發。