benchspec 0.0.5
benchspec is a framework for evaluating AI agents with repeatable, isolated benchmarks. Write evals as Markdown, run each eval across named benchmark arms, and compare how agent behavior changes by harness, model, effort, and environment.
Sources
- T1benchspec 0.0.5PyPI / crates.io / RubyGems / Go index / NuGet