coder-eval 0.12.7
Evaluate, benchmark, and A/B-test AI coding agents (Claude Code, Codex, Gemini/Antigravity, OpenCode, Pi, Delegate) with sandboxed, reproducible YAML task suites.
Sources
- T1coder-eval 0.12.7PyPI / crates.io / RubyGems / Go index / NuGet