How to benchmark a local coding agent honestly
A useful coding-agent benchmark needs work requests written like ordinary issues, clean workspaces, hidden checks, retained metrics and a separate review. This method evaluates a patch before acceptance.