AI Agent Evaluations

Performance results of AI coding agents on Nuxt code generation tasks, measuring success rate and execution time.
View on GitHubLast run date: August 27, 2026

Agent Performance Results

ModelAgentAvg DurationAvg List CostSuccess RateFirst-Try Rate
GPT 5.6 Sol (xhigh)
Codex325.19s$0.444100%94%
Claude Opus 5
Claude Code417.25s$1.85997%94%
Claude Fable 5
Claude Code310.54s$1.19397%94%
Kimi K3
OpenCode412.22s$0.31397%94%
GPT 5.5 Pro
Codex720.24s$9.12697%90%
GPT 5.3 Codex (xhigh)
Codex296.30s$0.20597%87%
Claude Opus 4.8
Claude Code266.44s$0.55597%87%
MiniMax M3
OpenCode238.21s$0.04497%84%
Kimi K2.7 Code
OpenCode339.07s$0.09497%77%
Claude Sonnet 5
Claude Code308.45s$0.51094%94%
Cursor Composer 2.0
Cursor295.06s$0.09294%90%
Cursor Composer 2.5
Cursor275.52s$0.09594%84%
Claude Opus 4.7
Claude Code223.20s$0.39894%84%
Claude Opus 4.6
Claude Code243.03s$0.35094%81%
Gemini 3.1 Pro Preview
OpenCode301.03s$0.27590%77%
Kimi K2.6
OpenCode295.87s$0.08590%77%
GPT 5.4 (xhigh)
Codex322.11s$0.39990%74%
Claude Sonnet 4.6
Claude Code254.34s$0.31987%77%
Claude Sonnet 4.5
Claude Code238.91s$0.18855%45%
MiniMax M2.7
OpenCode207.26s$0.01145%29%
Each evaluation is attempted up to 4 times. Success Rate is the percentage of evals that passed on at least one attempt; First-Try Rate is the percentage that passed on the first attempt, used to break ties between models with the same success rate. Avg Duration is the mean time an agent took per eval. Avg List Cost is the mean cost per eval, estimated from the tokens each run used at the provider's public list price, so it's a relative guide and not a bill: your rate depends on caching, discounts and subscription plans. Expand a row to see per-eval results, where a 1/3 badge means the eval failed twice before passing.