0Reviewed runs
0Agent/model variants
6Public tasks
0Three-trial comparisons
Evidence not ready
- No reviewed scored runs have been imported.
- Fewer than two scored agent/model variants are available.
- No paired condition comparison is available.
- MCP comparison gate mcp-vs-baseline is closed: no scored agent/model variants are available (0/6 required task-level comparisons).
- MCP comparison gate mcp-vs-skill is closed: no scored agent/model variants are available (0/6 required task-level comparisons).
MCP Comparison Gates
Three paired trials per agent, task, and comparison| Gate | Reference | Condition | Tasks | Eligible | Status |
|---|---|---|---|---|---|
mcp-vs-baseline | baseline | mcp-enabled | 3 | 0/6 | Closed |
mcp-vs-skill | skill-enabled | mcp-enabled | 3 | 0/6 | Closed |
Condition Results
Macro score, failures, time, and reported cost| Agent | Model | Condition | Runs | Scored | Failed | Score | Failure | Time | Cost |
|---|---|---|---|---|---|---|---|---|---|
| No reviewed runs published. | |||||||||
Paired Skill Lift
Same task and trial, compared by condition| Agent | Task | Reference | Condition | Pairs | Reference score | Condition score | Lift | CI95 |
|---|---|---|---|---|---|---|---|---|
| No three-trial paired comparison is available. | ||||||||
Public Run Ledger
Failures and pending reviews remain visible| Run | Agent | Task | Condition | Trial | Status | Score | Time | Cost |
|---|---|---|---|---|---|---|---|---|
| The public result ledger is empty. | ||||||||
Evidence Boundary
Comparative publication requires at least 3 paired trials, two independent blinded reviewers for every scored run, exact agent and model versions, a clean repository commit, and digest-verified public artifacts. Scores are not maturity promotions and incomplete evidence does not produce a ranking.