Agent Evidence Dashboard

Reviewed HPC task outcomes across baseline, documentation, direct-skill, and MCP-enabled conditions.

0Reviewed runs
0Agent/model variants
6Public tasks
0Three-trial comparisons

Evidence not ready

MCP Comparison Gates

Three paired trials per agent, task, and comparison
GateReferenceConditionTasksEligibleStatus
mcp-vs-baselinebaselinemcp-enabled30/6Closed
mcp-vs-skillskill-enabledmcp-enabled30/6Closed

Condition Results

Macro score, failures, time, and reported cost
AgentModelConditionRunsScoredFailedScoreFailureTimeCost
No reviewed runs published.

Paired Skill Lift

Same task and trial, compared by condition
AgentTaskReferenceConditionPairsReference scoreCondition scoreLiftCI95
No three-trial paired comparison is available.

Public Run Ledger

Failures and pending reviews remain visible
RunAgentTaskConditionTrialStatusScoreTimeCost
The public result ledger is empty.

Evidence Boundary

Comparative publication requires at least 3 paired trials, two independent blinded reviewers for every scored run, exact agent and model versions, a clean repository commit, and digest-verified public artifacts. Scores are not maturity promotions and incomplete evidence does not produce a ranking.