Ω OhmJudge / executable EE evaluation

deterministic grading
Models comparedsame generated suite
Responses gradedno LLM judge
Best accuracy
Pareto frontiercost ↓ / quality ↑

Cost × accuracy

Domain accuracy

Model scorecard

ModelAccuracy95% intervalMedian latencyTotal cost

Error taxonomy

Auditable result rows

ModelDomainTaskResultObservedExpected
Suite commitment: