Ω OhmJudge / executable EE evaluation
deterministic grading
Models comparedsame generated suite
Responses gradedno LLM judge
Best accuracy
Pareto frontiercost ↓ / quality ↑
Cost × accuracy
Domain accuracy
Model scorecard
| Model | Accuracy | 95% interval | Median latency | Total cost |
|---|
Error taxonomy
Auditable result rows
| Model | Domain | Task | Result | Observed | Expected |
|---|
Suite commitment: