PH — A critical comparison against a general-purpose LLM benchmark diagnosed…

A critical comparison against a general-purpose LLM benchmark diagnosed PUMA’s conceptual gap (it measured prediction quality but not reliability/consistency/equity), driving the addition of calibration (ECE), robustness (perturbations), fairness by subgroup, declarative YAML run-specs, and multi-model/few-shot — while positioning CO2 tracking as PUMA’s original advantage.

Source: phases/03-design/HELM-vs-PUMA · Traceability: corpus unit PHASE-019 · Confidence: verified-at-primary-source