PN — Inference runs locally via a model server exposing an OpenAI-compatible…
Inference runs locally via a model server exposing an OpenAI-compatible REST interface, chosen for deterministic inference with fixed seed/temperature, no paid API or internet dependency, 4-bit quantization support, and per-call timing metrics.
Source: PUMA project documentation · Traceability: corpus unit
MEM-023· Confidence: verified-at-primary-source