PN — Inference runs locally via a model server exposing an OpenAI-compatible…

Inference runs locally via a model server exposing an OpenAI-compatible REST interface, chosen for deterministic inference with fixed seed/temperature, no paid API or internet dependency, 4-bit quantization support, and per-call timing metrics.

Source: PUMA project documentation · Traceability: corpus unit MEM-023 · Confidence: verified-at-primary-source