Speed sweep

nvidia-nemotron-3-nano-4b-bf16-q8-0-apple-m5-pro-24gb-llama-cpp-tp1-sweep

nvidia-nemotron-3-nano-4b-bf16-q8-0-apple-m5-pro-24gb-llama-cpp-tp1-sweep

Record

Recipe
nvidia-nemotron-3-nano-4b-bf16-q8-0-apple-m5-pro-24gb-llama-cpp-tp1
Measured
2026-07-01T11:07:53.371Z
Points
1

Measured speed

ConcurrencyContextPrefillDecodeTTFT msStatus
14,2241,184.153.8432.4observed

Remaining fields

Identity, launch, related records, and measured speed are shown above. This is the rest of the normalized record.

id
nvidia-nemotron-3-nano-4b-bf16-q8-0-apple-m5-pro-24gb-llama-cpp-tp1-sweep
measured at
2026-07-01T11:07:53.371Z
recipe id
nvidia-nemotron-3-nano-4b-bf16-q8-0-apple-m5-pro-24gb-llama-cpp-tp1
schema version
local-ai-registry/v1

metrics

concurrency
1
inference engine version
9850 (4f31eedb0)
latest point at
2026-07-01T11:07:53.371Z
max context tokens
4,224
peak generation tps
53.81
peak prompt tps
1,184.13
point count
1

rows

concurrencycontext tokensdecode tok sdecode tok s per streamoutput tokenspeak vram gbprefill tok ssamples
14,22453.8153.81128Unknown1,184.131
Provenance & metadata (1)