Speed sweep

nvidia-nemotron-3-nano-30b-a3b-bf16-ud-q4-k-xl-rtx-5090-32gb-llama-cpp-tp1-sweep

nvidia-nemotron-3-nano-30b-a3b-bf16-ud-q4-k-xl-rtx-5090-32gb-llama-cpp-tp1-sweep

Record

Recipe
nvidia-nemotron-3-nano-30b-a3b-bf16-ud-q4-k-xl-rtx-5090-32gb-llama-cpp-tp1
Measured
2026-06-14T16:55:10.585Z
Points
1

Measured speed

ConcurrencyContextPrefillDecodeTTFT msStatus
18,1921,787.1313.146.4observed

Remaining fields

Identity, launch, related records, and measured speed are shown above. This is the rest of the normalized record.

id
nvidia-nemotron-3-nano-30b-a3b-bf16-ud-q4-k-xl-rtx-5090-32gb-llama-cpp-tp1-sweep
measured at
2026-06-14T16:55:10.585Z
recipe id
nvidia-nemotron-3-nano-30b-a3b-bf16-ud-q4-k-xl-rtx-5090-32gb-llama-cpp-tp1
schema version
local-ai-registry/v1

metrics

concurrency
1
latest point at
2026-06-14T16:55:10.585Z
max context tokens
8,192
peak generation tps
313.1
peak prompt tps
1,787.1
point count
1

rows

concurrencycontext tokensdecode tok sdecode tok s per streamoutput tokenspeak vram gbprefill tok ssamples
18,192313.1Unknown51221.71,787.11
Provenance & metadata (1)