Speed sweep

nvidia-nemotron-3-5-gptq-int4-g64-sym-local-dflash-bf16-local-intel-arc-pro-b70-32gb-vllm-tp1-sweep

nvidia-nemotron-3-5-gptq-int4-g64-sym-local-dflash-bf16-local-intel-arc-pro-b70-32gb-vllm-tp1-sweep

Record

Recipe
nvidia-nemotron-3-5-gptq-int4-g64-sym-local-dflash-bf16-local-intel-arc-pro-b70-32gb-vllm-tp1
Measured
2026-08-13
Points
1

Measured speed

ConcurrencyContextPrefillDecodeTTFT msStatus
16,3847,160186.6historical

Remaining fields

Identity, launch, related records, and measured speed are shown above. This is the rest of the normalized record.

id
nvidia-nemotron-3-5-gptq-int4-g64-sym-local-dflash-bf16-local-intel-arc-pro-b70-32gb-vllm-tp1-sweep
measured at
2026-08-13
recipe id
nvidia-nemotron-3-5-gptq-int4-g64-sym-local-dflash-bf16-local-intel-arc-pro-b70-32gb-vllm-tp1
schema version
local-ai-registry/v1

metrics

inference engine version
v0.26.1rc1.dev668+g3ee2df303 (XPU)
latest point at
2026-08-13
max context tokens
16,384
peak generation tps
186.6
peak prompt tps
7,160
point count
1

rows

concurrencycontext tokensdecode tok sdecode tok s per streamoutput tokenspeak vram gbprefill tok ssamples
Unknown16,384186.6Unknown0Unknown7,1601
Provenance & metadata (1)