Speed sweep

qwen3-6-35b-a3b-compressed-tensors-nvfp4-fp8-rtx-5090-32gb-vllm-tp1-sweep

qwen3-6-35b-a3b-compressed-tensors-nvfp4-fp8-rtx-5090-32gb-vllm-tp1-sweep

Record

Recipe
qwen3-6-35b-a3b-compressed-tensors-nvfp4-fp8-rtx-5090-32gb-vllm-tp1
Measured
2026-05-13
Points
1

Measured speed

ConcurrencyContextPrefillDecodeTTFT msStatus
262,1448,385240.961.3historical

Remaining fields

Identity, launch, related records, and measured speed are shown above. This is the rest of the normalized record.

id
qwen3-6-35b-a3b-compressed-tensors-nvfp4-fp8-rtx-5090-32gb-vllm-tp1-sweep
measured at
2026-05-13
recipe id
qwen3-6-35b-a3b-compressed-tensors-nvfp4-fp8-rtx-5090-32gb-vllm-tp1
schema version
local-ai-registry/v1

metrics

inference engine version
0.20.2rc1
latest point at
2026-05-13
max context tokens
262,144
peak generation tps
240.9
peak prompt tps
8,385
point count
1

rows

concurrencycontext tokensdecode tok sdecode tok s per streamoutput tokenspeak vram gbprefill tok ssamples
Unknown262,144240.9Unknown1,024318,3851
Provenance & metadata (1)