Speed sweep

nvidia-nemotron-labs-3-puzzle-75b-a9b-bf16-ud-iq4-xl-intel-arc-pro-b70-32gb-llama-cpp-tp2-sweep

nvidia-nemotron-labs-3-puzzle-75b-a9b-bf16-ud-iq4-xl-intel-arc-pro-b70-32gb-llama-cpp-tp2-sweep

Record

Recipe
nvidia-nemotron-labs-3-puzzle-75b-a9b-bf16-ud-iq4-xl-intel-arc-pro-b70-32gb-llama-cpp-tp2
Measured
2026-07-22T18:25:43.110Z
Points
1

Measured speed

ConcurrencyContextPrefillDecodeTTFT msStatus
12,0481,046.239.1observed

Remaining fields

Identity, launch, related records, and measured speed are shown above. This is the rest of the normalized record.

id
nvidia-nemotron-labs-3-puzzle-75b-a9b-bf16-ud-iq4-xl-intel-arc-pro-b70-32gb-llama-cpp-tp2-sweep
measured at
2026-07-22T18:25:43.110Z
recipe id
nvidia-nemotron-labs-3-puzzle-75b-a9b-bf16-ud-iq4-xl-intel-arc-pro-b70-32gb-llama-cpp-tp2
schema version
local-ai-registry/v1

metrics

concurrency
1
inference engine version
fork YanissAmz/llama.cpp branch puzzle-port (base b566325) + local SSM_SCAN d_state=96 Vulkan patch (required for this arch)
latest point at
2026-07-22T18:25:43.110Z
max context tokens
2,048
peak generation tps
39.1
peak prompt tps
1,046.2
point count
1

rows

concurrencycontext tokensdecode tok sdecode tok s per streamoutput tokenspeak vram gbprefill tok ssamples
12,04839.139.164441,046.21
Provenance & metadata (1)