{"data":{"accepted_at":"2026-08-27","id":"glm53-flash-exl3-q4-rtxpro6000-sglang-tp4-sweep","measured_at":"2026-08-27","metrics":{"concurrency":256,"inference_engine_version":"0.0.0.dev1+gf609d677b with Sparkinfer 1.0.1 selective-EXL3 overlay","latest_point_at":"2026-08-27","max_context_tokens":1024,"peak_generation_tps":1710.1642,"peak_prompt_tps":827.7402,"point_count":19},"recipe_id":"glm53-flash-exl3-q4-rtxpro6000-sglang-tp4","rows":[{"concurrency":1,"context_tokens":29,"decode_tok_s":73.4979,"decode_tok_s_per_stream":73.4979,"elapsed_s":3.483093,"engine_decode_tok_s":97.0524,"expert_parallel":1,"output_tokens":256,"peak_vram_gb":null,"prefill_tok_s":null,"samples":1,"status":"accepted-matched-screen","ttft_ms_p50":225.98},{"concurrency":1,"context_tokens":29,"decode_tok_s":68.4659,"decode_tok_s_per_stream":68.4659,"elapsed_s":3.739085,"engine_decode_tok_s":88.5637,"expert_parallel":4,"output_tokens":256,"peak_vram_gb":null,"prefill_tok_s":null,"samples":1,"status":"rejected-matched-regression","ttft_ms_p50":167.07},{"concurrency":1,"context_tokens":29,"decode_tok_s":65.9656,"decode_tok_s_per_stream":65.9656,"elapsed_s":3.88081,"output_tokens":256,"peak_vram_gb":null,"prefill_tok_s":null,"samples":1,"status":"observed-earlier-tp4-ep1-baseline","ttft_ms_p50":null},{"concurrency":1,"context_tokens":29,"decode_tok_s":64.8608,"decode_tok_s_per_stream":64.8608,"elapsed_s":3.946916,"output_tokens":256,"peak_vram_gb":null,"prefill_tok_s":null,"samples":1,"speculation":"NEXTN MTP5","status":"rejected-speculation-regression","ttft_ms_p50":null},{"cache_hit_rate":0,"concurrency":1,"context_tokens":1024,"decode_tok_s":null,"elapsed_s":1.248205,"output_tokens":1,"peak_vram_gb":null,"prefill_tok_s":827.7402,"samples":1,"status":"accepted-cold-prefill","ttft_ms_p50":1248.004},{"cache_hit_rate":0.9375,"concurrency":1,"context_tokens":1022,"decode_tok_s":null,"device_cache_hit_tokens":960,"elapsed_s":0.466973,"output_tokens":1,"peak_vram_gb":null,"prefill_compute_tokens":64,"prefill_tok_s":140.271,"samples":1,"status":"accepted-warm-prefix-prefill","ttft_ms_p50":466.779},{"cache_hit_rate":0,"concurrency":1,"context_tokens":126,"decode_tok_s":73.6191,"decode_tok_s_per_stream":79.0341,"elapsed_s":3.47736,"output_tokens":256,"output_tokens_per_minute":4417.1439,"peak_vram_gb":null,"prefill_tok_s":550.4661,"samples":1,"status":"accepted-cold-c1","ttft_ms_p50":238.089},{"cache_hit_rate":0,"concurrency":2,"context_tokens":128,"decode_tok_s":116.6656,"decode_tok_s_per_stream":63.0292,"elapsed_s":4.388611,"output_tokens":256,"output_tokens_per_minute":6999.9366,"peak_vram_gb":null,"prefill_tok_s":518.5195,"samples":2,"status":"accepted-cold-concurrency-sweep","ttft_ms_p50":326.636},{"cache_hit_rate":0,"concurrency":4,"context_tokens":128,"decode_tok_s":214.0485,"decode_tok_s_per_stream":62.2597,"elapsed_s":4.783963,"output_tokens":256,"output_tokens_per_minute":12842.9078,"peak_vram_gb":null,"prefill_tok_s":295.8532,"samples":4,"status":"accepted-cold-concurrency-sweep","ttft_ms_p50":671.55},{"cache_hit_rate":0,"concurrency":8,"context_tokens":128,"decode_tok_s":384.9508,"decode_tok_s_per_stream":55.4188,"elapsed_s":5.320161,"output_tokens":256,"output_tokens_per_minute":23097.0463,"peak_vram_gb":null,"prefill_tok_s":378.2635,"samples":8,"status":"accepted-cold-concurrency-sweep","ttft_ms_p50":699.564},{"cache_hit_rate":0,"concurrency":16,"context_tokens":128,"decode_tok_s":496.9819,"decode_tok_s_per_stream":38.2003,"elapsed_s":8.241749,"output_tokens":256,"output_tokens_per_minute":29818.9129,"peak_vram_gb":null,"prefill_tok_s":327.791,"samples":16,"status":"accepted-cold-concurrency-sweep","ttft_ms_p50":1538.581},{"cache_hit_rate":0,"concurrency":32,"context_tokens":128,"decode_tok_s":763.7398,"decode_tok_s_per_stream":30.395,"elapsed_s":10.726167,"engine_decode_tok_s":858.6539,"output_tokens":256,"output_tokens_per_minute":45824.3858,"peak_vram_gb":null,"prefill_tok_s":343.0371,"samples":32,"status":"accepted-balanced-latency-profile","ttft_ms_p50":2299.687},{"cache_hit_rate":0,"concurrency":64,"context_tokens":128,"decode_tok_s":812.0259,"decode_tok_s_per_stream":20.9074,"elapsed_s":20.176697,"output_tokens":256,"output_tokens_per_minute":48721.5518,"peak_vram_gb":null,"prefill_tok_s":360.9508,"samples":64,"status":"accepted-short-output-throughput-profile","ttft_ms_p50":3732.274},{"cache_hit_rate":0,"concurrency":128,"context_tokens":128,"decode_tok_s":798.0523,"decode_tok_s_per_stream":17.2556,"elapsed_s":41.059967,"output_tokens":256,"output_tokens_per_minute":47883.1361,"peak_vram_gb":null,"prefill_tok_s":371.4433,"samples":128,"status":"rejected-short-output-throughput-regression","ttft_ms_p50":19334.705},{"cache_hit_rate_effective":0.6632,"concurrency":64,"context_tokens":131,"decode_tok_s":1183.6579,"decode_tok_s_per_stream":28.9013,"device_cache_hit_tokens":8192,"elapsed_s":55.367351,"output_tokens":1024,"output_tokens_per_minute":71019.4719,"peak_vram_gb":null,"prefill_tok_s":191.8996,"samples":64,"status":"accepted-sustained-warm-prefix","total_api_tokens_per_minute":80104.9708,"ttft_ms_p50":2800.008},{"cache_hit_rate_effective":0.6667,"concurrency":128,"context_tokens":131,"decode_tok_s":1423.8616,"decode_tok_s_per_stream":28.3809,"device_cache_hit_tokens":16384,"elapsed_s":92.053892,"output_tokens":1024,"output_tokens_per_minute":85431.6945,"peak_vram_gb":null,"prefill_tok_s":211.6082,"samples":128,"status":"accepted-sustained-warm-prefix","total_api_tokens_per_minute":96360.9445,"ttft_ms_p50":38464.355},{"cache_hit_rate_effective":0.6667,"captured_decode_graph_max_batch":62,"concurrency":256,"context_tokens":131,"decode_tok_s":1710.1642,"decode_tok_s_per_stream":31.6067,"device_cache_hit_tokens":32768,"elapsed_s":153.285866,"output_tokens":1024,"output_tokens_per_minute":102609.852,"peak_vram_gb":78.71,"prefill_tok_s":222.5707,"samples":256,"status":"accepted-max-output-tpm-profile","total_api_tokens_per_minute":115736.6983,"ttft_ms_p50":68677.375,"ttft_ms_p95":104372.477},{"cache_hit_rate":0,"concurrency":64,"context_tokens":127,"decode_tok_s":563.981,"decode_tok_s_per_stream":17.2671,"elapsed_s":29.050624,"expert_parallel":4,"output_tokens":256,"output_tokens_per_minute":33838.86,"peak_vram_gb":null,"prefill_tok_s":295.7688,"samples":64,"status":"rejected-ep4-saturation-regression","ttft_ms_p50":7432.695},{"cache_hit_rate":0,"concurrency":64,"context_tokens":127,"decode_tok_s":792.009,"decode_tok_s_per_stream":20.0737,"elapsed_s":20.686634,"output_tokens":256,"output_tokens_per_minute":47520.5401,"peak_vram_gb":null,"prefill_tok_s":344.9519,"samples":64,"single_batch_overlap":true,"status":"rejected-single-batch-overlap-regression","ttft_ms_p50":3617.001}],"schema_version":"local-ai-registry/v1","source":{"artifact":"https://huggingface.co/0xSero/GLM-5.3-Flash-EXL3-Q4","artifact_revision":"99cccdf0e8741715662c383828a9ea601990c125","method":"OpenAI-compatible streaming sweeps with server-reported prompt/completion counts. Cold ISL/OSL concurrency screens use distinct prompts; sustained screens prime one shared prefix and request OSL 1024. Client output rate is total completed output tokens divided by batch wall time. Output TPM is output rate multiplied by 60; total API TPM includes prompt tokens. SGLang Prometheus deltas supply prefill-compute tokens, device-cache hits, and engine gauges. Full CUDA graphs remained enabled throughout.","runtime_image":"glm53-flash-sglang-exl3:stage-20260827-r6"},"relationships":{"recipe":{"api":"/api/v1/recipes/glm53-flash-exl3-q4-rtxpro6000-sglang-tp4","href":"/recipes/glm53-flash-exl3-q4-rtxpro6000-sglang-tp4","id":"glm53-flash-exl3-q4-rtxpro6000-sglang-tp4"}}},"meta":{"source":"registry"}}