Speed sweep

qwen36-35b-a3b-layered-fp8-arcb70-sglang-tp2-sweep

qwen36-35b-a3b-layered-fp8-arcb70-sglang-tp2-sweep

Record

Recipe
qwen36-35b-a3b-layered-fp8-arcb70-sglang-tp2
Measured
2026-08-25
Accepted
2026-08-25
Points
7

Measured speed

ConcurrencyContextPrefillDecodeTTFT msStatus
112858.41152,190.2accepted
151258.9116.28,687.3accepted
12,04862113.933,060.1accepted
18,19262.6116.4130,857.6accepted
251285.715,724.6accepted
451267.833,694.9accepted
851241.866,861accepted

Remaining fields

Identity, launch, related records, and measured speed are shown above. This is the rest of the normalized record.

accepted at
2026-08-25
id
qwen36-35b-a3b-layered-fp8-arcb70-sglang-tp2-sweep
measured at
2026-08-25
recipe id
qwen36-35b-a3b-layered-fp8-arcb70-sglang-tp2
schema version
local-ai-registry/v1

metrics

concurrency
8
latest point at
2026-08-25
max context tokens
8,192
peak generation tps
116.35
peak prompt tps
62.6
point count
7

rows

concurrencycontext tokensdecode tok sdecode tok s per streamoutput tokenspeak vram gbprefill tok ssamples
1128114.95114.95128Unknown58.441
1512116.17116.17128Unknown58.941
12,048113.92113.92128Unknown61.951
18,192116.35116.35128Unknown62.61
2512Unknown85.7128UnknownUnknown2
4512Unknown67.8128UnknownUnknown4
8512Unknown41.75128UnknownUnknown8
Provenance & metadata (1)

source

commit
15166aed68bc25c411e16ddd81621242ba3d6298
paths
README.md, sglang/xpu/run_qwen3_6_service.sh, sglang/xpu/start_qwen3_6_service.sh, benchmarks/bench.py, benchmarks/results/20260825-195430-b70-sglang.json