Recipe

qwen3-8-27b-q8-k-xl-apple-m5-max-128gb-mlx-tp1

qwen3-8-27b-q8-k-xl-apple-m5-max-128gb-mlx-tp1

Record

Status
candidate
Source
localmaxxing
Engine
mlx
Engine version
omlx
Accelerators
1
Tensor parallel
1
chat
unknown
reasoning
unknown
tools
unknown
vision
unknown

Hugging Face model card

Identity

https://huggingface.co/mcsplain/Qwen3.8-27B-oQ8-mtp
Repository
mcsplain/Qwen3.8-27B-oQ8-mtp
Status
known
Link type
Exact Hub repository

Public Hugging Face repository confirmed by the Hub API.

Candidate: useful compatibility or speed evidence. The registry does not offer Run until promotion requirements are met.

Observed configuration

mlx

Evidence only · candidate · reference

Candidate evidence — not a Run contract

Source
https://www.localmaxxing.com/en/runs/cmsz807ad0dz3ms01foyas4h6

No tokenized launch fields. This is measured or documented compatibility, not a Docker launch.

Measured speed

ConcurrencyContextPrefillDecodeTTFT msStatusSweep
14,096806.239.61,270historicalqwen3-8-27b-q8-k-xl-apple-m5-max-128gb-mlx-tp1-sweep

Remaining fields

Identity, launch, related records, and measured speed are shown above. This is the rest of the normalized record.

hardware count
1
hardware id
apple-m5-max-128gb
id
qwen3-8-27b-q8-k-xl-apple-m5-max-128gb-mlx-tp1
model instance id
mcsplain-qwen3-8-27b-oq8-mtp--q8-k-xl
recipe source
localmaxxing
schema version
local-ai-registry/v1
speed sweep ids
qwen3-8-27b-q8-k-xl-apple-m5-max-128gb-mlx-tp1-sweep
status
candidate

capabilities

engine

name
mlx
version
omlx

serving

tensor parallel
1
Provenance & metadata (3)

facts

capabilities.chat · provenance · captured at
2026-08-27T06:04:13.773Z
capabilities.chat · reason capability-not-verified
capabilities.chat · state unknown
capabilities.reasoning · provenance · captured at
2026-08-27T06:04:13.773Z
capabilities.reasoning · reason capability-not-verified
capabilities.reasoning · state unknown
capabilities.tools · provenance · captured at
2026-08-27T06:04:13.773Z
capabilities.tools · reason capability-not-verified
capabilities.tools · state unknown
capabilities.vision · provenance · captured at
2026-08-27T06:04:13.773Z
capabilities.vision · reason capability-not-verified
capabilities.vision · state unknown
description · provenance · captured at
2026-08-27T06:04:13.773Z
description · reason not-observed
description · state unknown
engine.graph mode · provenance · captured at
2026-08-27T06:04:13.773Z
engine.graph mode · reason runtime-detail-not-published
engine.graph mode · state unknown
metadata.localmaxxing.engine flags.attentionBackend · provenance · captured at
2026-08-27T06:04:13.773Z
metadata.localmaxxing.engine flags.attentionBackend · reason not-observed
metadata.localmaxxing.engine flags.attentionBackend · state unknown
metadata.localmaxxing.engine flags.flashAttn · provenance · captured at
2026-08-27T06:04:13.773Z
metadata.localmaxxing.engine flags.flashAttn · reason not-observed
metadata.localmaxxing.engine flags.flashAttn · state unknown
metadata.localmaxxing.engine flags.gpuLayers · provenance · captured at
2026-08-27T06:04:13.773Z
metadata.localmaxxing.engine flags.gpuLayers · reason not-observed
metadata.localmaxxing.engine flags.gpuLayers · state unknown
metadata.localmaxxing.engine flags.kvCacheDtype · provenance · captured at
2026-08-27T06:04:13.773Z
metadata.localmaxxing.engine flags.kvCacheDtype · reason not-observed
metadata.localmaxxing.engine flags.kvCacheDtype · state unknown
metadata.localmaxxing.engine flags.tensorParallel · provenance · captured at
2026-08-27T06:04:13.773Z
metadata.localmaxxing.engine flags.tensorParallel · reason not-observed
metadata.localmaxxing.engine flags.tensorParallel · state unknown
serving.kv cache tokens · provenance · captured at
2026-08-27T06:04:13.773Z
serving.kv cache tokens · reason kv-cache-capacity-not-published
serving.kv cache tokens · state unknown
serving.max concurrency · provenance · captured at
2026-08-27T06:04:13.773Z
serving.max concurrency · reason not-observed
serving.max concurrency · state unknown
serving.max context tokens · provenance · captured at
2026-08-27T06:04:13.773Z
serving.max context tokens · reason not-observed
serving.max context tokens · state unknown

metadata

localmaxxing · base lineage
known
localmaxxing · engine flags · mtpEnabled
No
localmaxxing · engine flags · specDecoding
No
localmaxxing · hardware label
Apple M5 Max 128GB
localmaxxing · notes
Full run: automated running on oMLX # Context: Code (Python) # Single request results Test TTFT(ms) TPOT(ms) ppTPS tgTPS E2E(s) Throughput PeakMem pp 1024 / tg 128 1270.1 25.4 806.2 39.6 4.5 254.8 28.8 GB pp 4096 / tg 128 5965.9 29.7 686.6 33.9 9.8 432.5 30.3 GB # Batch results Batch tgTPS ppTPS avgTTFT(ms) E2E(s) Speedup 1x baseline 39.6 806.2 1270.1 4.5 1.00x 2x 36.1 454.2 3775.6 11.6 0.91x 4x 58.8 389.6 6658.4 19.2 1.48x 8x 83.7 312.8 14553.5 38.4 2.11x
localmaxxing · revision unpinned
Yes
localmaxxing · run id
cmsz807ad0dz3ms01foyas4h6

provenance

captured at
2026-08-27T06:04:13.773Z

sources

captured atkindurl
2026-08-27T06:04:13.773Znormalized-recipewww.localmaxxing.com/en/runs/cmsz807ad0dz3ms01foyas4h6