Recipe

nvidia-nemotron-3-5-lightning-30b-a3b-bf16-q5-k-m-apple-m4-pro-48gb-lmstudio-tp1

nvidia-nemotron-3-5-lightning-30b-a3b-bf16-q5-k-m-apple-m4-pro-48gb-lmstudio-tp1

Observed LocalMaxxing leaderboard run. Evidence for compatibility, not an executable launch contract.

Record

Status
candidate
Source
localmaxxing
Engine
lmstudio
Engine version
0.4.20+1
Accelerators
1
Tensor parallel
1
Context tokens
64,000
Max concurrency
1
chat
unknown
reasoning
unknown
tools
unknown
vision
unknown

Hugging Face model card

Identity

https://huggingface.co/bartowski/NVIDIA-Nemotron-3.5-Lightning-30B-A3B-GGUF
Repository
bartowski/NVIDIA-Nemotron-3.5-Lightning-30B-A3B-GGUF
Status
known
Link type
Exact Hub repository

Public Hugging Face repository confirmed by the Hub API.

Candidate: useful compatibility or speed evidence. The registry does not offer Run until promotion requirements are met.

Observed configuration

lmstudio

Evidence only · candidate · reference

Candidate evidence — not a Run contract

Source
https://www.localmaxxing.com/en/runs/cmsqri91u00qomr01tr6ckfzy

Observed source tokens

Mechanical split of the source command. Unverified against the engine CLI. The registry does not offer Run for this recipe.

    1. lms
    2. server
    3. start
    4. --port
    5. 1234
    6. --bind
    7. 127.0.0.1
    1. lms
    2. load
    3. nvidia-nemotron-3.5-lightning-30b-a3b
    4. --context-length
    5. 64000
    6. --parallel
    7. 4
    8. --identifier
    9. benchmark-nemotron35-lightning
    10. --yes
FlagValue
--context-length64000
--parallel4
--identifierbenchmark-nemotron35-lightning

Measured speed

ConcurrencyContextPrefillDecodeTTFT msStatusSweep
164,000483.949.21,140.7observednvidia-nemotron-3-5-lightning-30b-a3b-bf16-q5-k-m-apple-m4-pro-48gb-lmstudio-tp1-sweep

Remaining fields

Identity, launch, related records, and measured speed are shown above. This is the rest of the normalized record.

hardware count
1
hardware id
apple-m4-pro-48gb
id
nvidia-nemotron-3-5-lightning-30b-a3b-bf16-q5-k-m-apple-m4-pro-48gb-lmstudio-tp1
model instance id
bartowski-nvidia-nemotron-3-5-lightning-30b-a3b-gguf--q5-k-m
recipe source
localmaxxing
schema version
local-ai-registry/v1
speed sweep ids
nvidia-nemotron-3-5-lightning-30b-a3b-bf16-q5-k-m-apple-m4-pro-48gb-lmstudio-tp1-sweep
status
candidate

capabilities

engine

name
lmstudio
version
0.4.20+1

serving

max concurrency
1
max context tokens
64,000
tensor parallel
1
Provenance & metadata (3)

facts

capabilities.chat · provenance · captured at
2026-08-30T09:10:02Z
capabilities.chat · reason capability-not-verified
capabilities.chat · state unknown
capabilities.reasoning · provenance · captured at
2026-08-30T09:10:02Z
capabilities.reasoning · reason capability-not-verified
capabilities.reasoning · state unknown
capabilities.tools · provenance · captured at
2026-08-30T09:10:02Z
capabilities.tools · reason capability-not-verified
capabilities.tools · state unknown
capabilities.vision · provenance · captured at
2026-08-30T09:10:02Z
capabilities.vision · reason capability-not-verified
capabilities.vision · state unknown
engine.graph mode · provenance · captured at
2026-08-30T09:10:02Z
engine.graph mode · reason runtime-detail-not-published
engine.graph mode · state unknown
serving.kv cache tokens · provenance · captured at
2026-08-30T09:10:02Z
serving.kv cache tokens · reason kv-cache-capacity-not-published
serving.kv cache tokens · state unknown

metadata

localmaxxing · backend
metal
localmaxxing · hardware label
M4 Pro
localmaxxing · notes
GGUF Q5_K_M quantization. Median of 3 timed runs after 1 warmup using the same deterministic 512-word source-prompt protocol at temperature 0. The model-specific chat template produced 552 prompt tokens; each run generated 255 output tokens. Prefill estimated as prompt tokens divided by LM Studio native time-to-first-token.
localmaxxing · observed command
lms server start --port 1234 --bind 127.0.0.1 && lms load nvidia-nemotron-3.5-lightning-30b-a3b --context-length 64000 --parallel 4 --identifier benchmark-nemotron35-lightning --yes
localmaxxing · run id
cmsqri91u00qomr01tr6ckfzy
localmaxxing · tokenized · arguments
lms, load, nvidia-nemotron-3.5-lightning-30b-a3b, --context-length, 64000, --parallel, 4, --identifier, benchmark-nemotron35-lightning, --yes
localmaxxing · tokenized · fidelity
faithful

localmaxxing · tokenized · steps

01234567
lmsserverstart--port1234--bind127.0.0.1Unknown
lmsloadnvidia-nemotron-3.5-lightning-30b-a3b--context-length64000--parallel4--identifier

provenance

captured at
2026-08-30T09:10:02Z

sources

captured atkindurl
2026-08-30T09:10:02Znormalized-recipewww.localmaxxing.com/en/runs/cmsqri91u00qomr01tr6ckfzy