node2 · gecontroleerde lokale meting

LLM Hardware
Lab

Een reproduceerbare vergelijking van lokale modellen en hardwareconfiguraties: het 2×V100-SXM2 NVLink-paar, een RTX A4000, een RTX 4000 Ada en beide RTX-kaarten als onafhankelijke parallel-servinglaag. Iedere rij bewaart de werkelijk zichtbare fysieke GPU’s.

✓ fysieke GPU-provenance✓ PCI_BUS_ID vastgezet✓ per-profiel telemetryV100 NV6 · 6 links64 GB HBM2 + 35 GB RTX2026-09-23 13:53 CEST
Qwen3.8 tensor split
44.87 t/s
33.8% boven single V100
Dense schaaltest
24.29 t/s
Qwen2.5 72,7B · RIV 6/6
1Cat DFlash2 B1
81.59 t/s
wall output throughput
Vrije modelopslag
138.8 GB
live bij lokale generatie; niet beschikbaar op CI
Hoofdconclusie. Layer split vergroot vooral capaciteit. Tensor split gebruikt beide V100’s echt parallel: Qwen3.8 wint 33.8%, terwijl de 72,7B dense Qwen van 14,84 naar 24,29 t/s gaat (+63,7%). Voor Qwen3.8 single-stream latency blijft 1Cat + DFlash2 de snelste route; bij batch 4 wint target-only.

Alle lokale resultaten

Decode-t/s van llama.cpp en wall-output-t/s van 1Cat zijn apart gemeten; batch-4 is aggregaat. RIV is een brongebonden zesveldentest, geen algemene modelaccuracy.

ModelEngineProfielOutput t/sPrompt t/sQwen3.8 speedupRIVVRAM GiBGPU util.
Qwen3.8-27B27Bllama.cppQ4_K_Msingle-v10033.53125.881.00×5/615.4291.3%
Qwen3.8-27B27Bllama.cppQ4_K_Mdual-layer33.33126.210.99×5/67.57 / 8.6445.1% / 48.5%
Qwen3.8-27B27Bllama.cppQ4_K_Mdual-tensor44.8795.941.34×5/68.04 / 8.0486.0% / 85.3%
DeepSeek-R1-Qwen32Bllama.cppQ4_K_Mdual-tensor44.12211.18—5/610.34 / 10.3490.0% / 93.0%
Qwen3.6-27B27Bllama.cppIQ3_XXSdual-tensor45.4292.36—6/66.20 / 6.2086.2% / 87.0%
Qwen3.5-27B27Bllama.cppQ4_K_Mdual-tensor44.9695.92—5/68.24 / 8.2486.8% / 86.7%
Gemma4-26B-A4B26B / ~4B activellama.cppQ4_K_Mdual-tensor77.24285.01—6/68.67 / 8.9682.5% / 80.2%
Devstral Small 224Bllama.cppQ4_K_Mdual-tensor46.43338.44—6/67.64 / 7.6469.9% / 69.4%
Qwen2.5-72B72.7B densellama.cppQ4_K_Mdual-layer14.84132.92—6/621.98 / 21.9750.2% / 48.5%
Qwen2.5-72B72.7B densellama.cppQ4_K_Mdual-tensor24.29140.25—6/621.75 / 21.7595.2% / 96.7%
Qwen3.8 target27B1Cat-vLLM 1.5NVFP4TP2 / 8K / B148.85——5/625.00 / 25.00100% / 100%
Qwen3.8 + DFlash227B1Cat-vLLM 1.5NVFP4TP2 / 8K / B181.59——5/625.46 / 25.46100% / 100%
Qwen3.8 target27B1Cat-vLLM 1.5NVFP4TP2 / 8K / B4183.51——5/625.14 / 25.14100% / 100%
Qwen3.8 + DFlash227B1Cat-vLLM 1.5NVFP4TP2 / 8K / B4156.60——5/624.61 / 24.61100% / 100%

Uitleg van de 1Cat-vLLM-rijen

Qwen3.8 target

Het model draait alleen, zonder hulpmodel. Elke token komt rechtstreeks uit één forward pass van Qwen3.8 zelf.

Terug naar boven

Qwen3.8 + DFlash2

Speculative decoding: een klein draft-model (DFlash2) stelt meerdere tokens tegelijk voor, die Qwen3.8 in één stap verifieert/accepteert. Bij lage gelijktijdigheid (B1) verlaagt dit de latency per request merkbaar; bij hoge gelijktijdigheid (B4) verdwijnt dat voordeel omdat de GPU dan toch al vol staat met werk van andere requests.

Terug naar boven

B1 (batchgrootte 1)

Eén gelijktijdig verzoek: meet single-stream latency/doorvoer, het scenario van één interactieve gebruiker die op antwoord wacht.

Terug naar boven

B4 (batchgrootte 4)

Vier gelijktijdige verzoeken: meet aggregate doorvoer onder concurrency, het scenario van meerdere gebruikers of achtergrondtaken tegelijk.

Terug naar boven

Throughputprofiel: alle gemeten modellen en configuraties

Elke balk is een werkelijk gemeten configuratie, niet een afgeleide schatting. Het onderschrift onder de modelnaam vermeldt steeds de fysieke GPU’s. Aggregate 2 requests telt twee gelijktijdige endpoints op en is dus capaciteit, geen snelheid van één model. De brede tabel erboven bevat de bijbehorende prompt-snelheid, VRAM en GPU-utilisatie.

Qwen3.8-27Bsingle-v100 · GPU 1 · Tesla V100-SXM2-32GB
33.53
Qwen3.8-27Bdual-layer · GPU 1 + 2 · 2× Tesla V100-SXM2-32GB · NVLink
33.33
Qwen3.8-27Bdual-tensor · GPU 1 + 2 · 2× Tesla V100-SXM2-32GB · NVLink
44.87
DeepSeek-R1-Qwendual-tensor · GPU 1 + 2 · 2× Tesla V100-SXM2-32GB · NVLink
44.12
Qwen3.6-27Bdual-tensor · GPU 1 + 2 · 2× Tesla V100-SXM2-32GB · NVLink
45.42
Qwen3.5-27Bdual-tensor · GPU 1 + 2 · 2× Tesla V100-SXM2-32GB · NVLink
44.96
Gemma4-26B-A4Bdual-tensor · GPU 1 + 2 · 2× Tesla V100-SXM2-32GB · NVLink
77.24
Devstral Small 2dual-tensor · GPU 1 + 2 · 2× Tesla V100-SXM2-32GB · NVLink
46.43
Qwen2.5-72Bdual-layer · GPU 1 + 2 · 2× Tesla V100-SXM2-32GB · NVLink
14.84
Qwen2.5-72Bdual-tensor · GPU 1 + 2 · 2× Tesla V100-SXM2-32GB · NVLink
24.29
Qwen3.8 targetTP2 / 8K / B1 · GPU 1 + 2 · 2× Tesla V100-SXM2-32GB · NVLink
48.85
Qwen3.8 + DFlash2TP2 / 8K / B1 · GPU 1 + 2 · 2× Tesla V100-SXM2-32GB · NVLink
81.59
Qwen3.8 targetTP2 / 8K / B4 · GPU 1 + 2 · 2× Tesla V100-SXM2-32GB · NVLink
183.51
Qwen3.8 + DFlash2TP2 / 8K / B4 · GPU 1 + 2 · 2× Tesla V100-SXM2-32GB · NVLink
156.60
Llama-3.1-70Bwell-known suite · GPU 1 + 2 · 2× Tesla V100-SXM2-32GB · NVLink
15.49
Qwen3.6-35B-A3B (1Cat-vLLM NVFP4)well-known suite · GPU-provenance ontbreekt
114.81
Nemotron-3.5-Lightning-30B-A3Bwell-known suite · GPU-provenance ontbreekt
127.78
Muse-Glimmer-30Bwell-known suite · GPU-provenance ontbreekt
34.27
gpt-oss-120Bwell-known suite · GPU 1 + 2 · 2× Tesla V100-SXM2-32GB · NVLink
96.81
gpt-oss-20Bwell-known suite · GPU 0 · NVIDIA RTX A4000
99.44
Mixture-of-modelswell-known suite · GPU-provenance ontbreekt
32.32
Mistral Small 4 (Ada+A4000)well-known suite · GPU 0 RTX A4000 + GPU 3 RTX 4000 Ada · PCIe
11.58
DeepSeek-V4-Flash-REAP-150B (Ada+A4000)well-known suite · GPU 0 RTX A4000 + GPU 3 RTX 4000 Ada · PCIe
5.85
Mixture-of-models 4 (quality)well-known suite · GPU-provenance ontbreekt
5.85
Mixture-of-models 4 (Gemma direct)well-known suite · GPU-provenance ontbreekt
5.85
Mixture-of-models 4 (Gemma route)well-known suite · GPU-provenance ontbreekt
5.85
Llama-3-70B-Instruct Q4_K_Mwell-known suite · GPU 1 + 2 · 2× Tesla V100-SXM2-32GB · NVLink
15.50
Command R+ 104B 08-2024 IQ3_Mwell-known suite · GPU 1 + 2 · 2× Tesla V100-SXM2-32GB · NVLink
10.72
Mixtral 8x22B Instruct Q3_K_Swell-known suite · GPU 1 + 2 · 2× Tesla V100-SXM2-32GB · NVLink
19.08
WizardLM-2 8x22B IQ3_Swell-known suite · GPU 1 + 2 · 2× Tesla V100-SXM2-32GB · NVLink
25.90
GLM-5.3-Flash 313B-A17B AJ-IQ2_XXSwell-known suite · GPU 0 A4000 + GPU 1/2 V100 NVLink + GPU 3 RTX 4000 Ada
21.49
Qwen3.8 Flash-Next AP-IQ4_XS · 2×V100well-known suite · GPU-provenance ontbreekt
42.40
Qwen3.8 Flash-Next AP-IQ4_XS · 4 GPU'swell-known suite · GPU-provenance ontbreekt
37.82
Qwen3.8 Flash-Next AP-Q4_K_M · 4 GPU'swell-known suite · GPU-provenance ontbreekt
40.00
DeepSeek-V4-Flash-0731 UD-IQ3_XXSwell-known suite · GPU 1 + 2 · 2× Tesla V100-SXM2-32GB · NVLink
13.89
Qwen3.8 Flash-Next AP-IQ2_S · 2×V100well-known suite · GPU-provenance ontbreekt
42.79
Qwen3.8 Flash-Next AP-IQ2_S · 4 GPU'swell-known suite · GPU-provenance ontbreekt
40.79
Mixture ultieme 6 (nemotron+deepseek+glm+kat+qwen35+qwen38-iq2s)well-known suite · GPU-provenance ontbreekt
13.89
GLM-5.3-Flash REAP50 IQ3_M · 2×V100well-known suite · GPU 1 + 2 · 2× Tesla V100-SXM2-32GB · NVLink
16.37
GLM-5.3-Flash REAP50 IQ3_M · 4 GPU'swell-known suite · GPU 0 A4000 + GPU 1/2 V100 NVLink + GPU 3 RTX 4000 Ada
22.44
mixture-optimized-2well-known suite · GPU-provenance ontbreekt
13.89
mixture-optimized-3well-known suite · GPU-provenance ontbreekt
16.37
mixture-optimized-4well-known suite · GPU-provenance ontbreekt
5.85
mixture-optimized-5well-known suite · GPU-provenance ontbreekt
5.85
mixture-optimized-6well-known suite · GPU-provenance ontbreekt
15.50
qwen38-flash-next-ap-q4kxl-v100well-known suite · GPU 1 + 2 · 2× Tesla V100-SXM2-32GB · NVLink
34.59
Granite-4.2-30Bwell-known suite · GPU 3 · NVIDIA RTX 4000 Ada
17.51
Qwen3.5-122B-A10B IQ3_Swell-known suite · GPU 1 + 2 · 2× Tesla V100-SXM2-32GB · NVLink
49.14
KAT-Coder-V2.5-Devwell-known suite · GPU 0 RTX A4000 + GPU 3 RTX 4000 Ada · PCIe
91.73
mixture-ensemble-v1-jev-candidatewell-known suite · GPU-provenance ontbreekt
34.59
Qwen3.6-27Bhardware · single-a4000 · GPU 0 · NVIDIA RTX A4000
21.15
Qwen3.6-27Bhardware · single-ada · GPU 3 · NVIDIA RTX 4000 Ada
22.63
Qwen3.6-27Bhardware · dual-a4000ada · GPU 0 RTX A4000 + GPU 3 RTX 4000 Ada · PCIe
23.21
Qwen3.6-27Bhardware · single-v100 · GPU 1 · Tesla V100-SXM2-32GB
34.15
Qwen3.6-27Bhardware · dual-layer · GPU 1 + 2 · 2× Tesla V100-SXM2-32GB · NVLink
34.16
Qwen3.6-27Bhardware · dual-tensor · GPU 1 + 2 · 2× Tesla V100-SXM2-32GB · NVLink
45.42
GLM-5.3-Flash 313B-A17Bhardware · all-four-layer · GPU 0 A4000 + GPU 1/2 V100 NVLink + GPU 3 RTX 4000 Ada
25.97
GLM-5.3-Flash 313B-A17Bhardware · single-v100 · GPU 1 · Tesla V100-SXM2-32GB
9.04
GLM-5.3-Flash 313B-A17Bhardware · single-v100-2 · GPU 2 · Tesla V100-SXM2-32GB
9.10
GLM-5.3-Flash 313B-A17Bhardware · dual-layer · GPU 1 + 2 · 2× Tesla V100-SXM2-32GB · NVLink
13.12
GLM-5.3-Flash 313B-A17Bhardware · single-ada · GPU 3 · NVIDIA RTX 4000 Ada
7.82
GLM-5.3-Flash 313B-A17Bhardware · single-a4000 · GPU 0 · NVIDIA RTX A4000
7.03
GLM-5.3-Flash 313B-A17Bhardware · dual-a4000ada · GPU 0 RTX A4000 + GPU 3 RTX 4000 Ada · PCIe
8.41

Benchmarkscores (8 taken, deterministisch gescoord)

Elke taak levert een objectieve, programmatisch gecontroleerde score 0-100% op -- geen LLM-jury. Alle 7 lokale modellen zijn hierop getest op de dual-tensor 2xV100-configuratie (GPU 0/3 uitgesloten).

ModelRIVArithCodeJSONGICSNeedleSummaryRefusalGemiddeld
qwen38-flash-next-ap-iq2sllama.cpp100%0%100%100%100%100%100%100%88%
qwen38-flash-next-ap-iq2sllama.cpp83%0%100%100%100%100%100%100%85%
qwen38-flash-next-ap-iq4xsllama.cpp83%0%100%100%100%100%100%100%85%
qwen38-flash-next-ap-iq4xsllama.cpp83%0%100%100%100%100%100%100%85%
Qwen3.8-27Bllama.cpp83%0%100%100%100%100%100%100%85%
DeepSeek-R1-Qwenllama.cpp83%0%0%0%0%100%67%50%38%
Qwen3.6-27Bllama.cpp100%0%100%100%100%100%100%100%88%
Qwen3.5-27Bllama.cpp83%0%100%100%100%100%100%100%85%
Gemma4-26B-A4Bllama.cpp100%0%100%100%100%100%100%100%88%
Devstral Small 2llama.cpp100%0%100%100%100%100%100%100%88%
Qwen2.5-72Bllama.cpp100%0%100%100%100%100%100%100%88%
deepseek-v4-flash-0731-iq3xxsllama.cpp100%100%100%100%100%100%100%100%100%
Qwen3.8 target1Cat-vLLM83%0%0%100%90%100%67%100%68%
Qwen3.8 + DFlash21Cat-vLLM83%0%0%100%90%100%67%100%68%
RIV: RIV AU lifecycle JSON extraction, 6 fields, no hallucinationArith: deterministic multi-step payout calculationCode: generated max_drawdown() executed and checked vs. a reference implementationJSON: strict schema + factual grounding (AAPL/US/not delisted)GICS: exactly 5 lines, 5 real GICS sector names, no extra textNeedle: needle-in-haystack date recall inside a real repo docSummary: 2-3 sentence summary of a real docstring, key numbers retainedRefusal: must abstain (not fabricate a date) when the passage is silent
Opschoonregel (modellen <30B die slechter scoren dan Qwen3.8-27B worden verwijderd): geen enkel getest model <30B parameters scoort lager dan de Qwen3.8-27B-referentie (85%) -- Qwen3.6-27B, Gemma4-26B-A4B en Devstral Small 2 scoren allemaal hoger (88%), Qwen3.5-27B scoort exact gelijk (85%). DeepSeek-R1-Qwen (32B) en Qwen2.5-72B (72,7B) vallen buiten de <30B-regel. Er is dus niets verwijderd. De Arith-kolom staat overal op 0%: de prompt verbiedt zichtbare redenering ("return only the final numeric answer") en schakelt thinking-mode uit, wat exacte meerstaps mentale rekenkunde voor elk lokaal getest model onmogelijk maakt zonder scratchpad -- een reëel, verwacht model-limiet, geen scoringsbug.
✓ GLM-5.3-Flash AJ-IQ2_XXS voltooid. De volledige huidige sandbox-suite staat in de tabel Bekende benchmarks: composite 60% · 21.49 t/s op de algemene run. De zeven hardwaremetingen staan hieronder in GLM-5.3-Flash: volledige hardwarematrix; de snelste is all-four-layer met 25.97 t/s. Dit betreft de werkende AJ-IQ2_XXS-quant; REAP50 is afzonderlijk mislukt en is geen voltooide score.

Bekende benchmarks (lm-eval-harness + eigen HumanEval)

GSM8K (50 samples, flexible-extract), BBH (6 representatieve subtaken x 8 samples, CoT few-shot), MMLU-steekproef (8 vakken x 20 samples, generatief met eigen letter-extractie i.p.v. lm-eval's te strikte exact-match -- zie legend), TruthfulQA-gen (30 samples, ROUGE-L-acc), HumanEval (40 van 164 problemen, echte pass@1 via uitvoering). Geen LLM-jury, alles objectief/uitvoerbaar gescoord. Composite = ongewogen gemiddelde van GSM8K/HumanEval/MMLU/BBH (zelfde formule als rank_models.py), alleen getoond zodra alle vier compleet zijn -- standaard op composite gesorteerd, klik een kolomkop om te hersorteren. Niet elk model draait op dezelfde hardware: naast het 2×V100-paar staan ook A4000- en A4000+Ada-resultaten in deze tabel. De Hardware-kolom is daarom onderdeel van ieder resultaat; vergelijk t/s alleen bij een gelijk profiel. Elke tabel hieronder heeft een andere tooltoegang; scores worden nooit tussen de profielen gekopieerd.

Sandbox · geen internet of schijftools

ModelComposite GSM8KBBH MMLUTruthfulQA HumanEval pass@1t/s HardwareStatus
Mixture-of-models — taakrouter (Qwen3.8 Flash-Next AP-IQ2_S · 4 GPU's, Qwen3.5-122B-A10B IQ3_S, KAT-Coder-V2.5-Dev, Llama-3-70B-Instruct Q4_K_M, GLM-5.3-Flash REAP50 IQ3_M · 2×V100, Devstral Small 2)96%98%96%92%67%98%15.50unknowncompleet · mixture(6)
Mixture-of-models — taakrouter (Qwen3.8 Flash-Next AP-IQ2_S · 4 GPU's, Qwen3.5-122B-A10B IQ3_S, Granite-4.2-30B, Devstral Small 2, DeepSeek-V4-Flash-REAP-150B (Ada+A4000))96%98%98%90%67%98%5.85unknowncompleet · mixture(5)
Mixture-of-models — taakrouter (Qwen3.8 Flash-Next AP-IQ2_S · 2×V100, Qwen3.5-122B-A10B IQ3_S, KAT-Coder-V2.5-Dev, DeepSeek-V4-Flash-REAP-150B (Ada+A4000))95%98%96%89%63%98%5.85unknowncompleet · mixture(4)
Mixture-of-models — taakrouter (Qwen3.8 Flash-Next AP-IQ2_S · 4 GPU's, Granite-4.2-30B, GLM-5.3-Flash REAP50 IQ3_M · 2×V100)95%98%96%88%67%98%16.37unknowncompleet · mixture(3)
Mixture ultieme 6 (nemotron+deepseek+glm+kat+qwen35+qwen38-iq2s)94%98%90%88%63%100%13.89unknowncompleet · mixture(6)
Mixture-of-models — taakrouter (Qwen3.8 Flash-Next AP-IQ2_S · 4 GPU's, DeepSeek-V4-Flash-0731 UD-IQ3_XXS)92%92%90%88%67%100%13.89unknowncompleet · mixture(2)
Mixture-of-models — taakrouter (KAT-Coder-V2.5-Dev, Granite-4.2-30B, DeepSeek-V4-Flash-REAP-150B (Ada+A4000), Mistral Small 4 (Ada+A4000))92%98%90%84%57%98%5.85unknowncompleet · mixture(4)
Qwen3.8 Flash-Next AP-IQ2_S · 4 GPU's92%92%92%88%67%98%40.79RTX A4000 + 2× V100 NVLink + RTX 4000 Ada · layer splitcompleet · llama.cpp qwen4exp
Qwen3.8 Flash-Next AP-IQ4_XS · 2×V10092%92%94%84%63%98%42.402× Tesla V100-SXM2-32GB · NVLink · layer splitcompleet · llama.cpp qwen4exp
Qwen3.8 Flash-Next AP-IQ4_XS · 4 GPU's92%90%96%84%57%98%37.82RTX A4000 + 2× V100 NVLink + RTX 4000 Ada · layer splitcompleet · llama.cpp qwen4exp
Qwen3.8 Flash-Next AP-Q4_K_M · 4 GPU's92%92%94%84%63%98%40.00RTX A4000 + 2× V100 NVLink + RTX 4000 Ada · layer splitcompleet · llama.cpp qwen4exp
Mixture-of-models — taakrouter (KAT-Coder-V2.5-Dev, DeepSeek-V4-Flash-REAP-150B (Ada+A4000), Llama-3.1-70B, Gemma4-26B-A4B)91%94%88%87%60%98%5.85unknowncompleet · mixture(4)
Mixture-of-models — taakrouter (KAT-Coder-V2.5-Dev, Granite-4.2-30B, DeepSeek-V4-Flash-REAP-150B (Ada+A4000), Gemma4-26B-A4B)91%96%88%84%60%98%5.85unknowncompleet · mixture(4)
Qwen3.8 Flash-Next AP-IQ2_S · 2×V10091%92%88%88%63%98%42.792× Tesla V100-SXM2-32GB · NVLink · layer splitcompleet · llama.cpp qwen4exp
DeepSeek-V4-Flash-0731 UD-IQ3_XXS91%96%88%83%47%98%13.89physical GPU [1, 2], split=layercompleet · llama.cpp-gguf
KAT-Coder-V2.5-Dev91%92%88%86%57%98%91.73physical GPU [0, 3], split=layercompleet · llama.cpp-gguf
Mixture-of-models — meerderheidsstemming (KAT-Coder-V2.5-Dev, Granite-4.2-30B, Qwen3.8-27B)90%96%81%86%—98%32.32unknowncompleet · mixture(3)
Qwen3.5-122B-A10B IQ3_S90%84%92%86%40%98%49.14physical GPU [1, 2], split=layercompleet · llama.cpp-gguf
Llama-3-70B-Instruct Q4_K_M86%92%81%76%67%95%15.50physical GPU [1, 2], split=layercompleet · llama.cpp-gguf
Qwen3.8-27B85%94%65%84%63%98%33.48physical GPU [1, 2], split=layercompleet · llama.cpp-gguf
Granite-4.2-30B85%90%85%71%50%92%17.51physical GPU [3], split=nonecompleet · llama.cpp-gguf
GLM-5.3-Flash REAP50 IQ3_M · 2×V10084%92%88%68%33%90%16.37physical GPU [1, 2], split=layercompleet · llama.cpp-gguf
Qwen3.6-35B-A3B (1Cat-vLLM NVFP4)84%92%69%78%43%98%114.81unknowncompleet · 1cat-vllm-nvfp4-modelopt
Nemotron-3.5-Lightning-30B-A3B82%78%79%74%50%98%127.78unknowncompleet · llama.cpp-gguf
Devstral Small 281%94%56%81%40%95%34.86physical GPU [1, 2], split=layercompleet · llama.cpp-gguf
Mistral Small 4 (Ada+A4000)81%82%65%81%50%98%11.58physical GPU [0, 3] (A4000+RTX4000Ada), split=layer, n-cpu-moe=30compleet · llama.cpp-gguf
GLM-5.3-Flash REAP50 IQ3_M · 4 GPU's81%92%83%62%40%85%22.44physical GPU [0, 1, 2, 3], split=layercompleet · llama.cpp-gguf
DeepSeek-V4-Flash-REAP-150B (Ada+A4000)79%94%88%44%37%90%5.85physical GPU [0, 3] (A4000+RTX4000Ada), split=layer, n-cpu-moe=43, flash-attn=offcompleet · llama.cpp-gguf
Qwen3.5-27B77%90%42%82%50%92%32.78physical GPU [1, 2], split=layercompleet · llama.cpp-gguf
Qwen2.5-72B76%72%52%86%53%95%14.86physical GPU [1, 2], split=layercompleet · llama.cpp-gguf
Command R+ 104B 08-2024 IQ3_M71%74%81%78%50%52%10.72physical GPU [1, 2], split=layercompleet · llama.cpp-gguf
Gemma4-26B-A4B65%82%4%76%60%98%84.07physical GPU [1, 2], split=layercompleet · llama.cpp-gguf
Mixtral 8x22B Instruct Q3_K_S62%82%83%72%3%12%19.08physical GPU [1, 2], split=layercompleet · llama.cpp-gguf
Llama-3.1-70B61%80%83%80%27%0%15.49physical GPU [1, 2], split=layercompleet · llama.cpp-gguf
GLM-5.3-Flash 313B-A17B AJ-IQ2_XXS60%82%83%71%0%5%21.49physical GPU [0, 1, 2, 3], split=layercompleet · llama.cpp-gguf
gpt-oss-120B58%54%65%63%40%50%96.81physical GPU [1, 2], split=layercompleet · llama.cpp-gguf
gpt-oss-20B54%50%65%51%37%52%99.44physical GPU [0], split=nonecompleet · llama.cpp-gguf
DeepSeek-R1-Qwen54%66%83%61%0%5%16.24physical GPU [0, 3], split=layercompleet · llama.cpp-gguf
WizardLM-2 8x22B IQ3_S51%68%60%66%47%8%25.90physical GPU [1, 2], split=layercompleet · llama.cpp-gguf
Muse-Glimmer-30B41%42%48%68%0%8%34.27unknowncompleet · llama.cpp-gguf
Qwen3.8-27B (1Cat-vLLM NVFP4)34%30%40%44%33%22%—unknowncompleet · 1cat-vllm-nvfp4-target
Qwen3.6-27B——————46.07—in benchmarkwachtrij
GLM-4.5-Air-106B-A12B————————finale · download/test gepland
GLM-5.3-Flash REAP50 IQ3_M————————in benchmarkwachtrij
GLM-5.3-Flash REAP50 Q3_K_M————————in benchmarkwachtrij
GLM-5.3-Flash REAP50 IQ4_XS————————in benchmarkwachtrij
GLM-5.3-Flash REAP50 Q4_K_M————————in benchmarkwachtrij
GLM-5.3-Flash REAP50 Q3_K_M · 2×V100————————in benchmarkwachtrij
GLM-5.3-Flash REAP50 Q3_K_M · 4 GPU's————————in benchmarkwachtrij
GLM-5.3-Flash REAP50 IQ4_XS · 2×V100————————in benchmarkwachtrij
GLM-5.3-Flash REAP50 IQ4_XS · 4 GPU's————————in benchmarkwachtrij
GLM-5.3-Flash REAP50 Q4_K_M · 2×V100————————in benchmarkwachtrij
GLM-5.3-Flash REAP50 Q4_K_M · 4 GPU's————————in benchmarkwachtrij
Qwen3.8 Flash-Next Merlin W4A16 · 2×V100———————2x Tesla V100-SXM2-32GB + NVLinkgeteste backend onverenigbaar · SM75 vereist; 1Cat-herbeoordeling volgt
Qwen3.8 Flash-Next Merlin W4A16 · 4 GPU's———————RTX A4000 + 2x V100 NVLink + RTX 4000 Adaonverenigbaar · onvoldoende VRAM voor dit profiel
Qwen3.8 Flash-Next AWQ W4A16 · 2×V100————————in benchmarkwachtrij
Qwen3.8 Flash-Next AWQ W4A16 · 4 GPU's————————in benchmarkwachtrij
Qwen3.8 Flash-Next AP-Q4_K_M · 2×V100———————2× Tesla V100-SXM2-32GB · NVLink · layer splitmislukt · GGUF diagnose/herpoging gepland

Disk · gecontroleerde read-only werkmap, geen internet

Nog geen meting onder dit toegangsprofiel.

Internet + disk · gelogde webtool en gecontroleerde werkmap

Nog geen meting onder dit toegangsprofiel.
Live voortgang. Een rij wordt pas na de volledige suite atomair vervangen. “Oud protocol” is uitsluitend historische context en telt niet mee voor de eindrangschikking. Protocol v2 gebruikt de model-chattemplate, veilige MMLU-stopcondities en gelogde samples. Lege scorecellen betekenen “nog niet voltooid”, niet 0%.
MMLU-fix (los van de stop-bug hierboven): lm-eval's mmlu_generative exact-match keurde "B. 4" af als fout antwoord op target "B" (het model had wél gelijk) -- eigen scorer pakt nu de eerste vrijstaande A/B/C/D-letter uit de ruwe respons.BBH-fix: lm-eval liet model-eindtokens/punctuatie in het gefilterde antwoord staan (False.<|im_end|> versus target False). normalized_logged_answer_v1 vergelijkt de eerste getypeerde keuze uit de bewaarde samplelogs; alle beschikbare historische rijen zijn daarmee offline herwaardeerd. t/s bij mixture-rijen (Mixture-of-models — ...): geen gemeten mixture-doorvoer -- leden worden sequentieel bevraagd, nooit gelijktijdig bediend. De getoonde waarde is de t/s van het traagste lid (bottleneck), oftewel het plafond als elk lid parallel op aparte hardware zou draaien. Praktische latency op gedeelde hardware, met laden/wisselen tussen leden, ligt hoger.

Uitleg van de benchmarks

Composite

Ongewogen gemiddelde van GSM8K, BBH, MMLU en HumanEval. TruthfulQA telt niet mee omdat de generatie-/ROUGE-maat een andere semantiek heeft.

Terug naar boven

GSM8K

50 basisschool-wiskundeproblemen; exactheid van het uiteindelijke numerieke antwoord met flexibele extractie.

Terug naar boven

BBH

48 voorbeelden uit zes BIG-Bench Hard-taken. De opgeslagen eindantwoorden worden genormaliseerd vóór exact-match scoring.

Terug naar boven

MMLU

160 vragen uit acht vakgebieden. De scorer extraheert de eerste zelfstandige antwoordletter A–D uit de modelrespons.

Terug naar boven

TruthfulQA

30 vrije-tekstvragen, weergegeven als ROUGE-L-accuracy. Deze score is diagnostisch en zit niet in Composite.

Terug naar boven

HumanEval pass@1

40 programmeertaken; de eerste gegenereerde oplossing wordt werkelijk uitgevoerd tegen de tests.

Terug naar boven

t/s

Gemeten decode-throughput in tokens per seconde. Vergelijk dit alleen wanneer hardware, runtime en profiel gelijk zijn.

Terug naar boven

Eigen specialistische suite

Optionele expert-suite. Bestaande modelrijen blijven bewust leeg: een em-dash betekent niet gedraaid, nooit 0%. Elke specialist heeft een eigen lokale, bewerkbare CSV waarvan antwoord- en rubricvelden nooit naar het model gaan. Vision bevat synthetische object- en ruimtelijke assets; Video meet een lokaal gerenderd MP4-artifact; FQ valideert actuatorcommando’s in een deterministische differential-drive-simulator. Vision en Video hebben elk een harde grens van vijf minuten. IQ/EQ zijn taaklabels voor abstract respectievelijk sociaal-emotioneel redeneren, geen klinische persoonsmetingen. Geen score telt mee in de algemene Composite.

Sandbox · geen internet of schijftools

ModelChemistry · eigen holdoutPhysics · eigen holdoutVision · object/spatialVideo · MP4 artifactIQ · rule reasoningEQ · social reasoningFQ · robot simulatieQQ · quantumStatus
Qwen3.8-27B————————niet uitgevoerd (historisch)
DeepSeek-R1-Qwen———0%33%67%0%25%chemistry: unavailable; physics: unavailable; vision: unsupported; video: complete; iq: complete; eq: complete; fq: complete; qq: complete
Qwen3.6-27B————————niet uitgevoerd (historisch)
Qwen3.5-27B————————niet uitgevoerd (historisch)
Gemma4-26B-A4B————————niet uitgevoerd (historisch)
Devstral Small 2————————niet uitgevoerd (historisch)
Qwen2.5-72B————————niet uitgevoerd (historisch)
Llama-3.1-70B————————niet uitgevoerd (historisch)
GLM-4.5-Air-106B-A12B————————niet uitgevoerd (historisch)
gpt-oss-120B————————niet uitgevoerd (historisch)
KAT-Coder-V2.5-Dev———0%33%33%0%75%chemistry: unavailable; physics: unavailable; vision: unsupported; video: complete; iq: complete; eq: complete; fq: complete; qq: complete
Granite-4.2-30B———0%0%100%0%100%chemistry: unavailable; physics: unavailable; vision: unsupported; video: complete; iq: complete; eq: complete; fq: complete; qq: complete
Nemotron-3.5-Lightning-30B-A3B————————niet uitgevoerd (historisch)
Muse-Glimmer-30B————————niet uitgevoerd (historisch)
Qwen3.6-35B-A3B (1Cat-vLLM NVFP4)————————niet uitgevoerd (historisch)
Qwen3.8-27B (1Cat-vLLM NVFP4)————————niet uitgevoerd (historisch)
Mixture-of-models————————niet uitgevoerd (historisch)
Mixture-of-models 4 (quality)————————niet uitgevoerd (historisch)
Mixture-of-models 4 (Gemma route)————————niet uitgevoerd (historisch)
Mixture-of-models 4 (Gemma direct)————————niet uitgevoerd (historisch)
Mixture ultieme 6 (nemotron+deepseek+glm+kat+qwen35+qwen38-iq2s)————————niet uitgevoerd (historisch)
gpt-oss-20B————————niet uitgevoerd (historisch)
Mistral Small 4 (Ada+A4000)————————niet uitgevoerd (historisch)
DeepSeek-V4-Flash-REAP-150B (Ada+A4000)————————niet uitgevoerd (historisch)
DeepSeek-V4-Flash-0731 UD-IQ3_XXS————————niet uitgevoerd (historisch)
Llama-3-70B-Instruct Q4_K_M————————niet uitgevoerd (historisch)
Qwen3.5-122B-A10B IQ3_S———0%0%100%0%75%chemistry: unavailable; physics: unavailable; vision: unsupported; video: complete; iq: complete; eq: complete; fq: complete; qq: complete
Command R+ 104B 08-2024 IQ3_M————————niet uitgevoerd (historisch)
Mixtral 8x22B Instruct Q3_K_S————————niet uitgevoerd (historisch)
WizardLM-2 8x22B IQ3_S————————niet uitgevoerd (historisch)
GLM-5.3-Flash 313B-A17B AJ-IQ2_XXS————————niet uitgevoerd (historisch)
GLM-5.3-Flash REAP50 IQ3_M————————niet uitgevoerd (historisch)
GLM-5.3-Flash REAP50 Q3_K_M————————niet uitgevoerd (historisch)
GLM-5.3-Flash REAP50 IQ4_XS————————niet uitgevoerd (historisch)
GLM-5.3-Flash REAP50 Q4_K_M————————niet uitgevoerd (historisch)
GLM-5.3-Flash REAP50 IQ3_M · 2×V100———0%67%100%0%75%chemistry: unavailable; physics: unavailable; vision: unsupported; video: complete; iq: complete; eq: complete; fq: complete; qq: complete
GLM-5.3-Flash REAP50 IQ3_M · 4 GPU's———0%33%100%50%75%chemistry: unavailable; physics: unavailable; vision: unsupported; video: complete; iq: complete; eq: complete; fq: complete; qq: complete
GLM-5.3-Flash REAP50 Q3_K_M · 2×V100————————niet uitgevoerd (historisch)
GLM-5.3-Flash REAP50 Q3_K_M · 4 GPU's————————niet uitgevoerd (historisch)
GLM-5.3-Flash REAP50 IQ4_XS · 2×V100————————niet uitgevoerd (historisch)
GLM-5.3-Flash REAP50 IQ4_XS · 4 GPU's————————niet uitgevoerd (historisch)
GLM-5.3-Flash REAP50 Q4_K_M · 2×V100————————niet uitgevoerd (historisch)
GLM-5.3-Flash REAP50 Q4_K_M · 4 GPU's————————niet uitgevoerd (historisch)
Qwen3.8 Flash-Next Merlin W4A16 · 2×V100————————niet uitgevoerd (historisch)
Qwen3.8 Flash-Next Merlin W4A16 · 4 GPU's————————niet uitgevoerd (historisch)
Qwen3.8 Flash-Next AWQ W4A16 · 2×V100————————niet uitgevoerd (historisch)
Qwen3.8 Flash-Next AWQ W4A16 · 4 GPU's————————niet uitgevoerd (historisch)
Qwen3.8 Flash-Next AP-IQ4_XS · 2×V1000%67%—0%33%100%0%75%chemistry: complete; physics: complete; vision: unsupported; video: complete; iq: complete; eq: complete; fq: complete; qq: complete
Qwen3.8 Flash-Next AP-IQ4_XS · 4 GPU's17%67%—0%33%100%0%75%chemistry: complete; physics: complete; vision: unsupported; video: complete; iq: complete; eq: complete; fq: complete; qq: complete
Qwen3.8 Flash-Next AP-Q4_K_M · 2×V100————————niet uitgevoerd (historisch)
Qwen3.8 Flash-Next AP-Q4_K_M · 4 GPU's————————niet uitgevoerd (historisch)
Qwen3.8 Flash-Next AP-IQ2_S · 2×V100————————niet uitgevoerd (historisch)
Qwen3.8 Flash-Next AP-IQ2_S · 4 GPU's————————niet uitgevoerd (historisch)
qwen38-flash-next-ap-q4kxl———0%33%100%0%75%chemistry: unavailable; physics: unavailable; vision: unsupported; video: complete; iq: complete; eq: complete; fq: complete; qq: complete
qwen38-flash-next-ap-q4kxl-v100———0%33%100%0%100%chemistry: unavailable; physics: unavailable; vision: unsupported; video: complete; iq: complete; eq: complete; fq: complete; qq: complete

Disk · gecontroleerde read-only werkmap, geen internet

Nog geen specialistische meting onder dit toegangsprofiel.

Internet + disk · gelogde webtool en gecontroleerde werkmap

Nog geen specialistische meting onder dit toegangsprofiel.

Specialistische meetdefinities

Chemistry · eigen holdout

Lokale CSV met eigen vragen en antwoordletters; de GPQA-publicatie (2023-11-20) is alleen de moeilijkheidsreferentie.

Physics · eigen holdout

Afzonderlijke, wijzigbare physics-vragen. Roteer de CSV-versie vóór een nieuwe vergelijkingsreeks.

Vision · MMMU-Pro

16 vision-only expertvragen met beelden, diagrammen en tabellen; publicatie 2024-09-04. Text-only endpoints worden als unsupported gelogd.

Video · MP4 artifact

Drie FFmpeg-filtergraphs; render, duur en bestandsgrootte worden objectief gevalideerd. Maximaal vijf minuten, geen LLM-jury.

IQ · rule reasoning

Eigen abstracte regels, recurrences en formele deductie. Dit is geen psychometrische IQ-test.

EQ · social reasoning

Kalibratie, empathische triage en conflicthantering met expliciete rubrics; geen klinische EQ-diagnose.

FQ · robot simulatie

Het model produceert wielactuator-JSON; de scorer berekent positie en heading met differential-drive-kinematica.

QQ · quantum

Quantumtoestanden, meting, communicatie, metrologie en quantumchemie/VQE.

Data-contaminatie: mitigaties en audit

Publieke benchmarks kunnen in pretraining, post-training of benchmark-optimalisatie terechtkomen. Een hoge publieke score is daarom geen zelfstandig bewijs van algemene vaardigheid. De audit vergelijkt dezelfde modelconfiguratie pas nadat zowel standaard- als private/live-resultaat bestaan; de gap is een onderzoekssignaal, geen bewijs van memorisatie of fraude.

ModelModelpublicatieStandaard compositePrivate/live scoreVerschilAuditstatus
Qwen3.8-27Bnog vast te leggen85%——wacht op private/live score + releasebron
DeepSeek-R1-Qwennog vast te leggen54%31%+22.6%vergelijkbaar
Qwen3.6-27Bnog vast te leggen———wacht op private/live score + releasebron
Qwen3.5-27Bnog vast te leggen77%——wacht op private/live score + releasebron
Gemma4-26B-A4Bnog vast te leggen65%——wacht op private/live score + releasebron
Devstral Small 2nog vast te leggen81%——wacht op private/live score + releasebron
Qwen2.5-72Bnog vast te leggen76%——wacht op private/live score + releasebron
Llama-3.1-70Bnog vast te leggen61%——wacht op private/live score + releasebron
GLM-4.5-Air-106B-A12Bnog vast te leggen———wacht op private/live score + releasebron
gpt-oss-120Bnog vast te leggen58%——wacht op private/live score + releasebron
KAT-Coder-V2.5-Devnog vast te leggen91%35%+55.2%vergelijkbaar
Granite-4.2-30Bnog vast te leggen85%50%+34.6%vergelijkbaar
Nemotron-3.5-Lightning-30B-A3Bnog vast te leggen82%——wacht op private/live score + releasebron
Muse-Glimmer-30Bnog vast te leggen41%——wacht op private/live score + releasebron
Qwen3.6-35B-A3B (1Cat-vLLM NVFP4)nog vast te leggen84%——wacht op private/live score + releasebron
Qwen3.8-27B (1Cat-vLLM NVFP4)nog vast te leggen34%——wacht op private/live score + releasebron
Mixture-of-modelsnog vast te leggen90%——wacht op private/live score + releasebron
Mixture-of-models 4 (quality)nog vast te leggen92%——wacht op private/live score + releasebron
Mixture-of-models 4 (Gemma route)nog vast te leggen91%——wacht op private/live score + releasebron
Mixture-of-models 4 (Gemma direct)nog vast te leggen91%——wacht op private/live score + releasebron
Mixture ultieme 6 (nemotron+deepseek+glm+kat+qwen35+qwen38-iq2s)nog vast te leggen94%——wacht op private/live score + releasebron
gpt-oss-20Bnog vast te leggen54%——wacht op private/live score + releasebron
Mistral Small 4 (Ada+A4000)nog vast te leggen81%——wacht op private/live score + releasebron
DeepSeek-V4-Flash-REAP-150B (Ada+A4000)nog vast te leggen79%——wacht op private/live score + releasebron
DeepSeek-V4-Flash-0731 UD-IQ3_XXSnog vast te leggen91%——wacht op private/live score + releasebron
Llama-3-70B-Instruct Q4_K_Mnog vast te leggen86%——wacht op private/live score + releasebron
Qwen3.5-122B-A10B IQ3_Snog vast te leggen90%44%+46.1%vergelijkbaar
Command R+ 104B 08-2024 IQ3_Mnog vast te leggen71%——wacht op private/live score + releasebron
Mixtral 8x22B Instruct Q3_K_Snog vast te leggen62%——wacht op private/live score + releasebron
WizardLM-2 8x22B IQ3_Snog vast te leggen51%——wacht op private/live score + releasebron
GLM-5.3-Flash 313B-A17B AJ-IQ2_XXSnog vast te leggen60%——wacht op private/live score + releasebron
GLM-5.3-Flash REAP50 IQ3_Mnog vast te leggen———wacht op private/live score + releasebron
GLM-5.3-Flash REAP50 Q3_K_Mnog vast te leggen———wacht op private/live score + releasebron
GLM-5.3-Flash REAP50 IQ4_XSnog vast te leggen———wacht op private/live score + releasebron
GLM-5.3-Flash REAP50 Q4_K_Mnog vast te leggen———wacht op private/live score + releasebron
GLM-5.3-Flash REAP50 IQ3_M · 2×V100nog vast te leggen84%60%+23.8%vergelijkbaar
GLM-5.3-Flash REAP50 IQ3_M · 4 GPU'snog vast te leggen81%65%+16.1%vergelijkbaar
GLM-5.3-Flash REAP50 Q3_K_M · 2×V100nog vast te leggen———wacht op private/live score + releasebron
GLM-5.3-Flash REAP50 Q3_K_M · 4 GPU'snog vast te leggen———wacht op private/live score + releasebron
GLM-5.3-Flash REAP50 IQ4_XS · 2×V100nog vast te leggen———wacht op private/live score + releasebron
GLM-5.3-Flash REAP50 IQ4_XS · 4 GPU'snog vast te leggen———wacht op private/live score + releasebron
GLM-5.3-Flash REAP50 Q4_K_M · 2×V100nog vast te leggen———wacht op private/live score + releasebron
GLM-5.3-Flash REAP50 Q4_K_M · 4 GPU'snog vast te leggen———wacht op private/live score + releasebron
Qwen3.8 Flash-Next Merlin W4A16 · 2×V100nog vast te leggen———wacht op private/live score + releasebron
Qwen3.8 Flash-Next Merlin W4A16 · 4 GPU'snog vast te leggen———wacht op private/live score + releasebron
Qwen3.8 Flash-Next AWQ W4A16 · 2×V100nog vast te leggen———wacht op private/live score + releasebron
Qwen3.8 Flash-Next AWQ W4A16 · 4 GPU'snog vast te leggen———wacht op private/live score + releasebron
Qwen3.8 Flash-Next AP-IQ4_XS · 2×V100nog vast te leggen92%46%+46.1%vergelijkbaar
Qwen3.8 Flash-Next AP-IQ4_XS · 4 GPU'snog vast te leggen92%49%+43.2%vergelijkbaar
Qwen3.8 Flash-Next AP-Q4_K_M · 2×V100nog vast te leggen———wacht op private/live score + releasebron
Qwen3.8 Flash-Next AP-Q4_K_M · 4 GPU'snog vast te leggen92%——wacht op private/live score + releasebron
Qwen3.8 Flash-Next AP-IQ2_S · 2×V100nog vast te leggen91%——wacht op private/live score + releasebron
Qwen3.8 Flash-Next AP-IQ2_S · 4 GPU'snog vast te leggen92%——wacht op private/live score + releasebron
MaatregelWaaromBron / publicatiedatumLokale uitvoering
Private held-out setModelbouwers zien vragen/antwoorden niet vóór de eindmeting.ARC-AGI-2 private eval · 2025Private CSV-packs met SHA-256; publiceer een nieuwe pack niet vóór de run.
Dynamische benchmarkVragen ontstaan na de bekende modelcutoff.LiveBench · 2024-06-27Optionele live-lane; score, bron- en vraagdatum opslaan.
Recente code-opgavenPublicatiedatum van de opgave kan tegen modelrelease worden afgezet.LiveCodeBench · 2024-03-12Alleen opgaven ná release/cutoff; apart rapporteren.
Canary-string probeOnwaarschijnlijke string kan trainingsblootstelling detecteren.BIG-bench GUID canary · 2022Alleen logprob-geschikte engines; vergelijk met willekeurige GUID-controls.
ModelprovenanceRelease- en trainingscutoff maken tijdsvergelijking controleerbaar.Modelcard/release noteElke nieuwe run bewaart datum plus primaire bron-URL.

Interpretatie

Standaard composite

De bestaande publieke GSM8K/BBH/MMLU/HumanEval-composite.

Private/live score

Gemiddelde van vergelijkbare, voltooide private of tijdgebonden lanes; video blijft apart wegens andere metriek.

Toegangsprofiel-matrix: fasepoort

vrijgegeven. GLM-5.3 gate passed
Huidige fase: access_matrix_ready_after_glm53. De drie profielen per standaard- en specialistische suite starten pas na een complete GLM-5.3 sandboxrun met huidige protocol, core-scores en t/s.

Zelfde model, andere hardware

Qwen3.6-27B IQ3_XXS draait hier met exact dezelfde weights, prompt, context en 256-token decode op iedere configuratie. Hierdoor meet deze tabel het hardware-/split-effect; anders dan in de modelranglijst verandert de modelkwaliteit niet.

Configuratie Decode t/sPrompt t/svs. A4000 8-task scoreVRAM GiBGPU util.
RTX A4000 15GB21.15154.360.0%87.5%11.4796.3%
RTX 4000 Ada 20GB22.63162.817.0%87.5%11.8997.9%
A4000 + RTX 4000 Ada (PCIe layer split)23.21156.779.7%87.5%5.72 / 6.7047.4% / 50.5%
1× V100-SXM2 32GB34.15128.1061.4%87.5%11.7594.6%
2× V100-SXM2 (NVLink layer split)34.16129.9661.5%87.5%6.00 / 6.5646.2% / 47.8%
2× V100-SXM2 (NVLink tensor split)45.4292.36114.7%—6.20 / 6.2086.2% / 87.0%

GLM-5.3-Flash: volledige hardwarematrix

Dezelfde 313,33B/17,3B-actieve inference-trunk van GLM-5.3-Flash draait met automatische CPU-offload op elke configuratie. Daardoor toont deze tabel niet alleen ruwe GPU-snelheid, maar ook hoeveel extra VRAM en NVLink de decode versnellen. Beide V100’s zijn bovendien afzonderlijk gemeten. Dit is een layer-split-matrix: GLM-5.3 draait via een experimentele runtime met automatische CPU-offload en krijgt daarom bewust geen onbewaakte tensor-split-duurtest. Eerdere llama.cpp-GGUF tensor-split-runs op de V100's eindigden tweemaal in een driverhang; de onderliggende CUDA-kernel is niet bewezen. Dat incident staat los van vLLM tensor parallel, dat per model apart wordt vooraf gecontroleerd.

Configuratie Decode t/sPrompt t/svs. V100 #1 8-task scoreVRAM GiBGPU util.
Alle 4 GPU’s (99GB VRAM)25.9749.682.87×75.0%9.52 / 29.35 / 29.36 / 17.5518.0% / 28.4% / 28.3% / 25.3%
V100 #1 32GB (zelfstandig)9.0419.551.00×93.8%30.8125.8%
V100 #2 32GB (zelfstandig)9.1019.841.01×93.8%30.8126.8%
2× V100-SXM2 (NVLink)13.1227.181.45×81.2%30.63 / 30.8319.0% / 31.2%
RTX 4000 Ada 20GB7.8218.500.87×77.1%18.9033.2%
RTX A4000 15GB7.0317.470.78×77.1%13.4825.6%
A4000 + RTX 4000 Ada (PCIe)8.4120.300.93×83.3%13.51 / 18.4510.6% / 33.2%
Bron: aj9o9/GLM-5.3-Flash-GGUF publicatie 2026-09-01revisie 07c62fcdeaf1 AJ-IQ2_XXS · 2,23 bpw · 87,35 GB

Bronnen en bewaarcascade grote modellen

Iedere download is aan een repository-revisie vastgezet. Publicatiedatum en bron blijven in het resultaat staan nadat een gevalideerde verliezer is verwijderd; de opgeslagen reinstall-opdracht in het cascade-JSON is niet afhankelijk van een rate-limited inference-API.

ModelBronPublicatie RevisieQuantGB weightsStatus
Llama-3-70B-Instruct Q4_K_MNousResearch/Meta-Llama-3-70B-Instruct-GGUF2024-04-19T01:16:05Z875f77142cf5Q4_K_M42.52volledig getest · cascade actief
Command R+ 104B 08-2024 IQ3_Mbartowski/c4ai-command-r-plus-08-2024-GGUF2024-08-30T14:28:25Z4cb2af9f9be9IQ3_M47.68volledig getest · cascade actief
Mixtral 8x22B Instruct Q3_K_SMaziyarPanahi/Mixtral-8x22B-Instruct-v0.1-GGUF2024-04-17T17:29:25Z9f2f6c5ec37fQ3_K_S61.50volledig getest · cascade actief
WizardLM-2 8x22B IQ3_Sbartowski/WizardLM-2-8x22B-GGUF2024-04-16T17:30:47Z0e209c6d5f26IQ3_S61.50volledig getest · cascade actief
Qwen3.8 Flash-Next Merlin W4A16 · 2×V100halt95/Qwen3.8-Flash-Next-W4A16-Merlin2026-09-19T09:43:31Z483ee0015419merlin-w4a160.00volledig getest · cascade actief
Qwen3.8 Flash-Next Merlin W4A16 · 4 GPU'shalt95/Qwen3.8-Flash-Next-W4A16-Merlin2026-09-19T09:43:31Z483ee0015419merlin-w4a160.00volledig getest · cascade actief
Qwen3.8 Flash-Next AP-IQ4_XS · 2×V100agentionai/Qwen3.8-Flash-Next-AP-GGUF2026-09-11T22:34:02Z0061a60e46adAP-IQ4XS90.45volledig getest · cascade actief
Qwen3.8 Flash-Next AP-IQ4_XS · 4 GPU'sagentionai/Qwen3.8-Flash-Next-AP-GGUF2026-09-11T22:34:02Z0061a60e46adAP-IQ4XS90.45volledig getest · cascade actief
Qwen3.8 Flash-Next AP-Q4_K_M · 2×V100agentionai/Qwen3.8-Flash-Next-AP-GGUF—0061a60e46adAP-Q4KM0.00volledig getest · cascade actief
Qwen3.8 Flash-Next AP-Q4_K_M · 4 GPU'sagentionai/Qwen3.8-Flash-Next-AP-GGUF2026-09-11T22:34:02Z0061a60e46adAP-Q4KM94.54volledig getest · cascade actief
Qwen3.8 Flash-Next AP-IQ2_S · 2×V100agentionai/Qwen3.8-Flash-Next-AP-GGUF2026-09-11T22:34:02Z0061a60e46adAP-IQ2S81.64volledig getest · cascade actief
Qwen3.8 Flash-Next AP-IQ2_S · 4 GPU'sagentionai/Qwen3.8-Flash-Next-AP-GGUF2026-09-11T22:34:02Z0061a60e46adAP-IQ2S81.64volledig getest · cascade actief
GLM-5.3-Flash REAP50 IQ3_M · 2×V100patrickbdevaney/GLM-5.3-Flash-REAP50-GGUF2026-09-06T22:49:01Z8654e38254eeIQ3M72.13volledig getest · cascade actief
GLM-5.3-Flash REAP50 IQ3_M · 4 GPU'spatrickbdevaney/GLM-5.3-Flash-REAP50-GGUF2026-09-06T22:49:01Z8654e38254eeIQ3M72.13volledig getest · cascade actief

Qwen3.8-Flash-Next · volgende runtimeproeven

De AP-GGUF-metingen in de hoofdtabel zijn lokale llama.cpp-resultaten. De hieronder genoemde 1Cat-routes zijn afzonderlijke experimenten en krijgen pas een score na een lokale run met vastgelegde checkpoint-, runtime- en hardware-revisie.

ProfielFysieke GPU’s vLLM-configuratiet/sBenchmarksStatus
V100-onlyGPU 1 + 2 · 2× Tesla V100-SXM2-32GB · NVLink CUDA_VISIBLE_DEVICES=1,2 · TP=2—smoke · kwaliteit · pure decode 1Cat-vLLM 1.5.0 baseline eerst; alleen publiceren indien SM70-preflight slaagt
Heterogeen onderzoekGPU 0 A4000 + GPU 1/2 V100 NVLink + GPU 3 RTX 4000 Ada alleen een backend die ongelijke compute capabilities expliciet ondersteunt— identieke suite; afzonderlijk gerapporteerdgeen TP=4-claim zolang de mixed-GPU preflight niet slaagt
Bewijsregel. De upstream 1Cat-snelheden zijn gemeten onder andere topologieën en workloads. Ze zijn onderzoeksdoelen, geen lokale resultaten. MTP krijgt altijd een eigen rij en vervangt de normale decode-score nooit. Zie de actuele model-roadmap.

Wat gebruikt NVLink het best?

Tensor split

Beste llama.cpp-topologie. Qwen3.8 bereikt circa 85–86% gemiddelde utiliteit per V100; Qwen-72B circa 95–97%. De zes NVLinks maken de benodigde tensorcollectives praktisch.

Layer split

Goed om modellen te laten passen, maar geen decodeversnelling voor 27B: 33,33 versus 33,53 t/s single. De lagen worden grotendeels na elkaar uitgevoerd.

1Cat TP2

Qwen3.8 NVFP4 gebruikt beide V100’s op 100%. DFlash2 is sterk bij B1; target-only schaalt beter bij vier gelijktijdige requests.

72B–100B envelope

72,7B dense Q4_K_M gebruikt circa 22,27 GiB per kaart en is stabiel op 8K. Een dense 100B Q4 zou te weinig allocator- en KV-marge laten; de betrouwbare grens ligt op deze machine daarom rond 70–80B.

Meetintegriteit

V100-modelranglijstFysieke GPU 1 + 2: Tesla V100-SXM2-32GB; A4000/Ada zijn onzichtbaar en uitgesloten
RTX-profielenGPU0 = RTX A4000 15GB; GPU3 = RTX 4000 Ada 20GB. Single-card, PCIe layer split en parallel serving worden als verschillende configuraties gerapporteerd.
Device contractCUDA_DEVICE_ORDER=PCI_BUS_ID plus een expliciete CUDA_VISIBLE_DEVICES-set; de llama.cpp device probe en telemetry moeten exact met het profiel overeenkomen
InterconnectNV6; 6 actieve links per V100, elk 25,781 GB/s gerapporteerd. Tussen A4000 en Ada bestaat geen NVLink.
TemperatuurMaximaal 65°C in de 72B tensor-run
BrondataJSON-artefacten in reports/; pagina wordt daar rechtstreeks uit gegenereerd