Qwen3.8 target
Het model draait alleen, zonder hulpmodel. Elke token komt rechtstreeks uit één forward pass van Qwen3.8 zelf.
Terug naar bovenEen reproduceerbare vergelijking van lokale modellen en hardwareconfiguraties: het 2×V100-SXM2 NVLink-paar, een RTX A4000, een RTX 4000 Ada en beide RTX-kaarten als onafhankelijke parallel-servinglaag. Iedere rij bewaart de werkelijk zichtbare fysieke GPU’s.
Decode-t/s van llama.cpp en wall-output-t/s van 1Cat zijn apart gemeten; batch-4 is aggregaat. RIV is een brongebonden zesveldentest, geen algemene modelaccuracy.
| Model | Engine | Profiel | Output t/s | Prompt t/s | Qwen3.8 speedup | RIV | VRAM GiB | GPU util. |
|---|---|---|---|---|---|---|---|---|
| Qwen3.8-27B27B | llama.cppQ4_K_M | single-v100 | 33.53 | 125.88 | 1.00× | 5/6 | 15.42 | 91.3% |
| Qwen3.8-27B27B | llama.cppQ4_K_M | dual-layer | 33.33 | 126.21 | 0.99× | 5/6 | 7.57 / 8.64 | 45.1% / 48.5% |
| Qwen3.8-27B27B | llama.cppQ4_K_M | dual-tensor | 44.87 | 95.94 | 1.34× | 5/6 | 8.04 / 8.04 | 86.0% / 85.3% |
| DeepSeek-R1-Qwen32B | llama.cppQ4_K_M | dual-tensor | 44.12 | 211.18 | — | 5/6 | 10.34 / 10.34 | 90.0% / 93.0% |
| Qwen3.6-27B27B | llama.cppIQ3_XXS | dual-tensor | 45.42 | 92.36 | — | 6/6 | 6.20 / 6.20 | 86.2% / 87.0% |
| Qwen3.5-27B27B | llama.cppQ4_K_M | dual-tensor | 44.96 | 95.92 | — | 5/6 | 8.24 / 8.24 | 86.8% / 86.7% |
| Gemma4-26B-A4B26B / ~4B active | llama.cppQ4_K_M | dual-tensor | 77.24 | 285.01 | — | 6/6 | 8.67 / 8.96 | 82.5% / 80.2% |
| Devstral Small 224B | llama.cppQ4_K_M | dual-tensor | 46.43 | 338.44 | — | 6/6 | 7.64 / 7.64 | 69.9% / 69.4% |
| Qwen2.5-72B72.7B dense | llama.cppQ4_K_M | dual-layer | 14.84 | 132.92 | — | 6/6 | 21.98 / 21.97 | 50.2% / 48.5% |
| Qwen2.5-72B72.7B dense | llama.cppQ4_K_M | dual-tensor | 24.29 | 140.25 | — | 6/6 | 21.75 / 21.75 | 95.2% / 96.7% |
| Qwen3.8 target27B | 1Cat-vLLM 1.5NVFP4 | TP2 / 8K / B1 | 48.85 | — | — | 5/6 | 25.00 / 25.00 | 100% / 100% |
| Qwen3.8 + DFlash227B | 1Cat-vLLM 1.5NVFP4 | TP2 / 8K / B1 | 81.59 | — | — | 5/6 | 25.46 / 25.46 | 100% / 100% |
| Qwen3.8 target27B | 1Cat-vLLM 1.5NVFP4 | TP2 / 8K / B4 | 183.51 | — | — | 5/6 | 25.14 / 25.14 | 100% / 100% |
| Qwen3.8 + DFlash227B | 1Cat-vLLM 1.5NVFP4 | TP2 / 8K / B4 | 156.60 | — | — | 5/6 | 24.61 / 24.61 | 100% / 100% |
Het model draait alleen, zonder hulpmodel. Elke token komt rechtstreeks uit één forward pass van Qwen3.8 zelf.
Terug naar bovenSpeculative decoding: een klein draft-model (DFlash2) stelt meerdere tokens tegelijk voor, die Qwen3.8 in één stap verifieert/accepteert. Bij lage gelijktijdigheid (B1) verlaagt dit de latency per request merkbaar; bij hoge gelijktijdigheid (B4) verdwijnt dat voordeel omdat de GPU dan toch al vol staat met werk van andere requests.
Terug naar bovenEén gelijktijdig verzoek: meet single-stream latency/doorvoer, het scenario van één interactieve gebruiker die op antwoord wacht.
Terug naar bovenVier gelijktijdige verzoeken: meet aggregate doorvoer onder concurrency, het scenario van meerdere gebruikers of achtergrondtaken tegelijk.
Terug naar bovenElke balk is een werkelijk gemeten configuratie, niet een afgeleide schatting. Het onderschrift onder de modelnaam vermeldt steeds de fysieke GPU’s. Aggregate 2 requests telt twee gelijktijdige endpoints op en is dus capaciteit, geen snelheid van één model. De brede tabel erboven bevat de bijbehorende prompt-snelheid, VRAM en GPU-utilisatie.
Elke taak levert een objectieve, programmatisch gecontroleerde score 0-100% op -- geen LLM-jury. Alle 7 lokale modellen zijn hierop getest op de dual-tensor 2xV100-configuratie (GPU 0/3 uitgesloten).
| Model | RIV | Arith | Code | JSON | GICS | Needle | Summary | Refusal | Gemiddeld |
|---|---|---|---|---|---|---|---|---|---|
| qwen38-flash-next-ap-iq2sllama.cpp | 100% | 0% | 100% | 100% | 100% | 100% | 100% | 100% | 88% |
| qwen38-flash-next-ap-iq2sllama.cpp | 83% | 0% | 100% | 100% | 100% | 100% | 100% | 100% | 85% |
| qwen38-flash-next-ap-iq4xsllama.cpp | 83% | 0% | 100% | 100% | 100% | 100% | 100% | 100% | 85% |
| qwen38-flash-next-ap-iq4xsllama.cpp | 83% | 0% | 100% | 100% | 100% | 100% | 100% | 100% | 85% |
| Qwen3.8-27Bllama.cpp | 83% | 0% | 100% | 100% | 100% | 100% | 100% | 100% | 85% |
| DeepSeek-R1-Qwenllama.cpp | 83% | 0% | 0% | 0% | 0% | 100% | 67% | 50% | 38% |
| Qwen3.6-27Bllama.cpp | 100% | 0% | 100% | 100% | 100% | 100% | 100% | 100% | 88% |
| Qwen3.5-27Bllama.cpp | 83% | 0% | 100% | 100% | 100% | 100% | 100% | 100% | 85% |
| Gemma4-26B-A4Bllama.cpp | 100% | 0% | 100% | 100% | 100% | 100% | 100% | 100% | 88% |
| Devstral Small 2llama.cpp | 100% | 0% | 100% | 100% | 100% | 100% | 100% | 100% | 88% |
| Qwen2.5-72Bllama.cpp | 100% | 0% | 100% | 100% | 100% | 100% | 100% | 100% | 88% |
| deepseek-v4-flash-0731-iq3xxsllama.cpp | 100% | 100% | 100% | 100% | 100% | 100% | 100% | 100% | 100% |
| Qwen3.8 target1Cat-vLLM | 83% | 0% | 0% | 100% | 90% | 100% | 67% | 100% | 68% |
| Qwen3.8 + DFlash21Cat-vLLM | 83% | 0% | 0% | 100% | 90% | 100% | 67% | 100% | 68% |
GSM8K (50 samples, flexible-extract), BBH (6 representatieve subtaken x 8 samples,
CoT few-shot), MMLU-steekproef (8 vakken x 20 samples, generatief met eigen
letter-extractie i.p.v. lm-eval's te strikte exact-match -- zie legend), TruthfulQA-gen
(30 samples, ROUGE-L-acc), HumanEval (40 van 164 problemen, echte pass@1 via
uitvoering). Geen LLM-jury, alles objectief/uitvoerbaar gescoord. Composite = ongewogen
gemiddelde van GSM8K/HumanEval/MMLU/BBH (zelfde formule als rank_models.py),
alleen getoond zodra alle vier compleet zijn -- standaard op composite gesorteerd,
klik een kolomkop om te hersorteren. Niet elk model draait op dezelfde hardware: naast
het 2×V100-paar staan ook A4000- en A4000+Ada-resultaten in deze tabel. De Hardware-kolom
is daarom onderdeel van ieder resultaat; vergelijk t/s alleen bij een gelijk profiel. Elke tabel hieronder heeft een
andere tooltoegang; scores worden nooit tussen de profielen gekopieerd.
| Model | Composite | GSM8K | BBH | MMLU | TruthfulQA | HumanEval pass@1 | t/s | Hardware | Status |
|---|---|---|---|---|---|---|---|---|---|
| Mixture-of-models — taakrouter (Qwen3.8 Flash-Next AP-IQ2_S · 4 GPU's, Qwen3.5-122B-A10B IQ3_S, KAT-Coder-V2.5-Dev, Llama-3-70B-Instruct Q4_K_M, GLM-5.3-Flash REAP50 IQ3_M · 2×V100, Devstral Small 2) | 96% | 98% | 96% | 92% | 67% | 98% | 15.50 | unknown | compleet · mixture(6) |
| Mixture-of-models — taakrouter (Qwen3.8 Flash-Next AP-IQ2_S · 4 GPU's, Qwen3.5-122B-A10B IQ3_S, Granite-4.2-30B, Devstral Small 2, DeepSeek-V4-Flash-REAP-150B (Ada+A4000)) | 96% | 98% | 98% | 90% | 67% | 98% | 5.85 | unknown | compleet · mixture(5) |
| Mixture-of-models — taakrouter (Qwen3.8 Flash-Next AP-IQ2_S · 2×V100, Qwen3.5-122B-A10B IQ3_S, KAT-Coder-V2.5-Dev, DeepSeek-V4-Flash-REAP-150B (Ada+A4000)) | 95% | 98% | 96% | 89% | 63% | 98% | 5.85 | unknown | compleet · mixture(4) |
| Mixture-of-models — taakrouter (Qwen3.8 Flash-Next AP-IQ2_S · 4 GPU's, Granite-4.2-30B, GLM-5.3-Flash REAP50 IQ3_M · 2×V100) | 95% | 98% | 96% | 88% | 67% | 98% | 16.37 | unknown | compleet · mixture(3) |
| Mixture ultieme 6 (nemotron+deepseek+glm+kat+qwen35+qwen38-iq2s) | 94% | 98% | 90% | 88% | 63% | 100% | 13.89 | unknown | compleet · mixture(6) |
| Mixture-of-models — taakrouter (Qwen3.8 Flash-Next AP-IQ2_S · 4 GPU's, DeepSeek-V4-Flash-0731 UD-IQ3_XXS) | 92% | 92% | 90% | 88% | 67% | 100% | 13.89 | unknown | compleet · mixture(2) |
| Mixture-of-models — taakrouter (KAT-Coder-V2.5-Dev, Granite-4.2-30B, DeepSeek-V4-Flash-REAP-150B (Ada+A4000), Mistral Small 4 (Ada+A4000)) | 92% | 98% | 90% | 84% | 57% | 98% | 5.85 | unknown | compleet · mixture(4) |
| Qwen3.8 Flash-Next AP-IQ2_S · 4 GPU's | 92% | 92% | 92% | 88% | 67% | 98% | 40.79 | RTX A4000 + 2× V100 NVLink + RTX 4000 Ada · layer split | compleet · llama.cpp qwen4exp |
| Qwen3.8 Flash-Next AP-IQ4_XS · 2×V100 | 92% | 92% | 94% | 84% | 63% | 98% | 42.40 | 2× Tesla V100-SXM2-32GB · NVLink · layer split | compleet · llama.cpp qwen4exp |
| Qwen3.8 Flash-Next AP-IQ4_XS · 4 GPU's | 92% | 90% | 96% | 84% | 57% | 98% | 37.82 | RTX A4000 + 2× V100 NVLink + RTX 4000 Ada · layer split | compleet · llama.cpp qwen4exp |
| Qwen3.8 Flash-Next AP-Q4_K_M · 4 GPU's | 92% | 92% | 94% | 84% | 63% | 98% | 40.00 | RTX A4000 + 2× V100 NVLink + RTX 4000 Ada · layer split | compleet · llama.cpp qwen4exp |
| Mixture-of-models — taakrouter (KAT-Coder-V2.5-Dev, DeepSeek-V4-Flash-REAP-150B (Ada+A4000), Llama-3.1-70B, Gemma4-26B-A4B) | 91% | 94% | 88% | 87% | 60% | 98% | 5.85 | unknown | compleet · mixture(4) |
| Mixture-of-models — taakrouter (KAT-Coder-V2.5-Dev, Granite-4.2-30B, DeepSeek-V4-Flash-REAP-150B (Ada+A4000), Gemma4-26B-A4B) | 91% | 96% | 88% | 84% | 60% | 98% | 5.85 | unknown | compleet · mixture(4) |
| Qwen3.8 Flash-Next AP-IQ2_S · 2×V100 | 91% | 92% | 88% | 88% | 63% | 98% | 42.79 | 2× Tesla V100-SXM2-32GB · NVLink · layer split | compleet · llama.cpp qwen4exp |
| DeepSeek-V4-Flash-0731 UD-IQ3_XXS | 91% | 96% | 88% | 83% | 47% | 98% | 13.89 | physical GPU [1, 2], split=layer | compleet · llama.cpp-gguf |
| KAT-Coder-V2.5-Dev | 91% | 92% | 88% | 86% | 57% | 98% | 91.73 | physical GPU [0, 3], split=layer | compleet · llama.cpp-gguf |
| Mixture-of-models — meerderheidsstemming (KAT-Coder-V2.5-Dev, Granite-4.2-30B, Qwen3.8-27B) | 90% | 96% | 81% | 86% | — | 98% | 32.32 | unknown | compleet · mixture(3) |
| Qwen3.5-122B-A10B IQ3_S | 90% | 84% | 92% | 86% | 40% | 98% | 49.14 | physical GPU [1, 2], split=layer | compleet · llama.cpp-gguf |
| Llama-3-70B-Instruct Q4_K_M | 86% | 92% | 81% | 76% | 67% | 95% | 15.50 | physical GPU [1, 2], split=layer | compleet · llama.cpp-gguf |
| Qwen3.8-27B | 85% | 94% | 65% | 84% | 63% | 98% | 33.48 | physical GPU [1, 2], split=layer | compleet · llama.cpp-gguf |
| Granite-4.2-30B | 85% | 90% | 85% | 71% | 50% | 92% | 17.51 | physical GPU [3], split=none | compleet · llama.cpp-gguf |
| GLM-5.3-Flash REAP50 IQ3_M · 2×V100 | 84% | 92% | 88% | 68% | 33% | 90% | 16.37 | physical GPU [1, 2], split=layer | compleet · llama.cpp-gguf |
| Qwen3.6-35B-A3B (1Cat-vLLM NVFP4) | 84% | 92% | 69% | 78% | 43% | 98% | 114.81 | unknown | compleet · 1cat-vllm-nvfp4-modelopt |
| Nemotron-3.5-Lightning-30B-A3B | 82% | 78% | 79% | 74% | 50% | 98% | 127.78 | unknown | compleet · llama.cpp-gguf |
| Devstral Small 2 | 81% | 94% | 56% | 81% | 40% | 95% | 34.86 | physical GPU [1, 2], split=layer | compleet · llama.cpp-gguf |
| Mistral Small 4 (Ada+A4000) | 81% | 82% | 65% | 81% | 50% | 98% | 11.58 | physical GPU [0, 3] (A4000+RTX4000Ada), split=layer, n-cpu-moe=30 | compleet · llama.cpp-gguf |
| GLM-5.3-Flash REAP50 IQ3_M · 4 GPU's | 81% | 92% | 83% | 62% | 40% | 85% | 22.44 | physical GPU [0, 1, 2, 3], split=layer | compleet · llama.cpp-gguf |
| DeepSeek-V4-Flash-REAP-150B (Ada+A4000) | 79% | 94% | 88% | 44% | 37% | 90% | 5.85 | physical GPU [0, 3] (A4000+RTX4000Ada), split=layer, n-cpu-moe=43, flash-attn=off | compleet · llama.cpp-gguf |
| Qwen3.5-27B | 77% | 90% | 42% | 82% | 50% | 92% | 32.78 | physical GPU [1, 2], split=layer | compleet · llama.cpp-gguf |
| Qwen2.5-72B | 76% | 72% | 52% | 86% | 53% | 95% | 14.86 | physical GPU [1, 2], split=layer | compleet · llama.cpp-gguf |
| Command R+ 104B 08-2024 IQ3_M | 71% | 74% | 81% | 78% | 50% | 52% | 10.72 | physical GPU [1, 2], split=layer | compleet · llama.cpp-gguf |
| Gemma4-26B-A4B | 65% | 82% | 4% | 76% | 60% | 98% | 84.07 | physical GPU [1, 2], split=layer | compleet · llama.cpp-gguf |
| Mixtral 8x22B Instruct Q3_K_S | 62% | 82% | 83% | 72% | 3% | 12% | 19.08 | physical GPU [1, 2], split=layer | compleet · llama.cpp-gguf |
| Llama-3.1-70B | 61% | 80% | 83% | 80% | 27% | 0% | 15.49 | physical GPU [1, 2], split=layer | compleet · llama.cpp-gguf |
| GLM-5.3-Flash 313B-A17B AJ-IQ2_XXS | 60% | 82% | 83% | 71% | 0% | 5% | 21.49 | physical GPU [0, 1, 2, 3], split=layer | compleet · llama.cpp-gguf |
| gpt-oss-120B | 58% | 54% | 65% | 63% | 40% | 50% | 96.81 | physical GPU [1, 2], split=layer | compleet · llama.cpp-gguf |
| gpt-oss-20B | 54% | 50% | 65% | 51% | 37% | 52% | 99.44 | physical GPU [0], split=none | compleet · llama.cpp-gguf |
| DeepSeek-R1-Qwen | 54% | 66% | 83% | 61% | 0% | 5% | 16.24 | physical GPU [0, 3], split=layer | compleet · llama.cpp-gguf |
| WizardLM-2 8x22B IQ3_S | 51% | 68% | 60% | 66% | 47% | 8% | 25.90 | physical GPU [1, 2], split=layer | compleet · llama.cpp-gguf |
| Muse-Glimmer-30B | 41% | 42% | 48% | 68% | 0% | 8% | 34.27 | unknown | compleet · llama.cpp-gguf |
| Qwen3.8-27B (1Cat-vLLM NVFP4) | 34% | 30% | 40% | 44% | 33% | 22% | — | unknown | compleet · 1cat-vllm-nvfp4-target |
| Qwen3.6-27B | — | — | — | — | — | — | 46.07 | — | in benchmarkwachtrij |
| GLM-4.5-Air-106B-A12B | — | — | — | — | — | — | — | — | finale · download/test gepland |
| GLM-5.3-Flash REAP50 IQ3_M | — | — | — | — | — | — | — | — | in benchmarkwachtrij |
| GLM-5.3-Flash REAP50 Q3_K_M | — | — | — | — | — | — | — | — | in benchmarkwachtrij |
| GLM-5.3-Flash REAP50 IQ4_XS | — | — | — | — | — | — | — | — | in benchmarkwachtrij |
| GLM-5.3-Flash REAP50 Q4_K_M | — | — | — | — | — | — | — | — | in benchmarkwachtrij |
| GLM-5.3-Flash REAP50 Q3_K_M · 2×V100 | — | — | — | — | — | — | — | — | in benchmarkwachtrij |
| GLM-5.3-Flash REAP50 Q3_K_M · 4 GPU's | — | — | — | — | — | — | — | — | in benchmarkwachtrij |
| GLM-5.3-Flash REAP50 IQ4_XS · 2×V100 | — | — | — | — | — | — | — | — | in benchmarkwachtrij |
| GLM-5.3-Flash REAP50 IQ4_XS · 4 GPU's | — | — | — | — | — | — | — | — | in benchmarkwachtrij |
| GLM-5.3-Flash REAP50 Q4_K_M · 2×V100 | — | — | — | — | — | — | — | — | in benchmarkwachtrij |
| GLM-5.3-Flash REAP50 Q4_K_M · 4 GPU's | — | — | — | — | — | — | — | — | in benchmarkwachtrij |
| Qwen3.8 Flash-Next Merlin W4A16 · 2×V100 | — | — | — | — | — | — | — | 2x Tesla V100-SXM2-32GB + NVLink | geteste backend onverenigbaar · SM75 vereist; 1Cat-herbeoordeling volgt |
| Qwen3.8 Flash-Next Merlin W4A16 · 4 GPU's | — | — | — | — | — | — | — | RTX A4000 + 2x V100 NVLink + RTX 4000 Ada | onverenigbaar · onvoldoende VRAM voor dit profiel |
| Qwen3.8 Flash-Next AWQ W4A16 · 2×V100 | — | — | — | — | — | — | — | — | in benchmarkwachtrij |
| Qwen3.8 Flash-Next AWQ W4A16 · 4 GPU's | — | — | — | — | — | — | — | — | in benchmarkwachtrij |
| Qwen3.8 Flash-Next AP-Q4_K_M · 2×V100 | — | — | — | — | — | — | — | 2× Tesla V100-SXM2-32GB · NVLink · layer split | mislukt · GGUF diagnose/herpoging gepland |
mmlu_generative exact-match keurde "B. 4" af als fout antwoord op target "B"
(het model had wél gelijk) -- eigen scorer pakt nu de eerste vrijstaande A/B/C/D-letter uit
de ruwe respons.BBH-fix: lm-eval liet model-eindtokens/punctuatie in het
gefilterde antwoord staan (False.<|im_end|> versus target False).
normalized_logged_answer_v1 vergelijkt de eerste getypeerde keuze uit de bewaarde
samplelogs; alle beschikbare historische rijen zijn daarmee offline herwaardeerd.
t/s bij mixture-rijen (Mixture-of-models — ...): geen gemeten mixture-doorvoer -- leden
worden sequentieel bevraagd, nooit gelijktijdig bediend. De getoonde waarde is de t/s van het
traagste lid (bottleneck), oftewel het plafond als elk lid parallel op aparte hardware zou
draaien. Praktische latency op gedeelde hardware, met laden/wisselen tussen leden, ligt
hoger.Ongewogen gemiddelde van GSM8K, BBH, MMLU en HumanEval. TruthfulQA telt niet mee omdat de generatie-/ROUGE-maat een andere semantiek heeft.
Terug naar boven50 basisschool-wiskundeproblemen; exactheid van het uiteindelijke numerieke antwoord met flexibele extractie.
Terug naar boven48 voorbeelden uit zes BIG-Bench Hard-taken. De opgeslagen eindantwoorden worden genormaliseerd vóór exact-match scoring.
Terug naar boven160 vragen uit acht vakgebieden. De scorer extraheert de eerste zelfstandige antwoordletter A–D uit de modelrespons.
Terug naar boven30 vrije-tekstvragen, weergegeven als ROUGE-L-accuracy. Deze score is diagnostisch en zit niet in Composite.
Terug naar boven40 programmeertaken; de eerste gegenereerde oplossing wordt werkelijk uitgevoerd tegen de tests.
Terug naar bovenGemeten decode-throughput in tokens per seconde. Vergelijk dit alleen wanneer hardware, runtime en profiel gelijk zijn.
Terug naar bovenOptionele expert-suite. Bestaande modelrijen blijven bewust leeg: een em-dash betekent niet gedraaid, nooit 0%. Elke specialist heeft een eigen lokale, bewerkbare CSV waarvan antwoord- en rubricvelden nooit naar het model gaan. Vision bevat synthetische object- en ruimtelijke assets; Video meet een lokaal gerenderd MP4-artifact; FQ valideert actuatorcommando’s in een deterministische differential-drive-simulator. Vision en Video hebben elk een harde grens van vijf minuten. IQ/EQ zijn taaklabels voor abstract respectievelijk sociaal-emotioneel redeneren, geen klinische persoonsmetingen. Geen score telt mee in de algemene Composite.
| Model | Chemistry · eigen holdout | Physics · eigen holdout | Vision · object/spatial | Video · MP4 artifact | IQ · rule reasoning | EQ · social reasoning | FQ · robot simulatie | QQ · quantum | Status |
|---|---|---|---|---|---|---|---|---|---|
| Qwen3.8-27B | — | — | — | — | — | — | — | — | niet uitgevoerd (historisch) |
| DeepSeek-R1-Qwen | — | — | — | 0% | 33% | 67% | 0% | 25% | chemistry: unavailable; physics: unavailable; vision: unsupported; video: complete; iq: complete; eq: complete; fq: complete; qq: complete |
| Qwen3.6-27B | — | — | — | — | — | — | — | — | niet uitgevoerd (historisch) |
| Qwen3.5-27B | — | — | — | — | — | — | — | — | niet uitgevoerd (historisch) |
| Gemma4-26B-A4B | — | — | — | — | — | — | — | — | niet uitgevoerd (historisch) |
| Devstral Small 2 | — | — | — | — | — | — | — | — | niet uitgevoerd (historisch) |
| Qwen2.5-72B | — | — | — | — | — | — | — | — | niet uitgevoerd (historisch) |
| Llama-3.1-70B | — | — | — | — | — | — | — | — | niet uitgevoerd (historisch) |
| GLM-4.5-Air-106B-A12B | — | — | — | — | — | — | — | — | niet uitgevoerd (historisch) |
| gpt-oss-120B | — | — | — | — | — | — | — | — | niet uitgevoerd (historisch) |
| KAT-Coder-V2.5-Dev | — | — | — | 0% | 33% | 33% | 0% | 75% | chemistry: unavailable; physics: unavailable; vision: unsupported; video: complete; iq: complete; eq: complete; fq: complete; qq: complete |
| Granite-4.2-30B | — | — | — | 0% | 0% | 100% | 0% | 100% | chemistry: unavailable; physics: unavailable; vision: unsupported; video: complete; iq: complete; eq: complete; fq: complete; qq: complete |
| Nemotron-3.5-Lightning-30B-A3B | — | — | — | — | — | — | — | — | niet uitgevoerd (historisch) |
| Muse-Glimmer-30B | — | — | — | — | — | — | — | — | niet uitgevoerd (historisch) |
| Qwen3.6-35B-A3B (1Cat-vLLM NVFP4) | — | — | — | — | — | — | — | — | niet uitgevoerd (historisch) |
| Qwen3.8-27B (1Cat-vLLM NVFP4) | — | — | — | — | — | — | — | — | niet uitgevoerd (historisch) |
| Mixture-of-models | — | — | — | — | — | — | — | — | niet uitgevoerd (historisch) |
| Mixture-of-models 4 (quality) | — | — | — | — | — | — | — | — | niet uitgevoerd (historisch) |
| Mixture-of-models 4 (Gemma route) | — | — | — | — | — | — | — | — | niet uitgevoerd (historisch) |
| Mixture-of-models 4 (Gemma direct) | — | — | — | — | — | — | — | — | niet uitgevoerd (historisch) |
| Mixture ultieme 6 (nemotron+deepseek+glm+kat+qwen35+qwen38-iq2s) | — | — | — | — | — | — | — | — | niet uitgevoerd (historisch) |
| gpt-oss-20B | — | — | — | — | — | — | — | — | niet uitgevoerd (historisch) |
| Mistral Small 4 (Ada+A4000) | — | — | — | — | — | — | — | — | niet uitgevoerd (historisch) |
| DeepSeek-V4-Flash-REAP-150B (Ada+A4000) | — | — | — | — | — | — | — | — | niet uitgevoerd (historisch) |
| DeepSeek-V4-Flash-0731 UD-IQ3_XXS | — | — | — | — | — | — | — | — | niet uitgevoerd (historisch) |
| Llama-3-70B-Instruct Q4_K_M | — | — | — | — | — | — | — | — | niet uitgevoerd (historisch) |
| Qwen3.5-122B-A10B IQ3_S | — | — | — | 0% | 0% | 100% | 0% | 75% | chemistry: unavailable; physics: unavailable; vision: unsupported; video: complete; iq: complete; eq: complete; fq: complete; qq: complete |
| Command R+ 104B 08-2024 IQ3_M | — | — | — | — | — | — | — | — | niet uitgevoerd (historisch) |
| Mixtral 8x22B Instruct Q3_K_S | — | — | — | — | — | — | — | — | niet uitgevoerd (historisch) |
| WizardLM-2 8x22B IQ3_S | — | — | — | — | — | — | — | — | niet uitgevoerd (historisch) |
| GLM-5.3-Flash 313B-A17B AJ-IQ2_XXS | — | — | — | — | — | — | — | — | niet uitgevoerd (historisch) |
| GLM-5.3-Flash REAP50 IQ3_M | — | — | — | — | — | — | — | — | niet uitgevoerd (historisch) |
| GLM-5.3-Flash REAP50 Q3_K_M | — | — | — | — | — | — | — | — | niet uitgevoerd (historisch) |
| GLM-5.3-Flash REAP50 IQ4_XS | — | — | — | — | — | — | — | — | niet uitgevoerd (historisch) |
| GLM-5.3-Flash REAP50 Q4_K_M | — | — | — | — | — | — | — | — | niet uitgevoerd (historisch) |
| GLM-5.3-Flash REAP50 IQ3_M · 2×V100 | — | — | — | 0% | 67% | 100% | 0% | 75% | chemistry: unavailable; physics: unavailable; vision: unsupported; video: complete; iq: complete; eq: complete; fq: complete; qq: complete |
| GLM-5.3-Flash REAP50 IQ3_M · 4 GPU's | — | — | — | 0% | 33% | 100% | 50% | 75% | chemistry: unavailable; physics: unavailable; vision: unsupported; video: complete; iq: complete; eq: complete; fq: complete; qq: complete |
| GLM-5.3-Flash REAP50 Q3_K_M · 2×V100 | — | — | — | — | — | — | — | — | niet uitgevoerd (historisch) |
| GLM-5.3-Flash REAP50 Q3_K_M · 4 GPU's | — | — | — | — | — | — | — | — | niet uitgevoerd (historisch) |
| GLM-5.3-Flash REAP50 IQ4_XS · 2×V100 | — | — | — | — | — | — | — | — | niet uitgevoerd (historisch) |
| GLM-5.3-Flash REAP50 IQ4_XS · 4 GPU's | — | — | — | — | — | — | — | — | niet uitgevoerd (historisch) |
| GLM-5.3-Flash REAP50 Q4_K_M · 2×V100 | — | — | — | — | — | — | — | — | niet uitgevoerd (historisch) |
| GLM-5.3-Flash REAP50 Q4_K_M · 4 GPU's | — | — | — | — | — | — | — | — | niet uitgevoerd (historisch) |
| Qwen3.8 Flash-Next Merlin W4A16 · 2×V100 | — | — | — | — | — | — | — | — | niet uitgevoerd (historisch) |
| Qwen3.8 Flash-Next Merlin W4A16 · 4 GPU's | — | — | — | — | — | — | — | — | niet uitgevoerd (historisch) |
| Qwen3.8 Flash-Next AWQ W4A16 · 2×V100 | — | — | — | — | — | — | — | — | niet uitgevoerd (historisch) |
| Qwen3.8 Flash-Next AWQ W4A16 · 4 GPU's | — | — | — | — | — | — | — | — | niet uitgevoerd (historisch) |
| Qwen3.8 Flash-Next AP-IQ4_XS · 2×V100 | 0% | 67% | — | 0% | 33% | 100% | 0% | 75% | chemistry: complete; physics: complete; vision: unsupported; video: complete; iq: complete; eq: complete; fq: complete; qq: complete |
| Qwen3.8 Flash-Next AP-IQ4_XS · 4 GPU's | 17% | 67% | — | 0% | 33% | 100% | 0% | 75% | chemistry: complete; physics: complete; vision: unsupported; video: complete; iq: complete; eq: complete; fq: complete; qq: complete |
| Qwen3.8 Flash-Next AP-Q4_K_M · 2×V100 | — | — | — | — | — | — | — | — | niet uitgevoerd (historisch) |
| Qwen3.8 Flash-Next AP-Q4_K_M · 4 GPU's | — | — | — | — | — | — | — | — | niet uitgevoerd (historisch) |
| Qwen3.8 Flash-Next AP-IQ2_S · 2×V100 | — | — | — | — | — | — | — | — | niet uitgevoerd (historisch) |
| Qwen3.8 Flash-Next AP-IQ2_S · 4 GPU's | — | — | — | — | — | — | — | — | niet uitgevoerd (historisch) |
| qwen38-flash-next-ap-q4kxl | — | — | — | 0% | 33% | 100% | 0% | 75% | chemistry: unavailable; physics: unavailable; vision: unsupported; video: complete; iq: complete; eq: complete; fq: complete; qq: complete |
| qwen38-flash-next-ap-q4kxl-v100 | — | — | — | 0% | 33% | 100% | 0% | 100% | chemistry: unavailable; physics: unavailable; vision: unsupported; video: complete; iq: complete; eq: complete; fq: complete; qq: complete |
Lokale CSV met eigen vragen en antwoordletters; de GPQA-publicatie (2023-11-20) is alleen de moeilijkheidsreferentie.
Afzonderlijke, wijzigbare physics-vragen. Roteer de CSV-versie vóór een nieuwe vergelijkingsreeks.
16 vision-only expertvragen met beelden, diagrammen en tabellen; publicatie 2024-09-04. Text-only endpoints worden als unsupported gelogd.
Drie FFmpeg-filtergraphs; render, duur en bestandsgrootte worden objectief gevalideerd. Maximaal vijf minuten, geen LLM-jury.
Eigen abstracte regels, recurrences en formele deductie. Dit is geen psychometrische IQ-test.
Kalibratie, empathische triage en conflicthantering met expliciete rubrics; geen klinische EQ-diagnose.
Het model produceert wielactuator-JSON; de scorer berekent positie en heading met differential-drive-kinematica.
Quantumtoestanden, meting, communicatie, metrologie en quantumchemie/VQE.
Publieke benchmarks kunnen in pretraining, post-training of benchmark-optimalisatie terechtkomen. Een hoge publieke score is daarom geen zelfstandig bewijs van algemene vaardigheid. De audit vergelijkt dezelfde modelconfiguratie pas nadat zowel standaard- als private/live-resultaat bestaan; de gap is een onderzoekssignaal, geen bewijs van memorisatie of fraude.
| Model | Modelpublicatie | Standaard composite | Private/live score | Verschil | Auditstatus |
|---|---|---|---|---|---|
| Qwen3.8-27B | nog vast te leggen | 85% | — | — | wacht op private/live score + releasebron |
| DeepSeek-R1-Qwen | nog vast te leggen | 54% | 31% | +22.6% | vergelijkbaar |
| Qwen3.6-27B | nog vast te leggen | — | — | — | wacht op private/live score + releasebron |
| Qwen3.5-27B | nog vast te leggen | 77% | — | — | wacht op private/live score + releasebron |
| Gemma4-26B-A4B | nog vast te leggen | 65% | — | — | wacht op private/live score + releasebron |
| Devstral Small 2 | nog vast te leggen | 81% | — | — | wacht op private/live score + releasebron |
| Qwen2.5-72B | nog vast te leggen | 76% | — | — | wacht op private/live score + releasebron |
| Llama-3.1-70B | nog vast te leggen | 61% | — | — | wacht op private/live score + releasebron |
| GLM-4.5-Air-106B-A12B | nog vast te leggen | — | — | — | wacht op private/live score + releasebron |
| gpt-oss-120B | nog vast te leggen | 58% | — | — | wacht op private/live score + releasebron |
| KAT-Coder-V2.5-Dev | nog vast te leggen | 91% | 35% | +55.2% | vergelijkbaar |
| Granite-4.2-30B | nog vast te leggen | 85% | 50% | +34.6% | vergelijkbaar |
| Nemotron-3.5-Lightning-30B-A3B | nog vast te leggen | 82% | — | — | wacht op private/live score + releasebron |
| Muse-Glimmer-30B | nog vast te leggen | 41% | — | — | wacht op private/live score + releasebron |
| Qwen3.6-35B-A3B (1Cat-vLLM NVFP4) | nog vast te leggen | 84% | — | — | wacht op private/live score + releasebron |
| Qwen3.8-27B (1Cat-vLLM NVFP4) | nog vast te leggen | 34% | — | — | wacht op private/live score + releasebron |
| Mixture-of-models | nog vast te leggen | 90% | — | — | wacht op private/live score + releasebron |
| Mixture-of-models 4 (quality) | nog vast te leggen | 92% | — | — | wacht op private/live score + releasebron |
| Mixture-of-models 4 (Gemma route) | nog vast te leggen | 91% | — | — | wacht op private/live score + releasebron |
| Mixture-of-models 4 (Gemma direct) | nog vast te leggen | 91% | — | — | wacht op private/live score + releasebron |
| Mixture ultieme 6 (nemotron+deepseek+glm+kat+qwen35+qwen38-iq2s) | nog vast te leggen | 94% | — | — | wacht op private/live score + releasebron |
| gpt-oss-20B | nog vast te leggen | 54% | — | — | wacht op private/live score + releasebron |
| Mistral Small 4 (Ada+A4000) | nog vast te leggen | 81% | — | — | wacht op private/live score + releasebron |
| DeepSeek-V4-Flash-REAP-150B (Ada+A4000) | nog vast te leggen | 79% | — | — | wacht op private/live score + releasebron |
| DeepSeek-V4-Flash-0731 UD-IQ3_XXS | nog vast te leggen | 91% | — | — | wacht op private/live score + releasebron |
| Llama-3-70B-Instruct Q4_K_M | nog vast te leggen | 86% | — | — | wacht op private/live score + releasebron |
| Qwen3.5-122B-A10B IQ3_S | nog vast te leggen | 90% | 44% | +46.1% | vergelijkbaar |
| Command R+ 104B 08-2024 IQ3_M | nog vast te leggen | 71% | — | — | wacht op private/live score + releasebron |
| Mixtral 8x22B Instruct Q3_K_S | nog vast te leggen | 62% | — | — | wacht op private/live score + releasebron |
| WizardLM-2 8x22B IQ3_S | nog vast te leggen | 51% | — | — | wacht op private/live score + releasebron |
| GLM-5.3-Flash 313B-A17B AJ-IQ2_XXS | nog vast te leggen | 60% | — | — | wacht op private/live score + releasebron |
| GLM-5.3-Flash REAP50 IQ3_M | nog vast te leggen | — | — | — | wacht op private/live score + releasebron |
| GLM-5.3-Flash REAP50 Q3_K_M | nog vast te leggen | — | — | — | wacht op private/live score + releasebron |
| GLM-5.3-Flash REAP50 IQ4_XS | nog vast te leggen | — | — | — | wacht op private/live score + releasebron |
| GLM-5.3-Flash REAP50 Q4_K_M | nog vast te leggen | — | — | — | wacht op private/live score + releasebron |
| GLM-5.3-Flash REAP50 IQ3_M · 2×V100 | nog vast te leggen | 84% | 60% | +23.8% | vergelijkbaar |
| GLM-5.3-Flash REAP50 IQ3_M · 4 GPU's | nog vast te leggen | 81% | 65% | +16.1% | vergelijkbaar |
| GLM-5.3-Flash REAP50 Q3_K_M · 2×V100 | nog vast te leggen | — | — | — | wacht op private/live score + releasebron |
| GLM-5.3-Flash REAP50 Q3_K_M · 4 GPU's | nog vast te leggen | — | — | — | wacht op private/live score + releasebron |
| GLM-5.3-Flash REAP50 IQ4_XS · 2×V100 | nog vast te leggen | — | — | — | wacht op private/live score + releasebron |
| GLM-5.3-Flash REAP50 IQ4_XS · 4 GPU's | nog vast te leggen | — | — | — | wacht op private/live score + releasebron |
| GLM-5.3-Flash REAP50 Q4_K_M · 2×V100 | nog vast te leggen | — | — | — | wacht op private/live score + releasebron |
| GLM-5.3-Flash REAP50 Q4_K_M · 4 GPU's | nog vast te leggen | — | — | — | wacht op private/live score + releasebron |
| Qwen3.8 Flash-Next Merlin W4A16 · 2×V100 | nog vast te leggen | — | — | — | wacht op private/live score + releasebron |
| Qwen3.8 Flash-Next Merlin W4A16 · 4 GPU's | nog vast te leggen | — | — | — | wacht op private/live score + releasebron |
| Qwen3.8 Flash-Next AWQ W4A16 · 2×V100 | nog vast te leggen | — | — | — | wacht op private/live score + releasebron |
| Qwen3.8 Flash-Next AWQ W4A16 · 4 GPU's | nog vast te leggen | — | — | — | wacht op private/live score + releasebron |
| Qwen3.8 Flash-Next AP-IQ4_XS · 2×V100 | nog vast te leggen | 92% | 46% | +46.1% | vergelijkbaar |
| Qwen3.8 Flash-Next AP-IQ4_XS · 4 GPU's | nog vast te leggen | 92% | 49% | +43.2% | vergelijkbaar |
| Qwen3.8 Flash-Next AP-Q4_K_M · 2×V100 | nog vast te leggen | — | — | — | wacht op private/live score + releasebron |
| Qwen3.8 Flash-Next AP-Q4_K_M · 4 GPU's | nog vast te leggen | 92% | — | — | wacht op private/live score + releasebron |
| Qwen3.8 Flash-Next AP-IQ2_S · 2×V100 | nog vast te leggen | 91% | — | — | wacht op private/live score + releasebron |
| Qwen3.8 Flash-Next AP-IQ2_S · 4 GPU's | nog vast te leggen | 92% | — | — | wacht op private/live score + releasebron |
| Maatregel | Waarom | Bron / publicatiedatum | Lokale uitvoering |
|---|---|---|---|
| Private held-out set | Modelbouwers zien vragen/antwoorden niet vóór de eindmeting. | ARC-AGI-2 private eval · 2025 | Private CSV-packs met SHA-256; publiceer een nieuwe pack niet vóór de run. |
| Dynamische benchmark | Vragen ontstaan na de bekende modelcutoff. | LiveBench · 2024-06-27 | Optionele live-lane; score, bron- en vraagdatum opslaan. |
| Recente code-opgaven | Publicatiedatum van de opgave kan tegen modelrelease worden afgezet. | LiveCodeBench · 2024-03-12 | Alleen opgaven ná release/cutoff; apart rapporteren. |
| Canary-string probe | Onwaarschijnlijke string kan trainingsblootstelling detecteren. | BIG-bench GUID canary · 2022 | Alleen logprob-geschikte engines; vergelijk met willekeurige GUID-controls. |
| Modelprovenance | Release- en trainingscutoff maken tijdsvergelijking controleerbaar. | Modelcard/release note | Elke nieuwe run bewaart datum plus primaire bron-URL. |
De bestaande publieke GSM8K/BBH/MMLU/HumanEval-composite.
Gemiddelde van vergelijkbare, voltooide private of tijdgebonden lanes; video blijft apart wegens andere metriek.
access_matrix_ready_after_glm53. De drie profielen per standaard- en specialistische suite starten pas na een complete GLM-5.3 sandboxrun met huidige protocol, core-scores en t/s.Qwen3.6-27B IQ3_XXS draait hier met exact dezelfde weights, prompt, context en 256-token decode op iedere configuratie. Hierdoor meet deze tabel het hardware-/split-effect; anders dan in de modelranglijst verandert de modelkwaliteit niet.
| Configuratie | Decode t/s | Prompt t/s | vs. A4000 | 8-task score | VRAM GiB | GPU util. |
|---|---|---|---|---|---|---|
| RTX A4000 15GB | 21.15 | 154.36 | 0.0% | 87.5% | 11.47 | 96.3% |
| RTX 4000 Ada 20GB | 22.63 | 162.81 | 7.0% | 87.5% | 11.89 | 97.9% |
| A4000 + RTX 4000 Ada (PCIe layer split) | 23.21 | 156.77 | 9.7% | 87.5% | 5.72 / 6.70 | 47.4% / 50.5% |
| 1× V100-SXM2 32GB | 34.15 | 128.10 | 61.4% | 87.5% | 11.75 | 94.6% |
| 2× V100-SXM2 (NVLink layer split) | 34.16 | 129.96 | 61.5% | 87.5% | 6.00 / 6.56 | 46.2% / 47.8% |
| 2× V100-SXM2 (NVLink tensor split) | 45.42 | 92.36 | 114.7% | — | 6.20 / 6.20 | 86.2% / 87.0% |
Dezelfde 313,33B/17,3B-actieve inference-trunk van GLM-5.3-Flash draait met automatische CPU-offload op elke configuratie. Daardoor toont deze tabel niet alleen ruwe GPU-snelheid, maar ook hoeveel extra VRAM en NVLink de decode versnellen. Beide V100’s zijn bovendien afzonderlijk gemeten. Dit is een layer-split-matrix: GLM-5.3 draait via een experimentele runtime met automatische CPU-offload en krijgt daarom bewust geen onbewaakte tensor-split-duurtest. Eerdere llama.cpp-GGUF tensor-split-runs op de V100's eindigden tweemaal in een driverhang; de onderliggende CUDA-kernel is niet bewezen. Dat incident staat los van vLLM tensor parallel, dat per model apart wordt vooraf gecontroleerd.
| Configuratie | Decode t/s | Prompt t/s | vs. V100 #1 | 8-task score | VRAM GiB | GPU util. |
|---|---|---|---|---|---|---|
| Alle 4 GPU’s (99GB VRAM) | 25.97 | 49.68 | 2.87× | 75.0% | 9.52 / 29.35 / 29.36 / 17.55 | 18.0% / 28.4% / 28.3% / 25.3% |
| V100 #1 32GB (zelfstandig) | 9.04 | 19.55 | 1.00× | 93.8% | 30.81 | 25.8% |
| V100 #2 32GB (zelfstandig) | 9.10 | 19.84 | 1.01× | 93.8% | 30.81 | 26.8% |
| 2× V100-SXM2 (NVLink) | 13.12 | 27.18 | 1.45× | 81.2% | 30.63 / 30.83 | 19.0% / 31.2% |
| RTX 4000 Ada 20GB | 7.82 | 18.50 | 0.87× | 77.1% | 18.90 | 33.2% |
| RTX A4000 15GB | 7.03 | 17.47 | 0.78× | 77.1% | 13.48 | 25.6% |
| A4000 + RTX 4000 Ada (PCIe) | 8.41 | 20.30 | 0.93× | 83.3% | 13.51 / 18.45 | 10.6% / 33.2% |
07c62fcdeaf1
AJ-IQ2_XXS · 2,23 bpw · 87,35 GBIedere download is aan een repository-revisie vastgezet. Publicatiedatum en bron blijven in het resultaat staan nadat een gevalideerde verliezer is verwijderd; de opgeslagen reinstall-opdracht in het cascade-JSON is niet afhankelijk van een rate-limited inference-API.
| Model | Bron | Publicatie | Revisie | Quant | GB weights | Status |
|---|---|---|---|---|---|---|
| Llama-3-70B-Instruct Q4_K_M | NousResearch/Meta-Llama-3-70B-Instruct-GGUF | 2024-04-19T01:16:05Z | 875f77142cf5 | Q4_K_M | 42.52 | volledig getest · cascade actief |
| Command R+ 104B 08-2024 IQ3_M | bartowski/c4ai-command-r-plus-08-2024-GGUF | 2024-08-30T14:28:25Z | 4cb2af9f9be9 | IQ3_M | 47.68 | volledig getest · cascade actief |
| Mixtral 8x22B Instruct Q3_K_S | MaziyarPanahi/Mixtral-8x22B-Instruct-v0.1-GGUF | 2024-04-17T17:29:25Z | 9f2f6c5ec37f | Q3_K_S | 61.50 | volledig getest · cascade actief |
| WizardLM-2 8x22B IQ3_S | bartowski/WizardLM-2-8x22B-GGUF | 2024-04-16T17:30:47Z | 0e209c6d5f26 | IQ3_S | 61.50 | volledig getest · cascade actief |
| Qwen3.8 Flash-Next Merlin W4A16 · 2×V100 | halt95/Qwen3.8-Flash-Next-W4A16-Merlin | 2026-09-19T09:43:31Z | 483ee0015419 | merlin-w4a16 | 0.00 | volledig getest · cascade actief |
| Qwen3.8 Flash-Next Merlin W4A16 · 4 GPU's | halt95/Qwen3.8-Flash-Next-W4A16-Merlin | 2026-09-19T09:43:31Z | 483ee0015419 | merlin-w4a16 | 0.00 | volledig getest · cascade actief |
| Qwen3.8 Flash-Next AP-IQ4_XS · 2×V100 | agentionai/Qwen3.8-Flash-Next-AP-GGUF | 2026-09-11T22:34:02Z | 0061a60e46ad | AP-IQ4XS | 90.45 | volledig getest · cascade actief |
| Qwen3.8 Flash-Next AP-IQ4_XS · 4 GPU's | agentionai/Qwen3.8-Flash-Next-AP-GGUF | 2026-09-11T22:34:02Z | 0061a60e46ad | AP-IQ4XS | 90.45 | volledig getest · cascade actief |
| Qwen3.8 Flash-Next AP-Q4_K_M · 2×V100 | agentionai/Qwen3.8-Flash-Next-AP-GGUF | — | 0061a60e46ad | AP-Q4KM | 0.00 | volledig getest · cascade actief |
| Qwen3.8 Flash-Next AP-Q4_K_M · 4 GPU's | agentionai/Qwen3.8-Flash-Next-AP-GGUF | 2026-09-11T22:34:02Z | 0061a60e46ad | AP-Q4KM | 94.54 | volledig getest · cascade actief |
| Qwen3.8 Flash-Next AP-IQ2_S · 2×V100 | agentionai/Qwen3.8-Flash-Next-AP-GGUF | 2026-09-11T22:34:02Z | 0061a60e46ad | AP-IQ2S | 81.64 | volledig getest · cascade actief |
| Qwen3.8 Flash-Next AP-IQ2_S · 4 GPU's | agentionai/Qwen3.8-Flash-Next-AP-GGUF | 2026-09-11T22:34:02Z | 0061a60e46ad | AP-IQ2S | 81.64 | volledig getest · cascade actief |
| GLM-5.3-Flash REAP50 IQ3_M · 2×V100 | patrickbdevaney/GLM-5.3-Flash-REAP50-GGUF | 2026-09-06T22:49:01Z | 8654e38254ee | IQ3M | 72.13 | volledig getest · cascade actief |
| GLM-5.3-Flash REAP50 IQ3_M · 4 GPU's | patrickbdevaney/GLM-5.3-Flash-REAP50-GGUF | 2026-09-06T22:49:01Z | 8654e38254ee | IQ3M | 72.13 | volledig getest · cascade actief |
De AP-GGUF-metingen in de hoofdtabel zijn lokale llama.cpp-resultaten. De hieronder genoemde 1Cat-routes zijn afzonderlijke experimenten en krijgen pas een score na een lokale run met vastgelegde checkpoint-, runtime- en hardware-revisie.
| Profiel | Fysieke GPU’s | vLLM-configuratie | t/s | Benchmarks | Status |
|---|---|---|---|---|---|
| V100-only | GPU 1 + 2 · 2× Tesla V100-SXM2-32GB · NVLink | CUDA_VISIBLE_DEVICES=1,2 · TP=2 | — | smoke · kwaliteit · pure decode | 1Cat-vLLM 1.5.0 baseline eerst; alleen publiceren indien SM70-preflight slaagt |
| Heterogeen onderzoek | GPU 0 A4000 + GPU 1/2 V100 NVLink + GPU 3 RTX 4000 Ada | alleen een backend die ongelijke compute capabilities expliciet ondersteunt | — | identieke suite; afzonderlijk gerapporteerd | geen TP=4-claim zolang de mixed-GPU preflight niet slaagt |
Beste llama.cpp-topologie. Qwen3.8 bereikt circa 85–86% gemiddelde utiliteit per V100; Qwen-72B circa 95–97%. De zes NVLinks maken de benodigde tensorcollectives praktisch.
Goed om modellen te laten passen, maar geen decodeversnelling voor 27B: 33,33 versus 33,53 t/s single. De lagen worden grotendeels na elkaar uitgevoerd.
Qwen3.8 NVFP4 gebruikt beide V100’s op 100%. DFlash2 is sterk bij B1; target-only schaalt beter bij vier gelijktijdige requests.
72,7B dense Q4_K_M gebruikt circa 22,27 GiB per kaart en is stabiel op 8K. Een dense 100B Q4 zou te weinig allocator- en KV-marge laten; de betrouwbare grens ligt op deze machine daarom rond 70–80B.
| V100-modelranglijst | Fysieke GPU 1 + 2: Tesla V100-SXM2-32GB; A4000/Ada zijn onzichtbaar en uitgesloten |
|---|---|
| RTX-profielen | GPU0 = RTX A4000 15GB; GPU3 = RTX 4000 Ada 20GB. Single-card, PCIe layer split en parallel serving worden als verschillende configuraties gerapporteerd. |
| Device contract | CUDA_DEVICE_ORDER=PCI_BUS_ID plus een expliciete CUDA_VISIBLE_DEVICES-set; de llama.cpp device probe en telemetry moeten exact met het profiel overeenkomen |
| Interconnect | NV6; 6 actieve links per V100, elk 25,781 GB/s gerapporteerd. Tussen A4000 en Ada bestaat geen NVLink. |
| Temperatuur | Maximaal 65°C in de 72B tensor-run |
| Brondata | JSON-artefacten in reports/; pagina wordt daar rechtstreeks uit gegenereerd |