Najvýkonnejšie servery Najvýkonnejšie servery
Vaše LLM generujú tokeny slimáčím tempom a s rastúcim kontextom sa odpoveď prepadá k nule? Akýkoľvek akcelerátor je lepší ako nič. Aj klasické MTP prináša viditeľné zrýchlenie oproti bežnej prevádzke. Súboj o absolútnu špičku však zvádzajú pokročilé architektúry DSpark a DFlash 2. Ktorá z nich v našich benchmarkoch dominovala v rýchlosti generovania tokenov a prečo neexistuje jedno univerzálne riešenie pre všetky scenáre? V našom detailnom porovnaní na karte RTX PRO 6000 Blackwell vám ukážeme, po ktorej architektúre siahnuť podľa konkrétneho typu úlohy a ako z vášho hardvéru vyťažiť maximum.
Maty
Vypočujte si článok v audio verzii. Powered by ZonerCloud
0:00 0:00
1.0x

Štyri varianty, jeden model a jedno GPU

Všetky varianty bežali s rovnakým modelom Qwen3.8-27B-FP8 v SGLangu na jednej NVIDIA RTX PRO 6000 Blackwell s 96 GB pamäte. Porovnali sme rýchlosť generovania pri zdieľaní servera aj pri dlhom kontexte.

Porovnali sme variant bez zrýchlenia, ktorý generuje bez spekulatívneho dekódovania, Eagle MTP s návrhovou (draft) časťou vstavanou priamo v Qwene a dve varianty s externým pomocným modelom. DSpark funguje tak, že pomocný model predpovedá ďalšiu časť textu krok za krokom, a akoby narazí na miesto, kde si nie je istý, zastaví sa a odovzdá prácu hlavnému modelu na schválenie. Naopak DFlash 2 nepostupuje po jednotlivých tokenoch, ale navrhne rovno celý blok textu naraz a hlavný model ho skontroluje v jedinom kroku.

V čom sa líšia jednotlivé architektúry spekulatívneho dekódovania

Zatiaľ čo princíp zostáva rovnaký (overiť viac kandidátov v jednom cykle), zásadný rozdiel je v nárokoch na správu modelov. Eagle MTP má pomocnú časť integrovanú priamo v tele Qwenu. Naopak DSpark a DFlash 2 vyžadujú beh samostatného pomocného modelu, ktorý síce zaberie ďalšiu časť pamäte GPU, ale ponúka pokročilejšie stratégie predpovedania.

DFlash 2 vedie do štyroch používateľov

Pre firemné AI API je dôležité, koľko práce zvládne server celkovo. Graf porovnáva súhrnný výkon pri 20k kontexte. Jeden aktívny používateľ tu znamená jednu súčasne generujúcu požiadavku.

Celková rýchlosť generovania Qwen3.8-27B pri 20k kontexte a jednej až 16 súčasných požiadavkách

DFlash 2 vedie do štyroch súčasných používateľov, od ôsmich preberá vedenie DSpark. Pri najvyššej záťaži sú obidve varianty takmer vyrovnané. Eagle MTP zostáva za nimi, ale všetky tri možnosti výrazne prekonávajú generovanie oproti variantu bez zrýchlenia.

Vyskúšajte AI/GPU server až na 7 dní ZADARMO

Otestujte výkon NVIDIA RTX PRO 6000 Blackwell pre vlastný AI model, firemné API aj viac používateľov súčasne. Bez investície do vlastného hardvéru si overte, ktorá konfigurácia najlepšie zodpovedá vašim úlohám.

Vyskúšajte AI/GPU server
RTX PRO 6000 Blackwell

Prečo celkový výkon servera nezaručuje rýchlosť pre jednotlivcov

Vyšší celkový výkon neznamená rýchlejšiu odpoveď pre každého. Pri zdieľaní servera sa výkon rozdeľuje medzi požiadavky. Graf ukazuje priemernú rýchlosť generovania na jedného používateľa.

Priemerná rýchlosť na používateľa pri zdieľaní Qwen3.8-27B jednou až 16 súčasnými požiadavkami

DFlash 2 ponúka najvyššiu rýchlosť pri menšom počte používateľov. DSpark naopak medzi štyrmi a ôsmimi požiadavkami drží takmer rovnaké tempo na používateľa. Pri najvyššej záťaži sa obidve varianty zbližujú a stále zostávajú výrazne rýchlejšie ako Eagle MTP aj variant bez zrýchlenia.

DSpark a DFlash 2 zvádzajú vyrovnaný súboj

Pracujete s dlhými dokumentmi alebo rozsiahlym kódom? Porovnali sme rýchlosť jednej požiadavky pri 20k a 200k kontexte, aby sme zistili, či dlhší vstup zmení poradie.

Rýchlosť jednej požiadavky pri 20k a 200k kontexte pre variant bez zrýchlenia, Eagle MTP, DSpark a DFlash 2

DFlash 2 vedie pri kratšom vstupe, zatiaľ čo pri dlhom kontexte sú DSpark a DFlash 2 prakticky vyrovnané. DSpark si udržal takmer rovnakú rýchlosť, ostatné varianty mierne spomalili. Obidve externé varianty dosiahli pri 200k kontexte približne 5,7× rýchlosť generovania bez zrýchlenia.

Ako sa zrýchlenie prejavuje pod záťažou?

Koľko výkonu získate zmenou dekódovania? Graf ukazuje násobok rýchlosti oproti variantu bez zrýchlenia pri rovnakom počte súčasných požiadaviek.

Násobky rýchlosti oproti variantu bez zrýchlenia pri 20k kontexte pre jedného, dvoch, štyroch a 16 používateľov

S rastúcou záťažou sa náskok zmenšuje, ale zrýchlenie sa vyplatilo vo všetkých meraných bodoch. DFlash 2 pre jedného používateľa dosahuje približne 5,4× rýchlosť. Aj pri najvyššej súbežnosti zostáva najmenej výkonné Eagle MTP približne 2,3× rýchlejšie ako variant bez zrýchlenia.

Výhody a nevýhody jednotlivých variantov

Bez zrýchlenia: jednoduchá prevádzka a záložné riešenie

  • Najjednoduchšia konfigurácia - menej súčastí, ktoré musíte ladit a kontrolovať.
  • Vhodný kontrolný bod - overíte, či vám konkrétne zrýchlenie skutočne pomáha.
  • Najnižší nameraný výkon

Eagle MTP: najjednoduchší setup

  • Bez externého návrhového modelu - MTP je súčasťou modelu.
  • Zrýchlenie zostáva stabilné po celý test
  • Nižšia rýchlosť ako obidve externé varianty
  • Nutná podpora výrobcu modelu

DSpark: silná voľba pre viac súčasných požiadaviek

  • Najvyšší celkový výkon pri ôsmich a 16 používateľoch
  • Stabilná rýchlosť pri dlhom kontexte
  • Potrebujete kompatibilný návrhový model
  • Slabší výsledok pri malej súbežnosti

DFlash 2: najrýchlejší pre menší počet používateľov

  • Najvyššia rýchlosť pri malej súbežnosti
  • Konkurencieschopný aj pri dlhom kontexte
  • Potrebujete kompatibilný návrhový model
  • Najvyššia súbežnosť nie je jeho najsilnejší bod

Pamäť a réžia: vyššia rýchlosť nie je zadarmo

Aby sme u zrýchlených variantov zachovali približne rovnakú kapacitu KV cache ako pri generovaní bez návrhov tokenov, potrebovali sme zhruba 2 až 3 GB grafickej pamäte naviac. Pamäťová cena bola pri MTP, DSpark aj DFlash 2 podobná.

Testovacie prostredie a kompletné výsledky

Rozbaľte podrobnosti pre úplnú konfiguráciu, pamäťové nároky a metodiku merania.

Hardvér, model a engine

ParameterTestovaná hodnota
Cieľový modelQwen/Qwen3.8-27B-FP8
GPU1× NVIDIA RTX PRO 6000 Blackwell, 96 GB
EngineSGLang v0.5.20-cu130, oficiálny kontajner
KV cacheFP8 E4M3
Attention backendFlashInfer
mamba-full-memory-ratio3,67 pre variant bez zrýchlenia a Eagle MTP; 11,01 pre DSpark a DFlash 2
Mamba radix stratégiaextra_buffer_lazy
SSM stavyFP32
Chunked prefill2 048 tokenov
Prefill CUDA graphsvypnuté
Maximálny počet požiadaviek16

Pamäťové nastavenie a kapacita KV cache

Parameter mem-fraction sme pre každú variantu upravili tak, aby veľkosť KV poolu zostala približne rovnaká. Konfigurácie so spekuláciou zaberali o 2,3 až 2,6 GiB viac ako variant bez zrýchlenia.

Konfiguráciamem-fractionKV poolObsadená pamäť GPU v nepatrnom zaťažení / v pokoji
Bez zrýchlenia0,850362 33084,3 GiB
Eagle MTP0,905363 32986,8 GiB
DSpark (dspark7)0,855361 49786,9 GiB
DFlash 20,857361 52486,6 GiB

Nastavenie spekulatívnych variantov

Eagle MTP: vstavaná návrhová časť Qwenu, konfigurácia s tromi krokmi a štyrmi draft tokenmi, oficiálny postup.

DSpark: návrhový model RadixArk/Qwen3.8-27B-DSpark. Návrhový blok o sedem tokenoch, oficiálny postup.

DFlash 2: návrhový model z-lab/Qwen3.8-27B-DFlash2, paralelný návrh ôsmich tokenov a následné overenie, oficiálny postup.

Vstupná záťaž a meranie

Každá požiadavka dostala rovnaký prompt. Ten obsahoval technický text o približne 20 000 alebo 200 000 tokenoch a končil pokynom „output only code, no prose“. Režim premýšľania bol vypnutý. Výstup mal vynútenú dĺžku 2 048 tokenov.

Meranie používalo oficiálny benchmark sglang.benchmark.serving a natívne rozhranie /generate. Pred každým meraným bodom prebehla jedna zahrievacia požiadavka.

Úplná nameraná priepustnosť

Celková rýchlosť generovania v tokenoch/s. Označenie kontextu zodpovedá skupinám v grafoch.
KontextPožiadavkyBez zrýchleniaEagle MTPDSparkDFlash 2
20k146127222248
20k288262376446
20k4172474620684
20k83288201 2321 084
20k165761 3281 6971 675
200k139108224222

Použité modely:

Qwen3.8-27B-FP8, RadixArk DSpark a z-lab DFlash 2.

Ktorú variantu zvoliť pre vaše nasadenie

Vaša prioritaČo vyskúšať ako prvý
Zrýchlenie bez externého návrhového modeluEagle MTP
Najvyššia rýchlosť pre 1 až 4 používateľov, 20k kontextDFlash 2
Celková priepustnosť pre 8 až 16 používateľov, 20k kontextDSpark, pri 16 používateľoch porovnajte aj téměř zhodný DFlash 2
Jeden používateľ, 200k kontextDSpark alebo DFlash 2, výsledky sú prakticky vyrovnané
Diagnostika alebo ťažkosti s kompatibilitouVariant bez spekulatívneho dekódovania

Na našej zostave sa spekulatívne dekódovanie vyplatilo vo všetkých meraných scenároch. Vyberte variant podľa počtu používateľov a overte jeho prínos na vlastných úlohách.

Zhrnutie: Viac výkonu z rovnakého GPU bez ďalších investícií

Najväčší posun prináša už samotný prechod od bežného generovania ku spekulatívnemu dekódovaniu. MTP ponúka jednoduchšie nasadenie, DFlash 2 najvyššiu rýchlosť pre menšiu skupinu a DSpark silný výkon pri väčšej súbežnosti.

Správnym nastavením dostanete zo svojho GPU servera maximálnu dravosť a rýchlosť. Vyberte si metódu, ktorá najlepšie sedí vašej prevádzke, a doprajte svojim používateľom bleskové odpovede bez akýchkoľvek kompromisov. Objednávajte tu