Nejvýkonnější servery Nejvýkonnější servery
Vaše LLM generují tokeny šnečím tempem a s rostoucím kontextem se odezva propadá k nule? Jakýkoliv akcelerátor je lepší než nic. I klasické MTP přináší viditelné zrychlení oproti běžnému provozu. Souboj o absolutní špičku ale svádějí pokročilé architektury DSpark a DFlash 2. Která z nich v našich benchmarcích dominovala v rychlosti generování tokenů a proč neexistuje jedno univerzální řešení pro všechny scenáře? V našem detailním srovnání na kartě RTX PRO 6000 Blackwell vám ukážeme, po které architektuře sáhnout podle konkrétního typu úlohy a jak z vašeho hardwaru vytěžit maximum.

Čtyři varianty, jeden model a jedno GPU

Všechny varianty běžely se stejným modelem Qwen3.8-27B-FP8 v SGLangu na jedné NVIDIA RTX PRO 6000 Blackwell s 96 GB paměti. Porovnali jsme rychlost generování při sdílení serveru i při dlouhém kontextu.

Porovnali jsme variantu bez zrychlení, která generuje bez spekulativního dekódování, Eagle MTP s návrhovou (draft) částí vestavěnou přímo v Qwenu a dvě varianty s externím pomocným modelem. DSpark funguje tak, že pomocný model předpovídá další část textu krok za krokem, a jakmile narazí na místo, kde si není jistý, zastaví se a předá práci hlavnímu modelu k schválení. Naopak DFlash 2 nepostupuje po jednotlivých tokenech, ale navrhne rovnou celý blok textu najednou a hlavní model ho zkontroluje v jediném kroku.

Spekulativní dekódování: v čem se liší architektury

Zatímco princip zůstává stejný (ověřit více kandidátů v jednom cyklu), zásadní rozdíl je v nárocích na správu modelů. Eagle MTP má pomocnou část integrovanou přímo v těle Qwenu. Naopak DSpark a DFlash 2 vyžadují běh samostatného pomocného modelu, který sice zabere další část paměti GPU, ale nabízí pokročilejší strategie předpovídání.

Celkový výkon: DFlash 2 vede do čtyř uživatelů

Pro firemní AI API je důležité, kolik práce zvládne server celkem. Graf porovnává souhrnný výkon při 20k kontextu. Jeden aktivní uživatel zde znamená jeden současně generující požadavek.

Celková rychlost generování Qwen3.8-27B při 20k kontextu a jednom až 16 současných požadavcích

DFlash 2 vede do čtyř současných uživatelů, od osmi přebírá vedení DSpark. Při nejvyšší zátěži jsou obě varianty téměř vyrovnané. Eagle MTP zůstává za nimi, ale všechny tři možnosti výrazně překonávají generování oproti variantě bez zrychlení.

Vyzkoušejte AI/GPU server až na 7 dní ZDARMA

Otestujte výkon NVIDIA RTX PRO 6000 Blackwell pro vlastní AI model, firemní API i více uživatelů současně. Bez investice do vlastního hardwaru si ověřte, která konfigurace nejlépe odpovídá vašim úlohám.

Vyzkoušejte AI/GPU server
RTX PRO 6000 Blackwell

Rychlost pro uživatele: celkový výkon není vše

Vyšší celkový výkon neznamená rychlejší odpověď pro každého. Při sdílení serveru se výkon rozděluje mezi požadavky. Graf ukazuje průměrnou rychlost generování na jednoho uživatele.

Průměrná rychlost na uživatele při sdílení Qwen3.8-27B jedním až 16 současnými požadavky

DFlash 2 nabízí nejvyšší rychlost při menším počtu uživatelů. DSpark naopak mezi čtyřmi a osmi požadavky drží téměř stejné tempo na uživatele. Při nejvyšší zátěži se obě varianty sbližují a stále zůstávají výrazně rychlejší než Eagle MTP i varianta bez zrychlení.

Dlouhý kontext: DSpark a DFlash 2 téměř shodně

Pracujete s dlouhými dokumenty nebo rozsáhlým kódem? Porovnali jsme rychlost jednoho požadavku při 20k a 200k kontextu, abychom zjistili, zda delší vstup změní pořadí.

Rychlost jednoho požadavku při 20k a 200k kontextu pro variantu bez zrychlení, Eagle MTP, DSpark a DFlash 2

DFlash 2 vede při kratším vstupu, zatímco při dlouhém kontextu jsou DSpark a DFlash 2 prakticky vyrovnané. DSpark si udržel téměř stejnou rychlost, ostatní varianty mírně zpomalily. Obě externí varianty dosáhly při 200k kontextu přibližně 5,7× rychlosti generování bez zrychlení.

Kolikrát rychlejší: náskok zůstává i pod zátěží

Kolik výkonu získáte změnou dekódování? Graf ukazuje násobek rychlosti oproti variantě bez zrychlení při stejném počtu současných požadavků.

Násobky rychlosti oproti variantě bez zrychlení při 20k kontextu pro jednoho, dva, čtyři a 16 uživatelů

S rostoucí zátěží se náskok zmenšuje, ale zrychlení se vyplatilo ve všech měřených bodech. DFlash 2 pro jednoho uživatele dosahuje přibližně 5,4× rychlosti. I při nejvyšší souběžnosti zůstává nejméně výkonné Eagle MTP přibližně 2,3× rychlejší než varianta bez zrychlení.

Výhody a nevýhody jednotlivých variant

Bez zrychlení: jednoduchý provoz a záložní řešení

  • Nejjednodušší konfigurace - méně součástí, které musíte ladit a kontrolovat.
  • Vhodný kontrolní bod - ověříte, zda vám konkrétní zrychlení skutečně pomáhá.
  • Nejnižší naměřený výkon

Eagle MTP: nejednodušší setup

  • Bez externího návrhového modelu - MTP je součástí modelu.
  • Zrychlení zůstavá stabilní po celý test
  • Nižší rychlost než obě externí varianty
  • Nutná podpora výrobce modelu

DSpark: silná volba pro více současných požadavků

  • Nejvyšší celkový výkon při osmi a 16 uživatelích
  • Stabilní rychlost při dlouhém kontextu
  • Potřebujete kompatibilní návrhový model
  • Slabší výsledek při malé souběžnosti

DFlash 2: nejrychlejší pro menší počet uživatelů

  • Nejvyšší rychlost při malé souběžnosti
  • Konkurenceschopný i při dlouhém kontextu
  • Potřebujete kompatibilní návrhový model
  • Nejvyšší souběžnost není jeho nejsilnější bod

Paměť a režie: vyšší rychlost není zadarmo

Abychom u zrychlených variant zachovali přibližně stejnou kapacitu KV cache jako při generování bez návrhů tokenů, potřebovali jsme zhruba 2 až 3 GB grafické paměti navíc. Paměťová cena byla u MTP, DSpark i DFlash 2 podobná.

Testovací prostředí a úplné výsledky

Rozbalte podrobnosti pro úplnou konfiguraci, paměťové nároky a metodiku měření.

Hardware, model a engine

ParametrTestovaná hodnota
Cílový modelQwen/Qwen3.8-27B-FP8
GPU1× NVIDIA RTX PRO 6000 Blackwell, 96 GB
EngineSGLang v0.5.20-cu130, oficiální kontejner
KV cacheFP8 E4M3
Attention backendFlashInfer
mamba-full-memory-ratio3,67 pro variantu bez zrychlení a Eagle MTP; 11,01 pro DSpark a DFlash 2
Mamba radix strategieextra_buffer_lazy
SSM stavyFP32
Chunked prefill2 048 tokenů
Prefill CUDA graphsvypnuto
Maximální počet požadavků16

Paměťové nastavení a kapacita KV cache

Parametr mem-fraction jsme pro každou variantu upravili tak, aby velikost KV poolu zůstala přibližně stejná. Konfigurace se spekulací zabírali o 2,3 až 2,6 GiB více než varianta bez zrychlení.

Konfiguracemem-fractionKV poolObsazená paměť GPU v klidu
Bez zrychlení0,850362 33084,3 GiB
Eagle MTP0,905363 32986,8 GiB
DSpark (dspark7)0,855361 49786,9 GiB
DFlash 20,857361 52486,6 GiB

Nastavení spekulativních variant

Eagle MTP: vestavěná návrhová část Qwenu, konfigurace se třemi kroky a čtyřmi draft tokeny, oficiální postup.

DSpark: návrhový model RadixArk/Qwen3.8-27B-DSpark. Návrhový blok o sedmi tokenech, oficiální postup.

DFlash 2: návrhový model z-lab/Qwen3.8-27B-DFlash2, paralelní návrh osmi tokenů a následné ověření, oficiální postup.

Vstupní zátěž a měření

Každý požadavek dostal stejný prompt. Ten obsahoval technický text o přibližně 20 000 nebo 200 000 tokenech a končil pokynem „output only code, no prose“. Režim přemýšlení byl vypnut. Výstup měl vynucenou délku 2 048 tokenů.

Měření používalo oficiální benchmark sglang.benchmark.serving a nativní rozhraní /generate. Před každým měřeným bodem proběhl jeden zahřívací požadavek.

Úplná naměřená propustnost

Celková rychlost generování v tokenech/s. Označení kontextu odpovídá skupinám v grafech.
KontextPožadavkyBez zrychleníEagle MTPDSparkDFlash 2
20k146127222248
20k288262376446
20k4172474620684
20k83288201 2321 084
20k165761 3281 6971 675
200k139108224222

Použité modely:

Qwen3.8-27B-FP8, RadixArk DSpark a z-lab DFlash 2.

Kterou variantu zvolit pro vaše nasazení

Vaše prioritaCo vyzkoušet jako první
Zrychlení bez externího návrhového modeluEagle MTP
Nejvyšší rychlost pro 1 až 4 uživatele, 20k kontextDFlash 2
Celková propustnost pro 8 až 16 uživatelů, 20k kontextDSpark, při 16 uživatelích porovnejte i téměř shodný DFlash 2
Jeden uživatel, 200k kontextDSpark nebo DFlash 2, výsledky jsou prakticky vyrovnané
Diagnostika nebo potíže s kompatibilitouVarianta bez spekulativního dekódování

Na naší sestavě se spekulativní dekódování vyplatilo ve všech měřených scénářích. Vyberte variantu podle počtu uživatelů a ověřte její přínos na vlastních úlohách.

Shrnutí: více výkonu ze stejného GPU

Největší posun přináší už samotný přechod od běžného generování ke spekulativnímu dekódování. MTP nabízí jednodušší nasazení, DFlash 2 nejvyšší rychlost pro menší skupinu a DSpark silný výkon při větší souběžnosti.

Správným nastavením dostanete ze svého GPU serveru maximální dravost a rychlost. Vyberte si metodu, která nejlépe sedí vašemu provozu, a dopřejte svým uživatelům bleskové odpovědi bez jakýchkoliv kompromisů.