Najvýkonnejšie servery Najvýkonnejšie servery

Extrémne rýchla LLM inferencia cez vLLM na NVIDIA RTX PRO 6000 Blackwell GPU

Pohotovosť a nápoveda > AI/GPU > Extrémne rýchla LLM inferencia cez vLLM na NVIDIA RTX PRO 6000 Blackwell GPU
Prevádzkujte AI/GPU server pre extrémne rýchlu inferenciu veľkých jazykových modelov a obsluhujte viac používateľov súčasne bez investícií do vlastného hardvéru. Naše servery s NVIDIA RTX PRO 6000 Blackwell ponúkajú vysoký výkon, 96 GB VRAM a ideálne zázemie pre nasadenie vLLM, vďaka ktorému ľahko rozbehnete aj rozsiahle modely, napríklad 120B FP4. V tomto návode vás krok za krokom prevedieme objednávkou služby, základným nastavením servera, inštaláciou vLLM aj prvým úspešným API testom.

Ako si službu objednať

AI/GPU server si objednáte priamo na stránke služby, kde zvolíte vhodnú konfiguráciu a dokončíte objednávku. Ak hľadáte ideálne riešenie pre vLLM a rozsiahlejšie LLM modely, odporúčame zvoliť variant s NVIDIA RTX PRO 6000 Blackwell.

Po dokončení objednávky a úspešnej platbe dostanete e-mail s prihlasovacími údajmi. Hneď ako sa pripojíte k serveru, môžete okamžite začať s prípravou prostredia pre AI inference server.

Vyskúšajte AI/GPU server až na 7 dní ZADARMO!

Presvedčte sa sami o sile najvýkonnejších AI GPU na trhu.
Otestujte AI VPS a plaťte až po vyskúšaní.

Chcem vyskúšať VPS ZADARMO
RTX PRO 6000 Blackwell

Úložisko a práca s dátami

Každý AI/GPU server je pripravený tak, aby ste mohli oddeliť systémové súbory od dát pre modely a cache. Systémový disk má kapacitu 150 GB, zatiaľ čo dátový disk ponúka 2 TB a je pripojený ako /data.

Práve do umiestnenia /data odporúčame ukladať virtuálne prostredia, stiahnuté modely, Hugging Face cache aj ďalšie objemnejšie súbory. Získate tak viac priestoru pre dlhodobú prevádzku a zároveň nepreťažíte systémový disk.

Ako začať s vLLM na našom serveri

vLLM je výborná voľba pre každého, kto chce prevádzkovať AI modely efektívnejšie, rýchlejšie a s lepšou obsluhou viacerých požiadaviek naraz. Nižšie nájdete kompletný postup, ako pripraviť server, nainštalovať potrebné nástroje a spustiť prvý API endpoint pre inferenciu.

1. Základný setup systému

Najprv aktualizujte balíčky a nastavte oprávnenia k dátovému disku. Tým si pripravíte prostredie, do ktorého budete ukladať cache, virtuálne prostredie aj modely pre vLLM.

Bash
sudo apt update
sudo chown vpsuser:vpsuser /data

2. Inštalácia NVIDIA CUDA Toolkitu

Aby vLLM využilo výkon GPU naplno, je nevyhnutné doinštalovať aktuálny NVIDIA CUDA Toolkit. Nižšie uvádzame príklad pre Ubuntu 24.04, ale počítajte s tým, že sa inštalačné príkazy môžu v čase meniť podľa verzie systému alebo CUDA balíčkov.

Ak by niektorý príkaz prestal fungovať, otvorte stránku NVIDIA CUDA Downloads a vygenerujte si aktuálny postup pre vašu konfiguráciu systému.

Bash
wget https://developer.download.nvidia.com/compute/cuda/repos/ubuntu2404/x86_64/cuda-keyring_1.1-1_all.deb
sudo dpkg -i cuda-keyring_1.1-1_all.deb
sudo apt-get update
sudo apt-get -y install cuda-toolkit-13-2

3. Inštalácia Python prostredia a vLLM

Následne vytvoríme samostatné Python virtuálne prostredie na dátovom disku. Vďaka tomu zostane inštalácia prehľadná, ľahko prenosná a nebude zbytočne zaťažovať systémovú časť servera.

Bash
sudo apt install -y python3-pip python3.12-venv
python3 -m venv /data/vllm-py
source /data/vllm-py/bin/activate

pip install vllm

Po dokončení inštalácie budete mať pripravené prostredie pre spustenie vLLM servera aj ďalších knižníc podľa potreby.

4. Nastavenie cache a spustenie vLLM API servera

Pred samotným spustením odporúčame nastaviť cache pre Hugging Face modely na dátový disk. Zabránite tým plneniu systémového úložiska a zároveň budete mať všetky veľké súbory prehľadne uložené na jednom mieste.

API kľúč si môžete jednoducho vygenerovať pomocou tr -dc 'A-Za-z0-9' </dev/urandom | head -c 32; echo a následne ho vložiť do príkazu namiesto VYGENERUJTE-SI-KLUC-A-VYMENTE.

Nižšie uvedený príklad spúšťa model NVIDIA Nemotron 120B, ktorý dobre ukazuje, aký potenciál majú servery s 96 GB VRAM a profesionálnou Blackwell grafikou pre rozsiahlejšie inference workloady.

Bash
export HF_HOME=/data/huggingface
vllm serve nvidia/NVIDIA-Nemotron-3-Super-120B-A12B-NVFP4 \
  --host 0.0.0.0 \
  --port 8000 \
  --trust-remote-code \
  --api-key VYGENERUJTE-SI-KLUC-A-VYMENTE

Po spustení začne vLLM pripravovať model pre inferenciu. Doba prvého načítania závisí od konkrétneho modelu a môže trvať až niekoľko minút.

Běžící vLLM server na AI GPU serveru

5. Otestovanie API v novej konzole

Hneď ako vLLM beží, otvorte si druhú konzolu a vykonajte test API. V ukážke nižšie nahraďte hodnotu VYGENERUJTE-SI-KLUC-A-VYMENTE vlastným kľúčom, ktorý ste nastavili v predchádzajúcom kroku.

Pri prvom požiadavku počítajte s tým, že model môže približne 10 sekúnd inicializovať odpoveď. Ďalšie requesty už bývajú rýchlejšie a čas zaberie prevažne samotné generovanie výstupu.

Bash
curl -sS http://localhost:8000/v1/chat/completions \
  -H "Content-Type: application/json" \
  -H "Authorization: Bearer VYGENERUJTE-SI-KLUC-A-VYMENTE" \
  -d '{
    "model": "nvidia/NVIDIA-Nemotron-3-Super-120B-A12B-NVFP4",
    "messages": [
      {"role": "user", "content": "Say hello and confirm you are working."}
    ],
    "max_tokens": 1000
  }' | jq -r '.choices[0].message.content'

Ak sa vráti textová odpoveď modelu, máte hotovo a váš vLLM inference server je pripravený pre ďalšiu integráciu, automatizáciu aj napojenie na vlastné aplikácie.

Úspěšný test VLLM API

Zhrnutie

AI/GPU server s NVIDIA RTX PRO 6000 Blackwell predstavuje rýchle a praktické riešenie pre každého, kto chce rozbehnúť vLLM, prevádzkovať vlastný inference endpoint a využiť vysoký výkon GPU bez obstarávania drahého fyzického hardvéru.

Vyskúšajte RTX PRO 6000 Blackwell pre  vLLM a AI inferenciu až na  7 dní ZADARMO:

Kontaktujte odborníka na AI GPU servery

Napíšte nám a pripravíme vám vhodné riešenie pre rýchle nasadenie vLLM, veľkých jazykových modelov aj vlastného AI API.