Přeskočit na obsah
ejaj.cz

vllm

ZdarmaOpen sourceAPIVývojářské nástroje

Open-source engine pro rychlé a levné nasazení jazykových modelů (LLM) s vysokou propustností a OpenAI-kompatibilním API.

vllm.ai

O nástroji

vLLM je open-source inferenční a servírovací engine pro velké jazykové modely, zaměřený na vysokou propustnost a efektivní využití paměti. Využívá technologii PagedAttention, pokročilé plánování a kontinuální dávkování (continuous batching) pro maximální využití GPU, díky čemuž umožňuje snížit náklady na inferenci při zachování výkonu. Nástroj podporuje nasazení nejrůznějších open-source modelů (např. DeepSeek, Llama, Qwen, Mistral, Gemma) na širokou škálu hardwaru včetně NVIDIA CUDA GPU, AMD ROCm, Google Cloud TPU, Intel XPU, CPU i Apple Silicon. Obsahuje drop-in OpenAI-kompatibilní API pro snadnou integraci do stávajících aplikací. vLLM je komunitní projekt podporovaný organizacemi jako AWS, Google Cloud, NVIDIA, Intel či IBM, s aktivní podporou přes Slack, fórum a GitHub Issues. Instalace probíhá přes Python (pip/uv) nebo Docker, vyžaduje Python 3.10+.

Kategorie

AI novinky do e-mailu

Každý pátek 3 vybrané AI nástroje, prompt týdne a to nejdůležitější ze světa AI — přehledně, česky a bez balastu.

Jeden z nejstarších pravidelných českých AI newsletterů.

Jednou týdně, v pátek. Žádný spam — odhlásíte se jedním klikem.

Podobné nástroje

Hledáte alternativu k vllm? Tady je 6 podobných nástrojů z kategorie Vývojářské nástroje.

Zobrazit všechny alternativy v kategorii Vývojářské nástroje