Přeskočit na obsah
ejaj.cz

lmdeploy

NeuvedenoAPIVývojářské nástroje

LMDeploy je nástroj pro kompresi, nasazení a servírování velkých jazykových modelů (LLM) s až 1,8× vyšším průtokem požadavků než vLLM.

lmdeploy.readthedocs.io

O nástroji

LMDeploy je toolkit určený pro vývojáře a týmy, kteří potřebují efektivně nasadit a provozovat velké jazykové modely (LLM). Nabízí efektivní inferenci díky funkcím jako persistent batch (continuous batching), blocked KV cache, dynamic split&fuse, tensor paralelismus a vysoce výkonné CUDA kernely, čímž dosahuje až 1,8× vyššího průtoku požadavků oproti vLLM. Nástroj podporuje kvantizaci vah i k/v cache (weight-only a k/v quantization), přičemž při 4bitové inferenci dosahuje až 2,4× vyššího výkonu oproti FP16. Kvalita kvantizace byla ověřena pomocí evaluace OpenCompass. Dále umožňuje distribuci požadavků napříč více stroji a kartami prostřednictvím distribuční služby a je kompatibilní s technikami jako AWQ nebo Automatic Prefix Caching. Dokumentace pokrývá nasazení jak textových LLM, tak vision-language modelů (VLM), včetně offline inference pipeline a OpenAI-kompatibilního serveru. Podle dostupných informací dokumentace neuvádí licenční model ani cenu nástroje, proto tyto údaje nelze potvrdit.

Kategorie

AI novinky do e-mailu

Každý pátek 3 vybrané AI nástroje, prompt týdne a to nejdůležitější ze světa AI — přehledně, česky a bez balastu.

Jeden z nejstarších pravidelných českých AI newsletterů.

Jednou týdně, v pátek. Žádný spam — odhlásíte se jedním klikem.

Podobné nástroje

Hledáte alternativu k lmdeploy? Tady je 6 podobných nástrojů z kategorie Vývojářské nástroje.

Zobrazit všechny alternativy v kategorii Vývojářské nástroje