Přeskočit na obsah
ejaj.cz

lmdeploy

NeuvedenoAPIVývojářské nástroje

LMDeploy je nástroj pro kompresi, nasazení a servírování velkých jazykových modelů (LLM) s až 1,8× vyšším průtokem požadavků než vLLM.

lmdeploy.readthedocs.io
Náhled nástroje lmdeploy

O nástroji

LMDeploy je toolkit určený pro vývojáře a týmy, kteří potřebují efektivně nasadit a provozovat velké jazykové modely (LLM). Nabízí efektivní inferenci díky funkcím jako persistent batch (continuous batching), blocked KV cache, dynamic split&fuse, tensor paralelismus a vysoce výkonné CUDA kernely, čímž dosahuje až 1,8× vyššího průtoku požadavků oproti vLLM. Nástroj podporuje kvantizaci vah i k/v cache (weight-only a k/v quantization), přičemž při 4bitové inferenci dosahuje až 2,4× vyššího výkonu oproti FP16. Kvalita kvantizace byla ověřena pomocí evaluace OpenCompass. Dále umožňuje distribuci požadavků napříč více stroji a kartami prostřednictvím distribuční služby a je kompatibilní s technikami jako AWQ nebo Automatic Prefix Caching. Dokumentace pokrývá nasazení jak textových LLM, tak vision-language modelů (VLM), včetně offline inference pipeline a OpenAI-kompatibilního serveru. Podle dostupných informací dokumentace neuvádí licenční model ani cenu nástroje, proto tyto údaje nelze potvrdit.

Klíčové vlastnosti

  • Persistent batch (continuous batching) a blocked KV cache
  • Dynamic split&fuse a tensor paralelismus
  • Kvantizace vah i k/v cache s až 2,4× rychlejší 4bitovou inferencí
  • Podpora AWQ, GPTQ, SmoothQuant a Automatic Prefix Caching
  • OpenAI-kompatibilní server i offline inference pipeline
  • Nasazení textových LLM i vision-language modelů (VLM)

Časté dotazy

Co LMDeploy umí?

Je to toolkit pro kompresi, nasazení a servírování velkých jazykových modelů, který díky continuous batching, blocked KV cache a tensor paralelismu dosahuje až 1,8× vyššího průtoku než vLLM. Podporuje i vision-language modely a nabízí OpenAI-kompatibilní server.

Kolik LMDeploy stojí?

Dokumentace neuvádí licenční model ani cenu nástroje, tyto údaje proto nelze potvrdit.

Pro koho je LMDeploy určen a jak začít?

Je určen vývojářům a týmům, kteří potřebují efektivně provozovat LLM ve větším měřítku. Začít lze instalací a spuštěním přes nabízené Quick Start, offline inference pipeline nebo OpenAI-kompatibilní server.

Kategorie

AI novinky do e-mailu

Každý pátek 3 vybrané AI nástroje, prompt týdne a to nejdůležitější ze světa AI – přehledně, česky a bez balastu.

Jeden z nejstarších pravidelných českých AI newsletterů.

Jednou týdně, v pátek. Žádný spam – odhlásíte se jedním klikem.

Podobné nástroje

Hledáte alternativu k lmdeploy? Tady je 6 podobných nástrojů z kategorie Vývojářské nástroje.

Zobrazit všechny alternativy v kategorii Vývojářské nástroje

Další nástroje v kategorii Vývojářské nástroje

Nezůstávejte jen u nejoblíbenějších – tohle jsou další nástroje z kategorie Vývojářské nástroje, které stojí za prohlédnutí.