Přeskočit na obsah
ejaj.cz

LMCache

NeuvedenoOpen sourceVývojářské nástroje

Open-source infrastruktura pro KV cache, která zrychluje LLM inferenci ukládáním a znovupoužitím kontextu.

lmcache.ai
Náhled nástroje LMCache

O nástroji

LMCache je modulární vrstva pro KV cache určená pro LLM inferenci, zaměřená na workloady s dlouhými prompty, historií konverzací a opakovaně používaným obsahem. Nástroj umožňuje ukládat, znovupoužívat, komprimovat, vyhledávat, přesouvat a monitorovat KV cache napříč GPU, CPU pamětí a externími úložišti, čímž snižuje dobu do prvního tokenu (TTFT) a zvyšuje propustnost, zejména u dlouhého kontextu, agentních a multi-turn konverzačních scénářů i RAG. Nástroj je vendor-neutrální a funguje jako KV cache vrstva pro řadu open-source serving enginů, mimo jiné podporuje integraci s vLLM a SGLang, a to buď v in-process módu (LMCacheConnectorV1) přímo uvnitř vLLM procesu, nebo jako standalone server, ke kterému se může připojit více instancí vLLM. Podporuje širokou škálu storage backendů, včetně CPU RAM, lokálního SSD disku, Redis/Valkey, Mooncake, InfiniStore, S3-kompatibilního úložiště, NIXL a GDS. Díky technologii CacheBlend dokáže nacházet znovupoužitelné KV cache chunky i mimo přesnou shodu prefixu. Projekt je dostupný na GitHubu, kde má přes 8 200 hvězd, více než 350 přispěvatelů a přes 115 tisíc stažení z PyPI, což naznačuje aktivní open-source vývoj a komunitu. Používají ho infrastrukturní týmy, cloud provideři a další open-source projekty v produkčním nasazení. Informace o cenovém modelu ani o dostupnosti bezplatné verze nejsou na webu uvedeny.

Klíčové vlastnosti

  • Ukládání a znovupoužití KV cache napříč GPU, CPU a diskem
  • Sdílení cache mezi více instancemi vLLM přes standalone server
  • Vyhledávání znovupoužitelných chunků i mimo přesný shodný prefix (CacheBlend)
  • Podpora storage backendů Redis, Mooncake, S3, NIXL a dalších
  • Integrace s vLLM a SGLang v in-process i standalone módu
  • Open-source projekt s aktivní komunitou na GitHubu

Časté dotazy

Co přesně LMCache dělá?

Je to modulární vrstva pro KV cache, která ukládá, znovupoužívá, komprimuje a přesouvá kontext LLM napříč GPU, CPU pamětí a externími úložišti. Díky tomu se zkracuje doba do prvního tokenu a roste propustnost hlavně u dlouhých promptů, multi-turn konverzací a RAG scénářů.

Kolik LMCache stojí?

Na webu není uveden žádný cenový model ani informace o placených plánech, jde o open-source projekt dostupný na GitHubu.

Pro koho je LMCache určený a jak začít?

Je určen infrastrukturním týmům, cloud providerům a vývojářům provozujícím LLM servery, kteří chtějí zrychlit inferenci ve vLLM nebo SGLang. Začít lze stažením z GitHubu podle quickstart dokumentace a příkladů integrace.

Kategorie

AI novinky do e-mailu

Každý pátek 3 vybrané AI nástroje, prompt týdne a to nejdůležitější ze světa AI — přehledně, česky a bez balastu.

Jeden z nejstarších pravidelných českých AI newsletterů.

Jednou týdně, v pátek. Žádný spam — odhlásíte se jedním klikem.

Podobné nástroje

Hledáte alternativu k LMCache? Tady je 6 podobných nástrojů z kategorie Vývojářské nástroje.

Zobrazit všechny alternativy v kategorii Vývojářské nástroje