LMCache
Open-source infrastruktura pro KV cache, která zrychluje LLM inferenci ukládáním a znovupoužitím kontextu.

O nástroji
LMCache je modulární vrstva pro KV cache určená pro LLM inferenci, zaměřená na workloady s dlouhými prompty, historií konverzací a opakovaně používaným obsahem. Nástroj umožňuje ukládat, znovupoužívat, komprimovat, vyhledávat, přesouvat a monitorovat KV cache napříč GPU, CPU pamětí a externími úložišti, čímž snižuje dobu do prvního tokenu (TTFT) a zvyšuje propustnost, zejména u dlouhého kontextu, agentních a multi-turn konverzačních scénářů i RAG. Nástroj je vendor-neutrální a funguje jako KV cache vrstva pro řadu open-source serving enginů, mimo jiné podporuje integraci s vLLM a SGLang, a to buď v in-process módu (LMCacheConnectorV1) přímo uvnitř vLLM procesu, nebo jako standalone server, ke kterému se může připojit více instancí vLLM. Podporuje širokou škálu storage backendů, včetně CPU RAM, lokálního SSD disku, Redis/Valkey, Mooncake, InfiniStore, S3-kompatibilního úložiště, NIXL a GDS. Díky technologii CacheBlend dokáže nacházet znovupoužitelné KV cache chunky i mimo přesnou shodu prefixu. Projekt je dostupný na GitHubu, kde má přes 8 200 hvězd, více než 350 přispěvatelů a přes 115 tisíc stažení z PyPI, což naznačuje aktivní open-source vývoj a komunitu. Používají ho infrastrukturní týmy, cloud provideři a další open-source projekty v produkčním nasazení. Informace o cenovém modelu ani o dostupnosti bezplatné verze nejsou na webu uvedeny.
Klíčové vlastnosti
- Ukládání a znovupoužití KV cache napříč GPU, CPU a diskem
- Sdílení cache mezi více instancemi vLLM přes standalone server
- Vyhledávání znovupoužitelných chunků i mimo přesný shodný prefix (CacheBlend)
- Podpora storage backendů Redis, Mooncake, S3, NIXL a dalších
- Integrace s vLLM a SGLang v in-process i standalone módu
- Open-source projekt s aktivní komunitou na GitHubu
Časté dotazy
Co přesně LMCache dělá?
Je to modulární vrstva pro KV cache, která ukládá, znovupoužívá, komprimuje a přesouvá kontext LLM napříč GPU, CPU pamětí a externími úložišti. Díky tomu se zkracuje doba do prvního tokenu a roste propustnost hlavně u dlouhých promptů, multi-turn konverzací a RAG scénářů.
Kolik LMCache stojí?
Na webu není uveden žádný cenový model ani informace o placených plánech, jde o open-source projekt dostupný na GitHubu.
Pro koho je LMCache určený a jak začít?
Je určen infrastrukturním týmům, cloud providerům a vývojářům provozujícím LLM servery, kteří chtějí zrychlit inferenci ve vLLM nebo SGLang. Začít lze stažením z GitHubu podle quickstart dokumentace a příkladů integrace.
Kategorie
AI novinky do e-mailu
Každý pátek 3 vybrané AI nástroje, prompt týdne a to nejdůležitější ze světa AI — přehledně, česky a bez balastu.
Jeden z nejstarších pravidelných českých AI newsletterů.
Podobné nástroje
Hledáte alternativu k LMCache? Tady je 6 podobných nástrojů z kategorie Vývojářské nástroje.

Vectorizer AI
FreemiumPřevádí rastrové obrázky PNG, JPG, GIF, BMP a WebP na vektorové formáty SVG, PDF, EPS a DXF pomo...

Stable Diffusion
FreemiumStability AI je platforma pro generování obrázků, videa a dalšího obsahu pomocí generativní AI,...

Whisper
ZdarmaPřevádí mluvenou řeč na text ve více než 90 jazycích. Whisper je open-source model od OpenAI tré...

Pinecone
FreemiumPinecone je vektorová databáze jako služba, která umožňuje ukládat, spravovat a prohledávat vekt...

Escape
NeuvedenoEscape je AI-powered platforma pro ofenzivní bezpečnost, která automatizuje discovery, pentestin...

MarsAi
ZdarmaMarsX je vývojářská platforma, která kombinuje AI, NoCode, kód a MicroApps pro rychlé budování S...
