Přeskočit na obsah
ejaj.cz

DogLM

Zdarma

Nezávislý benchmark, který testuje, zda LLM při generování videoherního kódu se psí postavou automaticky umožní hráči psa pohladit — hodí se lidem, kteří srovnávají kvalitu a "herní intuici" AI modelů při generování kódu.

mikeushakov.github.io
Náhled nástroje DogLM

O nástroji

DogLM je žebříček LLM modelů (Gemini, Claude, GPT, Grok, Qwen, DeepSeek, Kimi, Mistral, GLM), který měří jednu konkrétní věc: když model dostane zadání vytvořit hru s psí postavou bez jakékoli instrukce o interakci hráče se psem, otestuje se, zda si model sám domyslí a naprogramuje možnost psa pohladit. Vychází z herního designového pravidla popularizovaného účtem "Can You Pet the Dog?" – pokud má hra psa, hráč by ho měl moci pohladit. Nástroj zveřejňuje detailní žebříček s průměrným skóre (0–20) za pět běhů testu na 10 promptech, rozlišuje "cued" (pes zmíněn v promptu) a "uncued" skóre, ukazuje směrodatnou odchylku, počet úspěšně vygenerovaných her a náklady na vygenerování jedné hry v USD (od cca $0,005 u Mistral Large po $0,32 u Claude Fable 5). Aktuálně vede Gemini 3.7 Flash se skóre 8,2/20, zatímco řada modelů (Mistral, GLM, Claude Opus 4.8) dosahuje skóre blízkého nule. Stránka dále obsahuje ukázkové vygenerované hry, rozdělení typů interakcí (hlazení, animace, příkaz) a metodiku hodnocení pomocí modelu Claude Sonnet 4.6 jako rozhodčího. Web je celý v angličtině a slouží především jako výzkumný/porovnávací nástroj pro vývojáře a výzkumníky sledující schopnosti AI modelů generovat herní logiku, nikoli jako produkční nástroj pro tvorbu her.

AI novinky do e-mailu

Každý pátek 3 vybrané AI nástroje, prompt týdne a to nejdůležitější ze světa AI – přehledně, česky a bez balastu.

Jeden z nejstarších pravidelných českých AI newsletterů.

Jednou týdně, v pátek. Žádný spam – odhlásíte se jedním klikem.

Další nástroje z katalogu

Další nástroje z katalogu, které stojí za prohlédnutí.