Přeskočit na obsah
ejaj.cz

SenseVoice

NeuvedenoOpen sourceAPIPřeklad: text na řeč

Open-source model pro vícejazyčné rozpoznávání řeči, detekci emocí a zvukových událostí, určený vývojářům hlasových aplikací s LLM.

funaudiollm.github.io
Náhled nástroje SenseVoice

O nástroji

SenseVoice je součástí projektu FunAudioLLM (Alibaba/Tongyi Speech Team) a jde o základní řečový model kombinující automatické rozpoznávání řeči (ASR), identifikaci jazyka (LID), rozpoznávání emocí v řeči (SER) a detekci zvukových událostí (AED), jako je hudba na pozadí, potlesk, smích, pláč, kašel nebo kýchání. Vydaná verze SenseVoice-Small podporuje mandarínštinu, kantonštinu, angličtinu, japonštinu a korejštinu, zatímco větší model SenseVoice-Large zvládá přes 50 jazyků. Model vyniká rychlostí inference – latence rozpoznávání pod 80 ms, což je podle uváděných údajů více než 5× rychleji než Whisper-Small a 15× rychleji než Whisper-large. Projekt zahrnuje i CosyVoice pro syntézu přirozené řeči a je určen především vývojářům a firmám budujícím hlasové aplikace propojené s velkými jazykovými modely. Modely SenseVoice i CosyVoice jsou open-source, dostupné na Modelscope a Huggingface, včetně tréninkového, inferenčního a fine-tuning kódu na GitHubu. K dispozici jsou skripty pro fine-tuning a nasazení služby s podporou souběžných požadavků a klientské knihovny pro Python, C++, HTML, Java a C#. Informace o ceně nejsou v dostupných materiálech uvedeny.

Klíčové vlastnosti

  • Automatické rozpoznání řeči ve více jazycích
  • Detekce emocí v hlase (SER)
  • Rozpoznávání zvukových událostí jako smích či pláč
  • Latence rozpoznávání pod 80 ms
  • Podpora přes 50 jazyků u SenseVoice-Large
  • Open-source kód pro trénink i fine-tuning

Časté dotazy

Co přesně SenseVoice umí?

Kombinuje rozpoznávání řeči, identifikaci jazyka, detekci emocí v hlase a rozpoznávání zvukových událostí jako hudba, smích nebo kašel.

Kolik SenseVoice stojí?

Jde o open-source model dostupný zdarma ke stažení na Modelscope a Huggingface, informace o placené verzi nejsou uvedeny.

Pro koho je SenseVoice určen a jak začít?

Je určen vývojářům a firmám budujícím hlasové aplikace propojené s LLM – stačí stáhnout model a kód z GitHubu, k dispozici jsou i klientské knihovny pro Python, C++, Java, C# a HTML.

Kategorie

AI novinky do e-mailu

Každý pátek 3 vybrané AI nástroje, prompt týdne a to nejdůležitější ze světa AI — přehledně, česky a bez balastu.

Jeden z nejstarších pravidelných českých AI newsletterů.

Jednou týdně, v pátek. Žádný spam — odhlásíte se jedním klikem.

Podobné nástroje

Hledáte alternativu k SenseVoice? Tady je 6 podobných nástrojů z kategorie Překlad: text na řeč.

Zobrazit všechny alternativy v kategorii Překlad: text na řeč