GitHub 5. října 2026 spustil ReviewBench, otevřený benchmark pro hodnocení AI agentů při code review, postavený na reprezentativních pull requestech z produkčního prostředí. Benchmark kombinuje vícezdrojovou ground truth s kalibrovaným hodnocením. Výsledky jsou navrženy tak, aby odpovídaly reálným metrikám z produkce.
GitHub oznámil ReviewBench jako benchmark zaměřený specificky na code review agenty. Datová sada je sestavena z reálných pull requestů na GitHubu a hodnocení kombinuje pohledy více recenzentů, čímž se snaží eliminovat bias jednoho hodnotitele. Metriky jsou kalibrované tak, aby odrážely výkon v produkčním prostředí, nikoliv laboratorní skóre.
Benchmark je open-source a dostupný komunitě. GitHub ho spouští v době, kdy firmy nasazují stále více AI nástrojů pro automatizaci code review a potřebují způsob, jak jejich výkon objektivně porovnat. ReviewBench má být referenčním bodem pro srovnání různých agentů i verzí GitHub Copilot.
Proč by vás to mělo zajímat
Vybíráte nástroj pro automatizované code review? ReviewBench dává srovnatelný základ — porovnejte skóre svého stávajícího nástroje s benchmarkem, než prodlužujete licenci nebo přecházíte na konkurenci.


