5 октября 2026 г.
GitHub представил ReviewBench для сравнения ИИ-агентов по проверке кода
GitHub открыл ReviewBench, бенчмарк для оценки ИИ-агентов по проверке кода на 219 pull request из 19 языков программирования.
GitHub представил ReviewBench, открытый бенчмарк для сравнения ИИ-агентов, которые анализируют изменения в коде и формируют замечания к pull request. Проект рассчитан на разработчиков и команды, которым нужно оценивать такие системы по единой методике, а не по отдельным демонстрациям.
В набор вошли 219 pull request
ReviewBench включает 219 публичных pull request из 187 репозиториев с открытой лицензией. Набор охватывает 19 языков программирования. При его формировании GitHub изучил распределение 103,9 млн pull request, чтобы приблизить состав тестов к реальным задачам разработки.
Размеры изменений распределены с поправкой в пользу более содержательных запросов. В наборе оставили меньше небольших изменений в одном файле и больше многофайловых задач, где автоматическая проверка требует полноценного анализа.
Эталонные ответы проверили инженеры
Для формирования эталонного набора GitHub использовал несколько источников находок. Каждую проблему отнесли к категории и уровню серьёзности. Затем старшие инженеры, которые не участвовали в создании набора, повторно оценили все эталонные находки.
Результаты независимой проверки совпали с исходной разметкой в 96,6% случаев. GitHub также зафиксировал версии датасета, правил оценки и механизма сопоставления. Это позволяет повторять измерения на одинаковой конфигурации и сравнивать изменения результатов после обновления системы.
Метрики учитывают разные задачи ревью
ReviewBench использует шесть метрик в двух группах. Они оценивают полноту поиска известных проблем, точность замечаний и способность агента находить дополнительные дефекты, которых не было в исходном эталонном наборе.
Результаты можно разделять по категориям и серьёзности проблем. Коэффициент β в Fβ-оценке позволяет изменить баланс между полнотой и точностью: один сценарий требует находить больше потенциальных ошибок, другой снижает число лишних замечаний.
Исследовательская версия ReviewBench доступна для самостоятельной оценки собственных агентов. При этом результаты на открытом наборе не доказывают качество инструмента в конкретном проекте. Перед использованием в учебной или рабочей разработке стоит отдельно проверить поведение системы на нужном языке, стеке и типах изменений.
