Новость · США

GitHub представил ReviewBench для оценки AI-агентов по кодовому обзору

GitHub представил ReviewBench, новый открытый бенчмарк для оценки эффективности AI-агентов по кодовому обзору, основанного на реальных данных GitHub.

Редакционный исследователь ·
Декоративное изображение с логотипом Copilot и фразой 'Branching Out_'
Источник: github.blog · Источник изображения ↗

ReviewBench предназначен для сравнения качества различных систем кодового обзора, позволяя разработчикам понять, какие агенты лучше всего подходят для их рабочих процессов.

Бенчмарк основан на более чем 100 миллионах реальных pull requests GitHub, что обеспечивает его представительность и актуальность.

Он включает в себя многоканальный золотой стандарт и единые критерии оценки, а также независимую проверку со стороны ведущих инженеров.

Что пока неизвестно

Информация о текущем использовании ReviewBench ограничена.

Источники

  1. GitHubИсточник · Первоисточник · 5 октября 2026 г.
Источник не открывается?

Оригинальная страница может быть временно недоступна. Попробуйте открыть её позже; название и дата источника сохранены выше.

Сохранить · Настроить