• Главная
  • Новости
  • Блог
  • Релизы
  • История LLM
  • Сравнение LLM
  • Библиотека
  • Обо мне
⌘K
Вход

Блог и заметки о разработке. Для связи удобнее всего использовать соцсети ниже.

Контакты
talalaev.misha@gmail.com
Документы
Политика обработки персональных данныхСогласие на обработку персональных данных

Бенчмарк для AI-агентов на реальных CVE: почему это важно

Sh0ny
Sh0ny
23 июля 2026
  1. Главная
  2. Блог
  3. Бенчмарк для AI-агентов на реальных CVE: почему это важно
1 мин чтения
Обновлено 25 июля 2026

Коротко

Проект cve-bench предлагает оценивать AI-агентов на задаче исправления реальных уязвимостей в Python. Разбираю, почему бенчмарки на синтетических задачах вводят всех в заблуждение и что изменится, когда метрики станут честными.

На GitHub появился открытый проект cve-bench — бенчмарк для оценки AI-агентов на задаче исправления реальных уязвимостей в Python-коде. Автор просит сообщество подсказать, какие CVE стоит добавить в набор задач. На первый взгляд, очередная игрушка для измерения прогресса LLM. Но за этим стоит куда более интересный вопрос: как вообще понять, что агент умеет чинить безопасность, а не просто угадывает ответ по шаблону.

Проблема синтетических бенчмарков хорошо известна тем, кто работает с агентами в проде. Модель, которая блестяще проходит HumanEval или SWE-bench, часто беспомощна перед реальным легаси, где уязвимость размазана по пяти файлам, а правильный фикс ломает три теста. Синтетические задачи контаминированы — их решения уже есть в обучающей выборке, и метрики растут не потому, что модель стала умнее, а потому, что она выучила распределение. CVE-задачи срывают этот фокус: каждая уязвимость — это конкретный исторический контекст, конкретный патч и конкретные регрессионные тесты. Угадать заранее невозможно.

Проект пока выглядит как ранний каркас: Docker-окружение, harness для запуска агентов, шаблон задачи и папка с результатами. Это честный подход — вместо готовых цифр автор даёт инструмент и приглашает сообщество наращивать сложность. Если бенчмарк наберёт критическую массу реальных CVE, появится первый относительно надёжный способ отличить агентов, которые реально понимают код, от тех, кто красиво пересказывает документацию.

Главный вопрос не в том, какие CVE добавить, а в том, кто возьмётся оценивать качество самих патчей. Исправить уязвимость так, чтобы не сломать совместимость и не открыть новую дыру — задача, на которой люди ошибаются регулярно. Если бенчмарк будет проверять только «проходят ли тесты», он быстро превратится в очередной объект для gaming. Если добавит проверку семантики и регрессий — станет стандартом.

Источник: Hacker News - Newest: ""AI" "LLM""

новостиaiбезопасностьагенты
Больше разборов AI-инструментов — в Telegram-канале, коротко и по делу
Подписаться в Telegram

Комментарии

(0)
​