Коротко
Проект cve-bench предлагает оценивать AI-агентов на задаче исправления реальных уязвимостей в Python. Разбираю, почему бенчмарки на синтетических задачах вводят всех в заблуждение и что изменится, когда метрики станут честными.
На GitHub появился открытый проект cve-bench — бенчмарк для оценки AI-агентов на задаче исправления реальных уязвимостей в Python-коде. Автор просит сообщество подсказать, какие CVE стоит добавить в набор задач. На первый взгляд, очередная игрушка для измерения прогресса LLM. Но за этим стоит куда более интересный вопрос: как вообще понять, что агент умеет чинить безопасность, а не просто угадывает ответ по шаблону.
Проблема синтетических бенчмарков хорошо известна тем, кто работает с агентами в проде. Модель, которая блестяще проходит HumanEval или SWE-bench, часто беспомощна перед реальным легаси, где уязвимость размазана по пяти файлам, а правильный фикс ломает три теста. Синтетические задачи контаминированы — их решения уже есть в обучающей выборке, и метрики растут не потому, что модель стала умнее, а потому, что она выучила распределение. CVE-задачи срывают этот фокус: каждая уязвимость — это конкретный исторический контекст, конкретный патч и конкретные регрессионные тесты. Угадать заранее невозможно.
Проект пока выглядит как ранний каркас: Docker-окружение, harness для запуска агентов, шаблон задачи и папка с результатами. Это честный подход — вместо готовых цифр автор даёт инструмент и приглашает сообщество наращивать сложность. Если бенчмарк наберёт критическую массу реальных CVE, появится первый относительно надёжный способ отличить агентов, которые реально понимают код, от тех, кто красиво пересказывает документацию.
Главный вопрос не в том, какие CVE добавить, а в том, кто возьмётся оценивать качество самих патчей. Исправить уязвимость так, чтобы не сломать совместимость и не открыть новую дыру — задача, на которой люди ошибаются регулярно. Если бенчмарк будет проверять только «проходят ли тесты», он быстро превратится в очередной объект для gaming. Если добавит проверку семантики и регрессий — станет стандартом.
Источник: Hacker News - Newest: ""AI" "LLM""