• Главная
  • Новости
  • Блог
  • Релизы
  • История LLM
  • Сравнение LLM
  • Библиотека
  • Обо мне
⌘K
Вход

Блог и заметки о разработке. Для связи удобнее всего использовать соцсети ниже.

Контакты
talalaev.misha@gmail.com
Документы
Политика обработки персональных данныхСогласие на обработку персональных данных
Фото: Kvalifik / Unsplash

Аудиторы поисковых агентов пока исправляют лишь треть ошибок

Sh0ny
Sh0ny
7 августа 2026
  1. Главная
  2. Блог
  3. Аудиторы поисковых агентов пока исправляют лишь треть ошибок
1 мин чтения

Коротко

Длинный веб-поиск может превратить одну небольшую ошибку в уверенный, но неверный ответ. SearchAuditor улучшает поиск и исправление таких сбоев, однако результаты показывают: автоматический аудит пока далёк от надёжного контроля.

Главная проблема долгого поиска — не только найти нужную страницу, но и понять, в какой момент всё пошло не так. Ошибка в начале длинной цепочки рассуждений может незаметно испортить десятки следующих шагов, а на выходе агент всё равно сформулирует гладкий ответ.

Именно это проверяет SearchAuditBench — набор из 1 243 неудачных траекторий поисковых агентов. В среднем одна такая траектория содержит 73,1 сообщения и 65,1 тысячи токенов. Эксперты для каждой отметили критический шаг, причину сбоя и вариант исправления с критериями оценки.

На этой базе авторы предлагают SearchAuditor: систему, которая смотрит на ошибку с нескольких перспектив, привязывает выводы к доказательствам и пытается не только найти причину, но и починить запуск.

Результат любопытный именно в сравнении. Даже сильнейший базовый подход с frontier-моделью вроде GPT-5.5 прошёл проверку end-to-end только в 26,6% случаев. SearchAuditor поднял показатель до 32,3% — это заметное улучшение, но не уровень, при котором аудит можно считать автоматическим контролем качества.

Ограничения здесь важнее презентационной формулировки. Речь идёт о 1 243 уже провалившихся траекториях, собранных у восьми open-weight моделей на пяти бенчмарках, поэтому результат не описывает весь рынок поисковых агентов. Кроме того, даже лучший подход успешен примерно в трети случаев. Авторы сообщают, что после исправлений агенты лучше восстанавливаются и могут продолжить неудачный запуск, но это не отменяет исходной проблемы: системе всё ещё часто трудно правильно определить, что именно сломалось.

Практический вывод простой: для длинных задач нужен не только агент, который умеет искать, но и отдельный слой проверки его промежуточных решений. Правда, пока такой слой скорее снижает ущерб, чем гарантирует правильный ответ.

Если бы ваш поисковый агент ошибался в двух случаях из трёх, вы бы добавили автоматический аудит или предпочли сократить задачу до нескольких проверяемых шагов? Источник: cs.AI updates on arXiv.org

новостиaiагентыразработка
Больше разборов AI-инструментов — в Telegram-канале, коротко и по делу
Подписаться в Telegram

Комментарии

(0)
​