• Главная
  • Новости
  • Блог
  • Релизы
  • История LLM
  • Сравнение LLM
  • Библиотека
  • Обо мне
⌘K
Вход

Блог и заметки о разработке. Для связи удобнее всего использовать соцсети ниже.

Контакты
talalaev.misha@gmail.com
Документы
Политика обработки персональных данныхСогласие на обработку персональных данных

AI-агент не понимает код: почему уверенность модели — это не доказательство

Sh0ny
Sh0ny
26 июля 2026
  1. Главная
  2. Блог
  3. AI-агент не понимает код: почему уверенность модели — это не доказательство
2 мин чтения

Коротко

CodeSlicer строит проверяемый граф влияния кодовой базы и жёстко разделяет предположения AI от подтверждённых связей. Разбираем, почему ноль ложных срабатываний важнее скорости агента.

Главная проблема AI-агентов в больших кодовых базах — не скорость и не качество генерации отдельной функции. Проблема в том, что модель уверенно угадывает связи между компонентами, не имея доказательств. Изменение одного метода ломает backend-роут, frontend-компонент или background task — а агент об этом даже не подозревает.

Проект CodeSlicer предлагает подход, который мне кажется принципиально правильным: не превращать предположение AI в подтверждённую связь. Инструмент работает как локальный CLI, MCP-сервер и визуальный анализатор, который строит граф влияния проекта — от функций и классов до DI-провайдеров, HTTP-endpoint'ов, frontend-компонентов и тестов.

Ключевое отличие от обычных графов кода — сохранение evidence chain и provenance для каждого ребра. Система не просто говорит «эти две функции связаны». Она показывает, почему считает их связанными, с каким уровнем уверенности и на каком основании. Это позволяет агенту работать с кодом, где часть зависимостей подтверждена статическим анализом, часть — runtime-наблюдениями, а часть помечена как unknown regions, требующие ручной проверки.

Pipeline включает inventory, extraction, semantic resolution, support packs, mutation testing и runtime observation. Мутационное тестирование здесь — не академический довесок, а способ верификации: если разрыв ребра не ломает ничего, значит, связь была ложной.

Цифры на Python-сценариях выглядят жёстко: 21 тестовый сценарий, 29 mutation-сценариев, 20 обязательных semantic edges — и 0 false positive, 0 false negative. Для TypeScript и frontend-backend bridge проверены 12 сценариев, 15 мутаций и 4 cross-language цепочки с endpoint precision 1.0. Звучит почти слишком хорошо, но методология с мутационным тестированием даёт основание доверять результату — по крайней мере, на размеченных сценариях.

Интеграция с AI-агентами идёт через CLI, MCP и skills. Это значит, что агент получает не сырой код для угадывания, а уже структурированный граф с метаданными о достоверности каждой связи. Архитектурно это меняет распределение ответственности: модель отвечает за генерацию, а инструмент — за верификацию влияния.

Главный вопрос, который остаётся открытым — масштабируемость на реальные production-кодовые базы. Размеченные сценарии — это контролируемая среда. Но сам принцип разделения «предположение ≠ подтверждённое ребро» — именно тот trade-off, которого не хватает многим агентским фреймворкам, которые спешат выдать вероятностную догадку за факт.

Источник: Все статьи подряд / Искусственный интеллект / Хабр

новостиaiагентыразработка
Больше разборов AI-инструментов — в Telegram-канале, коротко и по делу
Подписаться в Telegram

Комментарии

(0)
​