• Главная
  • Новости
  • Блог
  • Релизы
  • История LLM
  • Сравнение LLM
  • Библиотека
  • Обо мне
⌘K
Вход

Блог и заметки о разработке. Для связи удобнее всего использовать соцсети ниже.

Контакты
talalaev.misha@gmail.com
Документы
Политика обработки персональных данныхСогласие на обработку персональных данных

Noisegate: агент не заслуживает доверия, и это нормально

Sh0ny
Sh0ny
31 июля 2026
  1. Главная
  2. Блог
  3. Noisegate: агент не заслуживает доверия, и это нормально
2 мин чтения

Коротко

Open-source шлюз Noisegate ставит границу доверия не в LLM, а в коде под ней. Дифференциальная приватность защищает данные даже от adversarial-агента — с атаками прямо в CI.

Главный архитектурный тезис Noisegate прост: LLM-агент — это ненадёжный ввод. Не нужно доверять модели, не нужно надеяться на её alignment, не нужно проверять, что она «не слила» данные. Приватность enforced в коде, который агент не контролирует — ниже по стеку, на уровне query engine и privacy budget. Модель лишь предлагает запрос. Всё остальное делает gateway, и вёл бы себя так же, если бы запрос вбивал человек руками.

Это правильная дисциплина. В продакшене вы не доверяете user input — вы валидируете, санитизируете, ограничиваете. Здесь то же самое, только input приходит от AI-агента через MCP. Шлюз компилирует запрос, выполняет его под tracked privacy budget и возвращает намеренно зашумлённый ответ с confidence interval. Если запрос слишком узкий — например, пытается вычленить одного пациента из 20 — шлюз отклоняет его на trust boundary. Если агент исчерпал бюджет — получает отказ, а не «потише» ответ.

Проект не ограничивается заявлениями. Три классические атаки на приватность — differencing, membership inference, singling out by re-identification — встроены прямо в репозиторий и запускаются в CI. Каждая показана: succeeds с выключенной приватностью, defeated с включённой. Это значит, что защита не может тихо сломаться — регрессия падает в пайплайне.

Механизм шума написан с нуля и сверен с OpenDP — industry reference implementation. Все 35 проверок масштаба шума совпадают до 1e-9. Учёт бюджета использует hybrid zCDP composition: 308 запросов на тот же бюджет против 268 при advanced composition и 100 при наивном sum-of-ε. Гарантия — (ε, δ)-DP, не чистый ε-DP. Это честное уточнение: чистый ε-DP был бы сильнее, но дороже.

Стек: Python, DuckDB, FastAPI, Streamlit, MCP SDK, Docker, 250+ тестов в CI. Лицензия Apache 2.0. Работает как MCP-сервер для Claude Desktop.

Для практиков, которые подключают агентов к чувствительным данным, это рабочий паттерн: не «доверяй модели», а «модель не в критическом пути». Вопрос, который остаётся — насколько этот паттерн совместим с реальными продакшен-датасетами, где бюджет дифференциальной приватности расходуется быстрее, чем хотелось бы.

Источник: Hacker News - Newest: ""AI" "LLM""

новостиaiбезопасностьагенты
Больше разборов AI-инструментов — в Telegram-канале, коротко и по делу
Подписаться в Telegram

Комментарии

(0)
​