Коротко
Open-source шлюз Noisegate ставит границу доверия не в LLM, а в коде под ней. Дифференциальная приватность защищает данные даже от adversarial-агента — с атаками прямо в CI.
Главный архитектурный тезис Noisegate прост: LLM-агент — это ненадёжный ввод. Не нужно доверять модели, не нужно надеяться на её alignment, не нужно проверять, что она «не слила» данные. Приватность enforced в коде, который агент не контролирует — ниже по стеку, на уровне query engine и privacy budget. Модель лишь предлагает запрос. Всё остальное делает gateway, и вёл бы себя так же, если бы запрос вбивал человек руками.
Это правильная дисциплина. В продакшене вы не доверяете user input — вы валидируете, санитизируете, ограничиваете. Здесь то же самое, только input приходит от AI-агента через MCP. Шлюз компилирует запрос, выполняет его под tracked privacy budget и возвращает намеренно зашумлённый ответ с confidence interval. Если запрос слишком узкий — например, пытается вычленить одного пациента из 20 — шлюз отклоняет его на trust boundary. Если агент исчерпал бюджет — получает отказ, а не «потише» ответ.
Проект не ограничивается заявлениями. Три классические атаки на приватность — differencing, membership inference, singling out by re-identification — встроены прямо в репозиторий и запускаются в CI. Каждая показана: succeeds с выключенной приватностью, defeated с включённой. Это значит, что защита не может тихо сломаться — регрессия падает в пайплайне.
Механизм шума написан с нуля и сверен с OpenDP — industry reference implementation. Все 35 проверок масштаба шума совпадают до 1e-9. Учёт бюджета использует hybrid zCDP composition: 308 запросов на тот же бюджет против 268 при advanced composition и 100 при наивном sum-of-ε. Гарантия — (ε, δ)-DP, не чистый ε-DP. Это честное уточнение: чистый ε-DP был бы сильнее, но дороже.
Стек: Python, DuckDB, FastAPI, Streamlit, MCP SDK, Docker, 250+ тестов в CI. Лицензия Apache 2.0. Работает как MCP-сервер для Claude Desktop.
Для практиков, которые подключают агентов к чувствительным данным, это рабочий паттерн: не «доверяй модели», а «модель не в критическом пути». Вопрос, который остаётся — насколько этот паттерн совместим с реальными продакшен-датасетами, где бюджет дифференциальной приватности расходуется быстрее, чем хотелось бы.
Источник: Hacker News - Newest: ""AI" "LLM""