Коротко
Sanitizer от Provexar чистит документы перед отправкой в LLM, заменяя чувствительные данные токенами. Идея в том, что AI работает вслепую, а вы локально восстанавливаете ответы. Разбираю, где подход сильный, а где — компромисс.
Проблема знакома каждому, кто подключал LLM к рабочим документам: модель работает лучше, когда видит полный контекст, но именно этот контекст чаще всего содержит то, что отправлять наружу нельзя. Sanitizer от Provexar предлагает конкретный архитектурный ответ — обрабатывать документы локально до того, как до них доберётся AI.
Главная идея — обратимая санитизация. Имена, контакты, учётные данные и ключи не удаляются безвозвратно, а заменяются непрозрачными токенами по политике проекта. AI получает текст, в котором нет реальных идентификаторов, работает с ним и возвращает ответ. Затем локально токены раскрываются обратно — вы видите результат с реальными именами, а модель никогда их не знала. Это разумный компромисс: вы не жертвуете точностью ради безопасности и не жертвуете безопасностью ради точности.
Второй слой — борьба с форматным мусором. 40 MB PDF или Word-файл — это в основном layout, встроенные шрифты и метаданные. Sanitizer конвертирует всё в чистый Markdown и плоский CSV, экономя токены и контекстное окно для содержимого, а не для бинарного балласта. Для тех, кто считает стоимость запросов к LLM, это не косметика, а реальные деньги.
Третий компонент — индексация. Каждый документ чанкуется и индексируется дважды: полнотекстовый индекс для точных терминов и семантический для поиска по смыслу. AI-агенты получают инструменты извлечения и тянут пять релевантных абзацев вместо пятисот страниц, с указанием источника. По сути, Sanitizer строит локальную RAG-инфраструктуру, но с упором на санитизацию как первый шаг пайплайна.
Всё работает локально: конвертация, OCR, санитизация, индексация, поиск. Никаких облачных сервисов и загрузок. Это закрывает главный страх корпоративного использования — что данные утекут через API провайдера.
Ограничения тоже честные. Личная версия бесплатна, но установщик не подписан кодом — Windows SmartScreen выдаст предупреждение, и нужно вручную сверить SHA-256. Бизнес-версия за $49.99 распространяется через Microsoft Store и подписана Microsoft. Только Windows 10/11, 64-бит. Для команд на Linux или macOS инструмент пока недоступен.
Лицензия прямолинейная: личная версия — только для некоммерческого использования, всё остальное требует Business-редакции. Reverse-engineering запрещён, гарантий нет.
Обратимая санитизация — не панацея. Токенизация работает, когда чувствительные данные можно выделить паттернами или словарём. Но если конфиденциальная информация размазана по тексту в свободной форме, замена по шаблону её не поймает. Инструмент снимает большую часть риска, но ответственность за проверку очищенного вывода остаётся на пользователе — это прямо сказано в лицензии.
Sanitizer интересен не как очередной AI-продукт, а как практический слой между вашими документами и чужой моделью. Вопрос, который стоит задать: насколько токенизация покрывает ваши реальные типы чувствительных данных, прежде чем доверять ей production-документы?
Источник: Hacker News - Newest: ""AI" "LLM""