• Главная
  • Новости
  • Блог
  • Релизы
  • История LLM
  • Сравнение LLM
  • Библиотека
  • Обо мне
⌘K
Вход

Блог и заметки о разработке. Для связи удобнее всего использовать соцсети ниже.

Контакты
talalaev.misha@gmail.com
Документы
Политика обработки персональных данныхСогласие на обработку персональных данных
Фото: Clint Patterson / Unsplash

Слепой AI, видящий читатель: локальная санитизация документов для LLM

Sh0ny
Sh0ny
1 августа 2026
  1. Главная
  2. Блог
  3. Слепой AI, видящий читатель: локальная санитизация документов для LLM
2 мин чтения

Коротко

Sanitizer от Provexar чистит документы перед отправкой в LLM, заменяя чувствительные данные токенами. Идея в том, что AI работает вслепую, а вы локально восстанавливаете ответы. Разбираю, где подход сильный, а где — компромисс.

Проблема знакома каждому, кто подключал LLM к рабочим документам: модель работает лучше, когда видит полный контекст, но именно этот контекст чаще всего содержит то, что отправлять наружу нельзя. Sanitizer от Provexar предлагает конкретный архитектурный ответ — обрабатывать документы локально до того, как до них доберётся AI.

Главная идея — обратимая санитизация. Имена, контакты, учётные данные и ключи не удаляются безвозвратно, а заменяются непрозрачными токенами по политике проекта. AI получает текст, в котором нет реальных идентификаторов, работает с ним и возвращает ответ. Затем локально токены раскрываются обратно — вы видите результат с реальными именами, а модель никогда их не знала. Это разумный компромисс: вы не жертвуете точностью ради безопасности и не жертвуете безопасностью ради точности.

Второй слой — борьба с форматным мусором. 40 MB PDF или Word-файл — это в основном layout, встроенные шрифты и метаданные. Sanitizer конвертирует всё в чистый Markdown и плоский CSV, экономя токены и контекстное окно для содержимого, а не для бинарного балласта. Для тех, кто считает стоимость запросов к LLM, это не косметика, а реальные деньги.

Третий компонент — индексация. Каждый документ чанкуется и индексируется дважды: полнотекстовый индекс для точных терминов и семантический для поиска по смыслу. AI-агенты получают инструменты извлечения и тянут пять релевантных абзацев вместо пятисот страниц, с указанием источника. По сути, Sanitizer строит локальную RAG-инфраструктуру, но с упором на санитизацию как первый шаг пайплайна.

Всё работает локально: конвертация, OCR, санитизация, индексация, поиск. Никаких облачных сервисов и загрузок. Это закрывает главный страх корпоративного использования — что данные утекут через API провайдера.

Ограничения тоже честные. Личная версия бесплатна, но установщик не подписан кодом — Windows SmartScreen выдаст предупреждение, и нужно вручную сверить SHA-256. Бизнес-версия за $49.99 распространяется через Microsoft Store и подписана Microsoft. Только Windows 10/11, 64-бит. Для команд на Linux или macOS инструмент пока недоступен.

Лицензия прямолинейная: личная версия — только для некоммерческого использования, всё остальное требует Business-редакции. Reverse-engineering запрещён, гарантий нет.

Обратимая санитизация — не панацея. Токенизация работает, когда чувствительные данные можно выделить паттернами или словарём. Но если конфиденциальная информация размазана по тексту в свободной форме, замена по шаблону её не поймает. Инструмент снимает большую часть риска, но ответственность за проверку очищенного вывода остаётся на пользователе — это прямо сказано в лицензии.

Sanitizer интересен не как очередной AI-продукт, а как практический слой между вашими документами и чужой моделью. Вопрос, который стоит задать: насколько токенизация покрывает ваши реальные типы чувствительных данных, прежде чем доверять ей production-документы?

Источник: Hacker News - Newest: ""AI" "LLM""

новостиaillmбезопасность
Больше разборов AI-инструментов — в Telegram-канале, коротко и по делу
Подписаться в Telegram

Комментарии

(0)
​