Коротко
Разбор архитектуры антискам-бота для Telegram-чатов: классификатор без размеченного датасета, типизатор проблем и работа с потоком из опечаток, сленга и трёх языков. Практический опыт ML на реальных, грязных данных.
Когда нет размеченного датасета, а данные — это живой поток из Telegram-чатов с опечатками, сленгом и тремя языками вперемешку, классические ML-подходы быстро сдают позиции. Автор антискам-бота делится архитектурой, которая связывает классификатор, определяющий необходимость помощи, и типизатор проблем — поверх RAG-модуля, разобранного в первой части.
Главный фокус статьи — не модели, а инженерия на грязных данных. Как собирать рабочий классификатор, когда метрики врут, а разметки нет вообще. Цифры в материале — реальные, из рабочих логов.