• Главная
  • Новости
  • Блог
  • Релизы
  • История LLM
  • Сравнение LLM
  • Библиотека
  • Обо мне
⌘K
Вход

Блог и заметки о разработке. Для связи удобнее всего использовать соцсети ниже.

Контакты
talalaev.misha@gmail.com
Документы
Политика обработки персональных данныхСогласие на обработку персональных данных

Антискам-бот на грязных данных: где ML-инженерия ломается

Sh0ny
Sh0ny
28 июля 2026
  1. Главная
  2. Блог
  3. Антискам-бот на грязных данных: где ML-инженерия ломается
1 мин чтения

Коротко

Разбор архитектуры антискам-бота для Telegram-чатов: классификатор без размеченного датасета, типизатор проблем и работа с потоком из опечаток, сленга и трёх языков. Практический опыт ML на реальных, грязных данных.

Когда нет размеченного датасета, а данные — это живой поток из Telegram-чатов с опечатками, сленгом и тремя языками вперемешку, классические ML-подходы быстро сдают позиции. Автор антискам-бота делится архитектурой, которая связывает классификатор, определяющий необходимость помощи, и типизатор проблем — поверх RAG-модуля, разобранного в первой части.

Главный фокус статьи — не модели, а инженерия на грязных данных. Как собирать рабочий классификатор, когда метрики врут, а разметки нет вообще. Цифры в материале — реальные, из рабочих логов.

Источник: Все статьи подряд / Машинное обучение / Хабр

новостиaiразработканейросети
Больше разборов AI-инструментов — в Telegram-канале, коротко и по делу
Подписаться в Telegram

Комментарии

(0)
​