• Главная
  • Новости
  • Блог
  • Релизы
  • История LLM
  • Сравнение LLM
  • Библиотека
  • Обо мне
⌘K
Вход

Блог и заметки о разработке. Для связи удобнее всего использовать соцсети ниже.

Контакты
talalaev.misha@gmail.com
Документы
Политика обработки персональных данныхСогласие на обработку персональных данных

ClickGuard: 91% F1 на кликбейт, но главная фишка — спойлер вместо запрета

Sh0ny
Sh0ny
24 июля 2026
  1. Главная
  2. Блог
  3. ClickGuard: 91% F1 на кликбейт, но главная фишка — спойлер вместо запрета
1 мин чтения
Обновлено 25 июля 2026

Коротко

Браузерное расширение не просто мечет кликбейт, но и пересказывает статью в двух предложениях, убивая мотив кликать. Разбор архитектуры и почему XGBoost оказался эффективнее чистого LLM-подхода.

Большинство систем антикликбейта останавливаются на бинарной метке «это кликбейт / нет». Статья ClickGuard идёт дальше: расширение не только предупреждает, но и пересказывает статью в одном-двух предложениях, лишая заголовок информационной монополии. Идея простая — если ты уже знаешь суть, кликать не нужно.

Архитектура гибридная, и это любопытный инженерный выбор. Авторы перебрали от классических векторайзеров до LLM-эмбеддингов и в итоге остановились на XGBoost поверх трансформерных признаков, дополненных лингвистическими фичами и кастомным скором «baitness». Результат — F1 91% на открытом объединённом датасете. Чистый LLM-подход не выиграл: тяжелее, дороже, а для задачи классификации коротких текстов бустинг поверх эмбеддингов оказался точнее и практичнее.

Расширение работает в два режима. До клика — предупреждение. После — процентная оценка вероятности кликбейта с объяснением, какие метрики сработали. Прозрачность решения здесь важна: пользователь видит не просто красный значок, а разбор, почему статья помечена. Это снимает претензии «алгоритм ошибся» и делает инструмент пригодным для реального использования, а не как демо.

Главный trade-off — спойлер. С одной стороны, он нейтрализует манипуляцию заголовка. С другой — сам становится источником интерпретации: если модель сжала статью неточно, пользователь получает искажённую суть вместо возможности прочитать оригинал. Авторы не обсуждают этот риск, а он ключевой для доверия к инструменту.

Для практиков, строящих AI-агентов и фильтры контента, здесь полезное наблюдение: гибридная архитектура (эмбеддинги + лингвистические признаки + бустинг) до сих пор конкурирует с end-to-end LLM-пайплайнами, особенно когда нужна скорость, интерпретируемость и работа в браузере. ClickGuard — пример, где «меньше LLM» оказалось правильным архитектурным решением.

Источник: cs.AI updates on arXiv.org

новостиaiразработкаllm
Больше разборов AI-инструментов — в Telegram-канале, коротко и по делу
Подписаться в Telegram

Комментарии

(0)
​