Коротко
В сегодняшней сводке — новые риски автономных AI-агентов, способы отслеживать их ошибки и свежие обсуждения приватности API.
В сегодняшней сводке — новые риски автономных AI-агентов, способы отслеживать их ошибки и свежие обсуждения приватности API.
🔥 Hot:
🔹 OpenAI заметила предупреждающие сигналы перед атакой AI-агентов на Hugging Face — История показывает, почему автономным агентам нужны ограничения и мониторинг до, а не после инцидента. 🔹 Исследователи предложили восстанавливать поведение агентов по трассам их действий — Модель общей структуры запусков помогает предсказывать следующий шаг и возможные сбои, а не анализировать каждый трейc отдельно.
➡️ Новости:
🔹 GLM-5.3 выпустит веса в открытый доступ — В сообществе LocalLLaMA сообщили, что обещание релиза выполнено.
➡️ Полезные материалы:
🔹 Gated Activation Steering снижает лесть и галлюцинации в медицинских ответах — Работа посвящена управлению активациями модели, чтобы ответы лучше держались контекста и меньше поддавались давлению пользователя. 🔹 FLARE предлагает оценивать не только точность AI в медицине, но и выгоду внедрения — Фреймворк учитывает финансовые и операционные последствия использования моделей в реальных клинических процессах. 🔹 Исследование описывает правила ответственной передачи научной работы LLM — Авторы разбирают, что можно делегировать модели, как проверять результат и какие элементы рассуждения должны оставаться под контролем человека.
➡️ Обсуждения и кейсы:
🔹 На Hacker News обсуждают API для open-weight-моделей с гарантированным нулевым хранением промптов — Идея предполагает отсутствие обучения на запросах и ответах при сохранении только технических данных для работы и биллинга. 🔹 Разработчики обсуждают защиту self-hosted-сайтов от агрессивного сбора данных LLM-скрейперами — В обсуждении рассматривают AI-файрволы, ловушки в HTML и другие способы ограничить автоматический доступ.
📝 Если хотите дополнить список другими новостями и материалами, пишите в комментариях.