Коротко
Сегодня — о том, как агенты могут принять ошибку инструмента за факт, почему AI-поиск выдаёт разные ответы и как эффективнее добывать контекст. Плюс несколько практических проектов из сообщества.
Сегодня — о том, как агенты могут принять ошибку инструмента за факт, почему AI-поиск выдаёт разные ответы и как эффективнее добывать контекст. Плюс несколько практических проектов из сообщества.
🔥 Hot:
🔹 Исследователи предложили Outcome Monitors для защиты агентов от «тихих» сбоев инструментов — Мониторы проверяют, соответствует ли результат вызова ожидаемому контракту, чтобы агент не принял кэшированную ошибку или неверные данные за факт. 🔹 Один и тот же запрос к AI-поиску трижды дал три почти разных списка компаний — Из 15 названий совпали только пять: замер упоминаемости по одному ответу может быть случайным.
➡️ Новости:
🔹 Разработчик выпустил open source видеоредактор, которым можно управлять через LLM — Проект пытается сделать монтаж доступнее для пользователей без опыта видеоредакторов. 🔹 Show HN: сервис собирает playable game по описанию идеи — Пользователь описывает задумку, а AI создаёт на её основе игру.
➡️ Полезные материалы:
🔹 Исследование предлагает рассматривать добычу контекста агентом как active inference — Агент выбирает между уточняющим вопросом, поиском, вызовом инструмента и попыткой с предположением — с учётом стоимости токенов и риска ошибки. 🔹 Исследование разбирает цену контроля над AI-моделью, которой компания не владеет — Проблема особенно актуальна для организаций, использующих frontier-модели через API и управляемые endpoints.
📝 Если хотите дополнить список другими новостями и материалами, пишите в комментариях.