Коротко
В сегодняшней сводке — новые подходы к адаптации и сжатию AI-моделей, а также инструменты для оценки агентов и систематических обзоров. В конце — дискуссия о том, достигла ли Astra уровня AGI.
В сегодняшней сводке — новые подходы к адаптации и сжатию AI-моделей, а также инструменты для оценки агентов и систематических обзоров. В конце — дискуссия о том, достигла ли Astra уровня AGI.
🔥 Hot:
🔹 Исследователи предложили бюджетную онлайн-адаптацию веб-агентов — Подход рассчитан на лёгкие локальные модели, которые должны учиться уже после развёртывания. 🔹 Новый метод сжатия LLM защищает критичные цепочки рассуждений — Reasoning-Aware Compression отказывается от одинаковой квантизации всех компонентов модели ради снижения энергозатрат без лишнего ущерба качеству.
➡️ Полезные материалы:
🔹 SCAFFOLD превращает накопленные навыки веб-агента в иерархическую библиотеку — Агент не начинает каждую задачу с нуля, а переиспользует процедурные знания в меняющихся интерфейсах. 🔹 SciLitBench проверяет LLM на всех этапах систематического обзора литературы — Бенчмарк охватывает отбор по заголовкам и полным текстам до извлечения данных по заданной схеме. 🔹 AutoFyn обучает долгосрочных агентов без изменения весов модели — Система сохраняет проверенные результаты в постоянном состоянии и возвращает их в новые сессии через явные интерфейсы. 🔹 CriticGen превращает оценку ответов LLM в конкретные рекомендации по улучшению — Метод учитывает сам процесс генерации и выдаёт более детальную обратную связь, чем обычные общие оценки. 🔹 ARC-Bench показывает проблему ранжирования действий в замороженных world models — Исследование проверяет предположение, что близость будущего состояния к цели в латентном пространстве действительно указывает на лучший action.
➡️ Обсуждения и кейсы:
🔹 На Хабре обсудили, можно ли считать Astra уровнем AGI — Автор провёл интервью с моделью и разбирает, что стоит за заявлениями о достижении общего искусственного интеллекта.
📝 Если хотите дополнить список другими новостями и материалами, пишите в комментариях.