Коротко
Сегодня в сводке математические результаты OpenAI и свежие исследования по автономным агентам. Плюс ещё один разбор: автор показал, как он автоматизировал смягчение промптов для Claude.
Сегодня в сводке математические результаты OpenAI и свежие исследования по автономным агентам. Плюс ещё один разбор: автор показал, как он автоматизировал смягчение промптов для Claude.
🔥 Hot:
🔹 OpenAI опубликовала математические результаты по 377 задачам: Их получили с помощью передовой модели, которую ещё не выпустили.
➡️ Полезные материалы:
🔹 StoreBench предлагает проверять AI-агентов в среде живой торговли: Авторы хотят уйти от тестов, где мир меняется только после того, как агент что-то делает. 🔹 Исследование проверяет, умеют ли AI-агенты укладываться в лимит времени: Авторы проверяют, насколько продуктивно агенты используют доступное время. 🔹 Plan-and-Patch помогает агентам пересматривать план после сбоев: Подход пригодится, когда инструменты отвечают неожиданно или действия не удаются. 🔹 Исследователи проверили обратимое сокращение контекста у AI-агентов: Агент сокращает длинные результаты инструментов до кратких заметок, а исходники складывает в архив.
➡️ Обсуждения и кейсы:
🔹 Автор сделал Punto Switcher для промптов Claude: Поводом стало обновление правил Anthropic. Автора это напугало, потому что он привык ругаться на Claude Code. 🔹 AI-ассистенту дали тело на цифровом острове, и он начал играть: За тридцать часов агент лазал по холмам, строил башни и рисовал мандалы без заданной цели.
📝 Если хотите дополнить список другими новостями и материалами, пишите в комментариях.