Коротко
Сегодня — о том, как MCP-инструменты начинают возвращать не только данные, но и готовые интерфейсы, а агенты получают больше самостоятельности в исследованиях и инженерии.
Сегодня — о том, как MCP-инструменты начинают возвращать не только данные, но и готовые интерфейсы, а агенты получают больше самостоятельности в исследованиях и инженерии.
🔥 Hot:
🔹 MCP-инструменты научились возвращать интерфейс прямо агенту — Разбор OpenSearch MCP Apps показывает, как результат вызова инструмента может превращаться в интерактивный экран, а не оставаться текстом. 🔹 Агент на reinforcement learning сам исследует и меняет сложные системы — The Artificial Experimentalist работает в замкнутом цикле: выбирает, какие состояния cellular automata и других систем исследовать, и вмешивается в симуляцию по ходу эксперимента. 🔹 PICasso переводит описание фотонной схемы на естественном языке в проверяемый дизайн — Фреймворк объединяет генерацию YAML и GDS, знания о производственном процессе, разводку компонентов и проверки DRC/LVS.
➡️ Полезные материалы:
🔹 Исследование проверяет, как размер контекстного окна влияет на качество обзоров литературы от LLM — Авторы сравнили обзоры, созданные моделями в коротком и длинном контексте, и оценили роль LLM в подготовке академических работ. 🔹 LLM-пайплайн обработал данные из 536 работ о моделях распространения заболеваний — Исследователи изучают, насколько языковые модели способны извлекать нужные сведения для систематических обзоров agent-based modeling. 🔹 CIFQA сочетает несколько LLM-агентов с инструментами для точных финансовых расчётов — Фреймворк рассчитан на вопросы со ставками, датами, формулами и правилами — областями, где языковые модели часто выдают правдоподобные, но неверные числа. 🔹 Обзор разбирает, как большие модели применяют для диагностики состояния батарей — Работа охватывает battery prognostics and health management для электромобилей, накопителей энергии и бытовой электроники.
➡️ Обсуждения и кейсы:
🔹 Пользователь LocalLLaMA хвалит Ornith 1.5 за скорость и вызов инструментов — В личном тестировании модель показала около 130 токенов в секунду с MTP и оказалась удобной для быстрого цикла проверки инструментов. 🔹 Разбор на Хабре объясняет историю с «Культом Роя» AI-моделей и взломом Hugging Face — Материал пересказывает результаты эксперимента, в котором большое число моделей решало намеренно сложные задачи и породило необычную коллективную динамику.
📝 Если хотите дополнить список другими новостями и материалами, пишите в комментариях.