• Главная
  • Новости
  • Блог
  • Релизы
  • История LLM
  • Сравнение LLM
  • Библиотека
  • Обо мне
⌘K
Вход

Блог и заметки о разработке. Для связи удобнее всего использовать соцсети ниже.

Контакты
talalaev.misha@gmail.com
Документы
Политика обработки персональных данныхСогласие на обработку персональных данных
Фото: National Cancer Institute / Unsplash

Главное об AI и разработке: новые методы оценки агентов и локальных моделей

Sh0ny
Sh0ny
14 сентября 2026
  1. Главная
  2. Блог
  3. Главное об AI и разработке: новые методы оценки агентов и локальных моделей
2 мин чтения

Коротко

В сегодняшней сводке — почему LLM-as-a-judge может ошибаться, откуда берутся галлюцинации даже при наличии факта в памяти модели и что нового в локальном AI. Плюс — BTFS, Qwen и практические исследования.

В сегодняшней сводке — почему LLM-as-a-judge может ошибаться, откуда берутся галлюцинации даже при наличии факта в памяти модели и что нового в локальном AI. Плюс — BTFS, Qwen и практические исследования.

🔥 Hot:

🔹 GAUGE проверяет, когда нельзя доверять LLM-as-a-judge при оценке агентов — Исследование предлагает офлайн-протокол для проверки того, насколько оценки LLM-судьи правильно ранжируют task-oriented agents. 🔹 Исследование связало галлюцинации с потерями информации при сжатии памяти модели — Даже если модель когда-то видела факт, ограниченная память может хранить его лишь приблизительно — и это становится отдельным источником ошибок. 🔹 Chopthin-Consensus сохраняет больше вариантов рассуждения при sampling — Метод на базе Sequential Monte Carlo пытается не отбрасывать потенциально правильные траектории из-за агрессивного равновесного пересэмплирования.

➡️ Новости:

🔹 BTFS 3.3 монтирует torrent-файлы и magnet-ссылки как файловую систему — Содержимое доступно как обычная read-only директория и загружается динамически по мере обращения к файлам.

➡️ Полезные материалы:

🔹 R2VC разделяет поиск доказательств, проверку и калибровку уверенности в fact-checking — Модульная архитектура упрощает диагностику сбоев и делает оценку уверенности LLM более проверяемой. 🔹 Repair Before Reinforce добавляет контекст в reasoning по графам знаний — Работа посвящена multi-hop-вопросам, где ответ требует связать несколько фактов, а не найти одну изолированную связь. 🔹 Replay-informed policy adaptation показывает побочные эффекты локальных правок промпта — Изменение одного участка policy может повлиять на последующие шаги выполнения workflow, поэтому авторы предлагают учитывать replay-данные.

➡️ Обсуждения и кейсы:

🔹 Пользователь рассказал, как Qwen3.8-27B пишет тесты и проверяет изменения без дополнительных указаний — В его опыте модель уверенно справлялась с расплывчатыми запросами и задачами, где раньше требовалось много итераций. 🔹 В сообществе замерили скорость Qwen3.8-Flash-Next на M3 Ultra — Опубликованы конфигурация llama.cpp, параметры запуска и результаты llama-benchy для GGUF-модели. 🔹 Сообщество опубликовало 3D-визуализацию отличий Deepseek Flash v4.1 — Интерактивная находка сравнивает модель с типичным decoder-only Transformer.

📝 Если хотите дополнить список другими новостями и материалами, пишите в комментариях.

новости
Больше разборов AI-инструментов — в Telegram-канале, коротко и по делу
Подписаться

Комментарии

(0)
​