Коротко
В сегодняшней сводке — почему LLM-as-a-judge может ошибаться, откуда берутся галлюцинации даже при наличии факта в памяти модели и что нового в локальном AI. Плюс — BTFS, Qwen и практические исследования.
В сегодняшней сводке — почему LLM-as-a-judge может ошибаться, откуда берутся галлюцинации даже при наличии факта в памяти модели и что нового в локальном AI. Плюс — BTFS, Qwen и практические исследования.
🔥 Hot:
🔹 GAUGE проверяет, когда нельзя доверять LLM-as-a-judge при оценке агентов — Исследование предлагает офлайн-протокол для проверки того, насколько оценки LLM-судьи правильно ранжируют task-oriented agents. 🔹 Исследование связало галлюцинации с потерями информации при сжатии памяти модели — Даже если модель когда-то видела факт, ограниченная память может хранить его лишь приблизительно — и это становится отдельным источником ошибок. 🔹 Chopthin-Consensus сохраняет больше вариантов рассуждения при sampling — Метод на базе Sequential Monte Carlo пытается не отбрасывать потенциально правильные траектории из-за агрессивного равновесного пересэмплирования.
➡️ Новости:
🔹 BTFS 3.3 монтирует torrent-файлы и magnet-ссылки как файловую систему — Содержимое доступно как обычная read-only директория и загружается динамически по мере обращения к файлам.
➡️ Полезные материалы:
🔹 R2VC разделяет поиск доказательств, проверку и калибровку уверенности в fact-checking — Модульная архитектура упрощает диагностику сбоев и делает оценку уверенности LLM более проверяемой. 🔹 Repair Before Reinforce добавляет контекст в reasoning по графам знаний — Работа посвящена multi-hop-вопросам, где ответ требует связать несколько фактов, а не найти одну изолированную связь. 🔹 Replay-informed policy adaptation показывает побочные эффекты локальных правок промпта — Изменение одного участка policy может повлиять на последующие шаги выполнения workflow, поэтому авторы предлагают учитывать replay-данные.
➡️ Обсуждения и кейсы:
🔹 Пользователь рассказал, как Qwen3.8-27B пишет тесты и проверяет изменения без дополнительных указаний — В его опыте модель уверенно справлялась с расплывчатыми запросами и задачами, где раньше требовалось много итераций. 🔹 В сообществе замерили скорость Qwen3.8-Flash-Next на M3 Ultra — Опубликованы конфигурация llama.cpp, параметры запуска и результаты llama-benchy для GGUF-модели. 🔹 Сообщество опубликовало 3D-визуализацию отличий Deepseek Flash v4.1 — Интерактивная находка сравнивает модель с типичным decoder-only Transformer.
📝 Если хотите дополнить список другими новостями и материалами, пишите в комментариях.