• Главная
  • Новости
  • Блог
  • Релизы
  • История LLM
  • Сравнение LLM
  • Библиотека
  • Обо мне
⌘K
Вход

Блог и заметки о разработке. Для связи удобнее всего использовать соцсети ниже.

Контакты
talalaev.misha@gmail.com
Документы
Политика обработки персональных данныхСогласие на обработку персональных данных
Фото: Enchanted Tools / Unsplash

Высокая температура не спасает LLM от одинаковых ответов

Sh0ny
Sh0ny
5 августа 2026
  1. Главная
  2. Блог
  3. Высокая температура не спасает LLM от одинаковых ответов
1 мин чтения

Коротко

Исследование предлагает разводить ответы моделей не только случайностью, а сначала меняя их исходную «персону». Подход снизил семантическое сходство ответов примерно с 0,85 до 0,65, но это ещё не доказывает рост качества или полезного разнообразия.

LLM могут выдавать разные формулировки, оставаясь по сути согласованными друг с другом. Авторы называют это эффектом «искусственного коллективного разума»: даже при высокой температуре ответы на открытые вопросы часто сходятся к узкому набору идей.

Проблема здесь не только эстетическая. Если модель почти всегда выбирает один и тот же тип рассуждения, она хуже подходит для мозгового штурма, поиска неожиданных гипотез и генерации альтернативных решений. Простое увеличение температуры, судя по работе, не устраняет эту однородность.

Предложенный метод состоит из двух шагов. Сначала модель должна сама выбрать необычную, индивидуальную «мета-персону», которая задаёт точку старта ответа. Затем применяется Filtered Temperature Scaling: сначала Top-p-фильтрация отбрасывает слишком маловероятные варианты, а уже к оставшимся кандидатам применяется экстремальная температура от 4.0 и выше.

Это важное сочетание. Высокая температура без фильтра может разрушить связность текста, а фильтрация без достаточно сильного разгона оставляет модель в привычной области вероятностей. В предложенной схеме сначала сохраняют грамматическую и вероятностную приемлемость, а затем расширяют пространство выбора.

В эксперименте на датасете INFINITY-CHAT проверяли open-weight-модели размером менее примерно 20B параметров. Среднее попарное cosine-сходство ответов снизилось примерно с 0,85 до 0,65, а для большинства вопросов показатель оказался ниже порога 0,7.

Но этот результат нужно читать аккуратно. Снижение семантического сходства означает, что ответы стали менее похожими, а не то, что они стали точнее, глубже или полезнее. Более того, в доступном описании нет деталей о том, как измерялись фактическая корректность, устойчивость к плохим персонам и цена дополнительного этапа генерации.

Практический вывод пока такой: если нужна не одна «усреднённая» версия ответа, стоит управлять разнообразием на уровне исходной роли модели, а не просто крутить temperature. При этом для рабочих систем понадобится отдельная проверка: не превратилось ли достигнутое разнообразие в уверенную генерацию лишнего шума.

Источник: cs.AI updates on arXiv.org

новостиaillmнейросети
Больше разборов AI-инструментов — в Telegram-канале, коротко и по делу
Подписаться в Telegram

Комментарии

(0)
​