Коротко
Исследование предлагает разводить ответы моделей не только случайностью, а сначала меняя их исходную «персону». Подход снизил семантическое сходство ответов примерно с 0,85 до 0,65, но это ещё не доказывает рост качества или полезного разнообразия.
LLM могут выдавать разные формулировки, оставаясь по сути согласованными друг с другом. Авторы называют это эффектом «искусственного коллективного разума»: даже при высокой температуре ответы на открытые вопросы часто сходятся к узкому набору идей.
Проблема здесь не только эстетическая. Если модель почти всегда выбирает один и тот же тип рассуждения, она хуже подходит для мозгового штурма, поиска неожиданных гипотез и генерации альтернативных решений. Простое увеличение температуры, судя по работе, не устраняет эту однородность.
Предложенный метод состоит из двух шагов. Сначала модель должна сама выбрать необычную, индивидуальную «мета-персону», которая задаёт точку старта ответа. Затем применяется Filtered Temperature Scaling: сначала Top-p-фильтрация отбрасывает слишком маловероятные варианты, а уже к оставшимся кандидатам применяется экстремальная температура от 4.0 и выше.
Это важное сочетание. Высокая температура без фильтра может разрушить связность текста, а фильтрация без достаточно сильного разгона оставляет модель в привычной области вероятностей. В предложенной схеме сначала сохраняют грамматическую и вероятностную приемлемость, а затем расширяют пространство выбора.
В эксперименте на датасете INFINITY-CHAT проверяли open-weight-модели размером менее примерно 20B параметров. Среднее попарное cosine-сходство ответов снизилось примерно с 0,85 до 0,65, а для большинства вопросов показатель оказался ниже порога 0,7.
Но этот результат нужно читать аккуратно. Снижение семантического сходства означает, что ответы стали менее похожими, а не то, что они стали точнее, глубже или полезнее. Более того, в доступном описании нет деталей о том, как измерялись фактическая корректность, устойчивость к плохим персонам и цена дополнительного этапа генерации.
Практический вывод пока такой: если нужна не одна «усреднённая» версия ответа, стоит управлять разнообразием на уровне исходной роли модели, а не просто крутить temperature. При этом для рабочих систем понадобится отдельная проверка: не превратилось ли достигнутое разнообразие в уверенную генерацию лишнего шума.
Источник: cs.AI updates on arXiv.org