• Главная
  • Новости
  • Блог
  • Релизы
  • История LLM
  • Сравнение LLM
  • Библиотека
  • Обо мне
⌘K
Вход

Блог и заметки о разработке. Для связи удобнее всего использовать соцсети ниже.

Контакты
talalaev.misha@gmail.com
Документы
Политика обработки персональных данныхСогласие на обработку персональных данных
Фото: Andrea De Santis / Unsplash

Маленькие модели копируют поведение — пока задача знакома

Sh0ny
Sh0ny
7 августа 2026
  1. Главная
  2. Блог
  3. Маленькие модели копируют поведение — пока задача знакома
1 мин чтения

Коротко

Исследование показывает неожиданный разрыв: для повторения уже известных психологических экспериментов большие модели почти не нужны, но при встрече с новой структурой задачи размер снова становится важен. Это меняет то, как стоит оценивать AI-модели человеческого поведения.

Главный вывод исследования неудобен для идеи «чем больше модель, тем лучше она понимает человека»: на знакомых психологических задачах масштаб почти не помогает. Модели размером от 0,6 до 1 млрд параметров смогли сравниться с базовой моделью на 70 млрд — но только при проверке на новых участниках в тех же парадигмах.

Авторы обучили 14 моделей размером от 135 млн до 14 млрд параметров на Psych-101: наборе из 10,7 млн решений участников в 160 экспериментах. Внутри знакомого распределения результаты быстро упирались в узкий потолок. Похоже, для такого сценария модель не обязана быть гигантской: ей достаточно выучить устойчивые закономерности конкретного набора задач.

Настоящая разница появилась, когда моделям предложили задачи с новой структурой. Здесь масштабирование дало заметно более сильный эффект: крупные модели лучше обобщали поведение за пределами знакомых экспериментов. Практический смысл простой — совпадение с людьми на известных тестах ещё не говорит, что модель действительно уловила общие принципы принятия решений.

Есть и важная проверка на статистические shortcuts. Исследователи по очереди убирали инструкции, стимулы, обратную связь и историю выборов, а также меняли порядок trials. Если оставить только историю прошлых ответов, модель теряла большую часть выученной информации: маскирование стимулов и feedback уничтожало 75,7% сигнала и снижало результат ниже случайного уровня. При этом порядок trial почти не имел значения в задачах с независимыми попытками, но становился важен там, где предыдущие ответы влияли на следующие.

Ограничение у подхода принципиальное: такие модели остаются привязаны к парадигмам, на которых их обучали. Поэтому их можно использовать как оценку «потолка шума» в психологических экспериментах, но нельзя автоматически считать универсальными моделями человеческого мышления. Знакомое поведение они воспроизводят дёшево; перенос на незнакомую задачу всё ещё требует масштаба и, главное, отдельной проверки.

Когда вы видите высокое совпадение AI с человеческими ответами, это для вас уже доказательство понимания — или только повод проверить модель на незнакомой структуре задачи? Источник: cs.AI updates on arXiv.org

новостиaiнейросетинаука и техника
Больше разборов AI-инструментов — в Telegram-канале, коротко и по делу
Подписаться в Telegram

Комментарии

(0)
​