Коротко
Исследование показывает неожиданный разрыв: для повторения уже известных психологических экспериментов большие модели почти не нужны, но при встрече с новой структурой задачи размер снова становится важен. Это меняет то, как стоит оценивать AI-модели человеческого поведения.
Главный вывод исследования неудобен для идеи «чем больше модель, тем лучше она понимает человека»: на знакомых психологических задачах масштаб почти не помогает. Модели размером от 0,6 до 1 млрд параметров смогли сравниться с базовой моделью на 70 млрд — но только при проверке на новых участниках в тех же парадигмах.
Авторы обучили 14 моделей размером от 135 млн до 14 млрд параметров на Psych-101: наборе из 10,7 млн решений участников в 160 экспериментах. Внутри знакомого распределения результаты быстро упирались в узкий потолок. Похоже, для такого сценария модель не обязана быть гигантской: ей достаточно выучить устойчивые закономерности конкретного набора задач.
Настоящая разница появилась, когда моделям предложили задачи с новой структурой. Здесь масштабирование дало заметно более сильный эффект: крупные модели лучше обобщали поведение за пределами знакомых экспериментов. Практический смысл простой — совпадение с людьми на известных тестах ещё не говорит, что модель действительно уловила общие принципы принятия решений.
Есть и важная проверка на статистические shortcuts. Исследователи по очереди убирали инструкции, стимулы, обратную связь и историю выборов, а также меняли порядок trials. Если оставить только историю прошлых ответов, модель теряла большую часть выученной информации: маскирование стимулов и feedback уничтожало 75,7% сигнала и снижало результат ниже случайного уровня. При этом порядок trial почти не имел значения в задачах с независимыми попытками, но становился важен там, где предыдущие ответы влияли на следующие.
Ограничение у подхода принципиальное: такие модели остаются привязаны к парадигмам, на которых их обучали. Поэтому их можно использовать как оценку «потолка шума» в психологических экспериментах, но нельзя автоматически считать универсальными моделями человеческого мышления. Знакомое поведение они воспроизводят дёшево; перенос на незнакомую задачу всё ещё требует масштаба и, главное, отдельной проверки.
Когда вы видите высокое совпадение AI с человеческими ответами, это для вас уже доказательство понимания — или только повод проверить модель на незнакомой структуре задачи? Источник: cs.AI updates on arXiv.org