Коротко
Первый количественный бенчмарк автономных AI Scientist систем показал: LLM-ревьюеры могут оценивать научные статьи согласованно — но не все. GPT-5.4 расходится с двумя другими моделями, а победитель бенчмарка подозрительно совпадает с его организатором.
Автономные системы научного исследования уже генерируют статьи, но как понять, какая из них лучше? Группа исследователей предложила первый количественный бенчмарк: четыре фреймворка (Sakana AI v1 и v2, CycleResearcher, Data-to-Paper) получили одинаковый набор из 15 исследовательских предложений и сгенерировали 60 статей. Оценивали три независимых LLM-ревьюера — GPT-5.4, Gemini и Claude — по четырём параметрам: оригинальность, научная строгость, ясность и значимость. Результаты опубликованы на arXiv.
Главный вывод обнадёживает: Gemini и Claude демонстрируют почти идеальное согласие между собой (ρ = 0.907, p < 0.001) и экстремально сильную корреляцию с синтезированной оценкой (ρ = 0.961). Это значит, что автоматизированное рецензирование с помощью LLM может работать как масштабируемая и согласованная система оценки — по крайней мере, когда ревьюеры смотрят на статьи одинаково.
Но GPT-5.4 ломает картину. Его корреляция с другими моделями — всего ρ ≈ 0.32. Авторы осторожно объясняют это тем, что модель «использует другие критерии оценки». На практике это означает: если вы выберете GPT-5.4 как единственного рецензента, рейтинг систем будет выглядеть принципиально иначе, чем при использовании Gemini или Claude. Для бенчмарка, претендующего на роль стандарта, это серьёзная трещина.
Ещё один неудобный факт. Исследовательские предложения, на которых тестировались все четыре фреймворка, опубликованы коммерческой компанией FARS — и она же предоставила 15 эталонных статей. Результат: статьи FARS набирают 2.14–2.47 балла из 5, а все остальные — от 1.00 до 1.87. На оценках Gemini и Claude отрыв FARS более чем двукратный. Когда организатор бенчмарка одновременно является победителем, вопрос о независимости оценки повисает в воздухе — даже если LLM-ревьюеры формально независимы.
Что это значит для практики? Мульти-модельное LLM-рецензирование — рабочий инструмент, но только если вы проверяете согласие между ревьюерами и не доверяете одной модели слепо. GPT-5.4, Gemini и Claude не просто дают разные оценки — они, по всей видимости, оптимизируют разные представления о качестве. Прежде чем использовать автоматический рецензент в пайплайне, стоит выяснить, какой именно «вкус» оценки выдаёт каждая модель, и не окажется ли, что ваш бенчмарк отражает предпочтения одного поставщика, а не реальное качество.
Источник: cs.AI updates on arXiv.org