• Главная
  • Новости
  • Блог
  • Релизы
  • История LLM
  • Сравнение LLM
  • Библиотека
  • Обо мне
⌘K
Вход

Блог и заметки о разработке. Для связи удобнее всего использовать соцсети ниже.

Контакты
talalaev.misha@gmail.com
Документы
Политика обработки персональных данныхСогласие на обработку персональных данных
Фото: PixelPro Vibes / Unsplash

ИИ оценивает ИИ-учёных: Gemini и Claude согласны, GPT-5.4 — нет

Sh0ny
Sh0ny
3 августа 2026
  1. Главная
  2. Блог
  3. ИИ оценивает ИИ-учёных: Gemini и Claude согласны, GPT-5.4 — нет
2 мин чтения

Коротко

Первый количественный бенчмарк автономных AI Scientist систем показал: LLM-ревьюеры могут оценивать научные статьи согласованно — но не все. GPT-5.4 расходится с двумя другими моделями, а победитель бенчмарка подозрительно совпадает с его организатором.

Автономные системы научного исследования уже генерируют статьи, но как понять, какая из них лучше? Группа исследователей предложила первый количественный бенчмарк: четыре фреймворка (Sakana AI v1 и v2, CycleResearcher, Data-to-Paper) получили одинаковый набор из 15 исследовательских предложений и сгенерировали 60 статей. Оценивали три независимых LLM-ревьюера — GPT-5.4, Gemini и Claude — по четырём параметрам: оригинальность, научная строгость, ясность и значимость. Результаты опубликованы на arXiv.

Главный вывод обнадёживает: Gemini и Claude демонстрируют почти идеальное согласие между собой (ρ = 0.907, p < 0.001) и экстремально сильную корреляцию с синтезированной оценкой (ρ = 0.961). Это значит, что автоматизированное рецензирование с помощью LLM может работать как масштабируемая и согласованная система оценки — по крайней мере, когда ревьюеры смотрят на статьи одинаково.

Но GPT-5.4 ломает картину. Его корреляция с другими моделями — всего ρ ≈ 0.32. Авторы осторожно объясняют это тем, что модель «использует другие критерии оценки». На практике это означает: если вы выберете GPT-5.4 как единственного рецензента, рейтинг систем будет выглядеть принципиально иначе, чем при использовании Gemini или Claude. Для бенчмарка, претендующего на роль стандарта, это серьёзная трещина.

Ещё один неудобный факт. Исследовательские предложения, на которых тестировались все четыре фреймворка, опубликованы коммерческой компанией FARS — и она же предоставила 15 эталонных статей. Результат: статьи FARS набирают 2.14–2.47 балла из 5, а все остальные — от 1.00 до 1.87. На оценках Gemini и Claude отрыв FARS более чем двукратный. Когда организатор бенчмарка одновременно является победителем, вопрос о независимости оценки повисает в воздухе — даже если LLM-ревьюеры формально независимы.

Что это значит для практики? Мульти-модельное LLM-рецензирование — рабочий инструмент, но только если вы проверяете согласие между ревьюерами и не доверяете одной модели слепо. GPT-5.4, Gemini и Claude не просто дают разные оценки — они, по всей видимости, оптимизируют разные представления о качестве. Прежде чем использовать автоматический рецензент в пайплайне, стоит выяснить, какой именно «вкус» оценки выдаёт каждая модель, и не окажется ли, что ваш бенчмарк отражает предпочтения одного поставщика, а не реальное качество.

Источник: cs.AI updates on arXiv.org

новостиaillmнаука
Больше разборов AI-инструментов — в Telegram-канале, коротко и по делу
Подписаться в Telegram

Комментарии

(0)
​