Коротко
Новый benchmark оценивает, умеет ли LLM пройти весь путь от инструкции и EEG-сигнала до численных выводов, артефактов и научного отчёта. Его главный результат пока не рейтинг моделей, а показательная зависимость качества от того, как именно организован рабочий процесс.
Большинство тестов для LLM в анализе EEG проверяют отдельные задачи: классификацию, декодирование или работу в рамках конкретной демонстрации. BrainBench предлагает оценивать не отдельный ответ, а полный исследовательский workflow — от инструкции и обработки сигнала до количественных доказательств и интерпретации.
Это важный сдвиг. В реальной работе недостаточно распознать класс по записи: системе нужно понять задачу, обработать EEG, при необходимости использовать физиологические сигналы, выполнить расчёты и оформить вывод так, чтобы его можно было проверить.
BrainBench объединяет четыре направления:
Всего в benchmark входят 17 датасетов и более 100 тысяч запусков при оценке моделей. Система получает инструкцию и записи, а на выходе должна выдать научно обоснованный отчёт и, когда это требуется, дополнительные артефакты.
Проверка не сводится к одному типу метрики: авторы используют численные, категориальные, множественные, последовательностные и семантические проверки, а также валидацию артефактов. Это ближе к проверке воспроизводимого анализа, чем к обычному вопросу с правильным ответом.
Самый интересный вывод касается не конкретной модели. Результаты заметно меняются в зависимости от модели, подзадачи, уровня сложности и способа выполнения. Авторы сравнивают два режима: автономное исполнение кода через CodeAct и структурированный агентный анализ через BrainAgent.
Отсюда следует практический вывод: «какая LLM лучше понимает EEG» — неполный вопрос. Нужно уточнять, в каком агентном контуре она работает, может ли запускать код, как получает доступ к сигналам и как проверяется её результат. Одна и та же модель в разных операционных режимах — это фактически разные инструменты.
Пока BrainBench стоит воспринимать прежде всего как инфраструктуру для измерения, а не как готовый рейтинг. В опубликованном описании нет полного набора численных результатов по моделям; код и benchmark обещают выпустить позднее, а результаты — обновлять.
Для разработчиков медицинских и научных AI-систем это полезнее очередной таблицы лидеров. Перед внедрением можно будет проверять не только точность классификации, но и весь путь рассуждения: корректно ли выполнены вычисления, согласуется ли отчёт с данными и создала ли система требуемые артефакты. Именно на этих переходах между сигналом, кодом и интерпретацией обычно и ломается красивая демонстрация.
Источник: cs.AI updates on arXiv.org