Коротко
Кажущийся значимым прирост от экспертных MeSH-термов исчезает при смене схемы кросс-валидации. Разбор того, как методология оценки переворачивает выводы бенчмарка.
В систематических обзорах классификаторы помогают отсеять тысячи абстрактов, чтобы оставить релевантные. Входы часто дополняют MeSH-термами — либо от экспертов (с задержкой в недели), либо от автоматических инструментов (сразу). До сих пор их напрямую как фичи не сравнивали, и никто не задавался вопросом: зависит ли вывод от того, как классификатор оценивают.
Авторы взяли бенчмарк Cohen et al. (2006) по трём темам — Statins, Opioids, ADHD — и прогнали bag-of-words логистическую регрессию (семь перезапусков) и BiomedBERT (пять сидов). Затем они начали менять дизайн оценки и смотреть, как меняется разрыв между экспертными и автоматическими MeSH на теме Statins.
Результаты говорят сами за себя. При каноническом 5-fold на полном корпусе разрыв «эксперт минус автоматика» составляет +0.096 WSS@95%. Стоило уравнять размер корпуса до меньших тем (n = 803) — разрыв упал до +0.033, и 95% бутстрап-доверительный интервал включил ноль. При 10-fold кросс-валидации на полном размере — +0.021, интервал едва не пересекает ноль. BiomedBERT выдаёт +0.020 — в пределах шума относительно 10-fold результата bag-of-words.
Иначе говоря, «значимое преимущество экспертных MeSH» — во многом artefact конкретной схемы оценки. Разумное изменение дизайна съедает 80% разрыва.
Ещё один нюанс: 15.1% входов Statins превышают 512-токеновый лимит BiomedBERT, когда к ним добавляют экспертные MeSH. Усечение может объяснять, почему у трансформера разрыв меньше, — но отделить это от объёма обучающих данных в данном эксперименте нельзя.
Анализ мощности показывает, что эффект размера Statins нельзя было бы обнаружить при дисперсии Opioids или ADHD. Нулевые результаты по этим темам — не информативны, а ограничены дизайном. Это важный момент: «нет разницы» и «не хватило мощности заметить разницу» — разные вещи, и бенчмарки routinely их путают.
Практический вывод для тех, кто строит пайплайны скрининга: при использовании трансформеров или 10-fold bag-of-words разрыв между экспертными и автоматическими MeSH на протестированных темах — около 0.02 WSS@95%, с доверительными интервалами, пересекающими ноль по крайней мере на одной границе. Гнаться за экспертной разметкой ради классификатора, если автоматическая доступна сразу, может не стоить.
Более широкая мораль: выводы бенчмарка об источниках фич могут существенно меняться при разумных изменениях дизайна оценки. Если ваш эксперимент показывает «значимый» эффект, проверьте, переживает ли он альтернативную схему кросс-валидации и адекватный ли у вас размер выборки.
Источник: cs.CL updates on arXiv.org