Коротко
Исследование сравнило GPT-4o, GPT-5.2, Claude Sonnet 4.5 и DeepSeek на переводе узкоспециальной терминологии. Главный практический вывод: уверенность модели не равна точности, а лидер по качеству — не лидер по стабильности.
Свежая статья с arXiv проверяет, могут ли LLM заменить специализированные корпуса при переводе терминологии — и приходит к честному выводу: пока не могут. Но по дороге к этому выводу обнаруживаются вещи, которые важны не только переводчикам, а вообще всем, кто использует LLM в профессиональных задачах.
Исследователи взяли четыре модели — GPT-4o, GPT-5.2, Claude Sonnet 4.5 и DeepSeek — и прогнали через них 160 терминов (по 80 в двух доменах: науки о Земле и обработка естественного языка), с английского на французский. Тестировали две стратегии промптинга: «терминологический» режим (модель ищет эквивалент как термин) и «переводческий» (модель переводит в контексте).
Результаты разошлись заметно. Claude Sonnet 4.5 показал лучший результат в наиболее благоприятной конфигурации. DeepSeek не вырвался в лидеры по пиковой точности, но оказался самой стабильной моделью — меньше разброс между доменами и стратегиями. GPT-4o и GPT-5.2 оказались где-то посередине.
Это знакомый trade-off: модель, которая даёт лучший результат в идеальном случае, не обязательно лучшая в продакшене. Если вам нужна воспроизводимость и предсказуемость — DeepSeek интереснее. Если вы готовы тюнить промпт под конкретную задачу и максимизировать пик — Claude.
Самый практически ценный вывод исследования касается не того, какая модель «лучше», а того, насколько можно доверять самооценке модели. Анализ confidence estimates показал, что уверенность модели — лишь частичный индикатор терминологической точности. Модель может быть уверена и ошибаться. Это не новость для тех, кто работает с LLM регулярно, но теперь это подтверждено измерением на узкой задаче, где есть объективный критерий правильности.
Итог исследователей: LLM полезны как инструмент поддержки, но не заменяют специализированные корпуса. Корпора требуют времени, технических навыков и доступа к данным — но дают то, чего LLM пока не дают: контролируемую точность. Для команд, которые внедряют LLM в рабочие процессы, это означает простую вещь: не убирайте проверяемые источники, пока модель не научится честно сигнализировать о своих ошибках.
Источник: cs.AI updates on arXiv.org