Коротко
Thomson Reuters заявляет, что собственная модель Thomson конкурирует с Claude Opus 4.8 и обходит GPT-5.5 — на дроби от их размера и стоимости. Но все бенчмарки внутренние, а главный аргумент — проприетарные данные, которых нет у конкурентов.
Рынок ставил на то, что достаточно взять мощную general-purpose модель и прикрутить к ней RAG. Thomson Reuters поставил иначе: построить собственную LLM, заточенную под юридическую работу, и обучить её на проприетарном контенте, недоступном конкурентам. Модель Thomson, по заявлению компании, конкурирует с Claude Opus 4.8 и обходит GPT-5.5, Claude Sonnet 5 и Gemini 3.1 Pro.
Главный тезис: general-purpose модели хороши для всех, но профессионалам нужна не универсальность, а точность. Для юриста «почти правильно» — это ошибка с последствиями. В 2024 году Thomson Reuters купил Safe Sign Technologies и начал строить свою модель вместо того, чтобы полагаться на чужие.
Thomson построен на open-source базе и дообучен на контенте Westlaw, Practical Law, Checkpoint и Reuters. Сотни экспертов оценивали выводы, выявляли ошибки и проверяли, что модель рассуждает как юрист, а не как универсальный ассистент. Данные клиентов для обучения не используются.
Ключевое отличие от фронтир-моделей — доступ к проприетарным данным. В тесте на 53 юридических запросах, написанных внутренними экспертами, Thomson с доступом к Westlaw и Practical Law показал лучшую полноту и фактичность, чем фронтир-модели с доступом к вебу. Модель цитирует источники, которые можно проверить. Это не магия архитектуры — это данные, которых у OpenAI и Anthropic нет.
Но критически: все бенчмарки внутренние и саморепортующиеся. Методология — «LLM as judge» с калибровкой по оценкам экспертов Thomson Reuters. Модель ещё не запущена. Первое применение — Tabular Analysis в CoCounsel Legal в августе: структурированный анализ документов с чётким стандартом точности. Это самый безопасный старт — объёмная, предсказуемая работа, где преимущество доменной модели легко измерить и сложно оспорить.
Использовано менее 10% контента Thomson Reuters. Если модель на десятой доле данных уже заявляет паритет с фронтиром — вопрос в том, что будет с остальными 90%. Либо преимущество сильно преувеличено, либо доменная специализация действительно меняет игру.
Стратегический вывод проще, чем бенчмарки: если у вас есть проприетарные данные и доменная экспертиза, своя модель может быть выгоднее зависимости от чужой. Thomson Reuters не утверждает, что general-purpose модели бесполезны — он утверждает, что для работы с высокими ставками специализация побеждает универсальность. Это вызов нарративу «одна большая модель решит всё».
До независимых тестов и реального использования — это обещание, а не факт. Но направление — доменные модели на закрытых данных — похоже на более устойчивый тренд, чем очередная гонка за размером.
Источник: Hacker News - Newest: ""AI" "LLM""