Claude, GPT и Gemini для документов: сравниваем проверяемый результат
Размер контекстного окна сам по себе не отвечает на вопрос, какую модель выбрать для договора, отчёта или пачки инструкций. В работе важнее, сохранены ли определения и исключения, умеет ли система показать основание вывода и сколько времени редактор тратит на перепроверку. Ниже — методика сравнения Claude, GPT и Gemini, которую можно повторить на своих файлах. Это не рейтинг брендов: итог зависит от версии модели, интерфейса, формата загрузки и правил хранения данных.
Соберите одинаковый тестовый набор
Возьмите три обезличенных файла: текстовый регламент на 20–30 страниц, таблицу с несколькими листами и PDF со сносками. Добавьте контрольные факты: дату, отрицание, исключение и число с единицами измерения. Отдельно составьте пять вопросов, ответы на которые точно есть, и два вопроса, которых в документах нет.
Загрузите этот набор в каждый инструмент без предварительного пересказа. Запишите дату, точную версию модели, режим рассуждения, время ответа и ограничения тарифа. Одинаковый промпт важен, но не менее важен одинаковый порядок файлов и одинаковая формулировка задачи. Иначе вы сравните не модели, а разные условия.
Что проверять в тексте
Начните с извлечения фактов: попросите вывести даты, роли и обязательства в таблицу. Затем задайте вопрос с отрицанием: «что регламент запрещает?». Модель, которая потеряла частицу «не», дала опасный результат, даже если её резюме выглядит убедительно.
Попросите привести короткую цитату и номер страницы или раздела. Если интерфейс не поддерживает точную ссылку, сохраните исходный фрагмент и проверьте его вручную. Отдельно задайте вопрос вне документа. Хороший ответ сообщает, что сведений недостаточно, а не заполняет пробел правдоподобной догадкой.
Таблицы и приложения тестируйте отдельно
В таблице добавьте скрытый столбец, объединённые ячейки, разные единицы и строку с исключением. Спросите итог по формуле и попросите показать использованные строки. Ошибка часто появляется не в арифметике, а при чтении структуры: модель принимает заголовок за значение или смешивает листы.
PDF с примечаниями проверяйте в двух режимах: вопрос по основному тексту и вопрос по сноске. Если цифра в сноске меняет смысл пункта, это должно попасть в результат. Сохраните скриншот страницы с проблемным местом для внутреннего отчёта; личные данные и номера договоров перед этим закройте.
Оценивайте не впечатление, а одинаковые критерии
| Критерий | Как измерить | Что считать проблемой |
|---|---|---|
| Факты | 20 контрольных утверждений | изменена дата, роль или отрицание |
| Цитаты | 10 ссылок на фрагмент | цитата не найдена в файле |
| Таблица | 5 расчётов и 3 фильтра | потеряна строка или единица |
| Отказ | 2 вопроса вне набора | уверенная выдумка вместо уточнения |
| Скорость | от загрузки до проверяемого ответа | быстрый, но требующий полной переделки результат |
| Контроль | время редактора и число правок | проверка дольше ручного чтения |
| Приватность | настройки хранения и удаления | нельзя понять, кто видит файл |
Оценку проводите вслепую: коллега получает три ответа без названий моделей и отмечает ошибки по одной форме. После этого добавьте стоимость запроса и ручного контроля. Ответ за одну минуту не выгоден, если на исправления уходит час.
Практические различия подходов
Claude часто удобно использовать для последовательного чтения и аккуратного пересказа, когда важны оговорки и логика разделов. GPT хорошо подходит для структурирования смешанного набора задач и вызова инструментов, если процесс требует промежуточных проверок. Gemini может быть удобен, когда документы уже находятся в экосистеме Google и важна работа с несколькими форматами. Это рабочие гипотезы, а не обещание: конкретная версия, лимиты и настройки способны изменить результат.
Не сравнивайте только интерфейсы чата. Проверьте, как каждая модель ведёт себя после уточнения, при повторной загрузке одного файла и при сокращении контекста. Если документ обновился, попросите перечислить различия между версиями, а не пересказать новую целиком. Для такого сценария полезно связать тест с материалом о векторном поиске и embedding.
Постройте маршрут с контрольными точками
Надёжный процесс состоит из четырёх шагов. Сначала модель извлекает факты и указывает источники внутри файла. Затем другой запрос проверяет противоречия и пропуски. Третий шаг превращает подтверждённые данные в краткий вывод или таблицу. В конце человек принимает решение и сохраняет исходный ответ вместе с правками.
Не передавайте модели право менять файл без предпросмотра. Для финансовых, юридических и кадровых документов назначьте владельца, который может остановить автоматизацию. Логи храните без полного текста конфиденциальных запросов: достаточно идентификатора операции, версии модели, количества токенов и статуса.
Как выбрать инструмент для пилота
Если главное — длинный связный текст, начните с теста на регламенте. Если больше таблиц, перенесите вес критериев на структуру и расчёты. Если документы не должны покидать компанию, сравните локальный и облачный вариант, а не только три облачные модели. Стоимость считайте на полном маршруте: загрузка, повторные вопросы, проверка человеком и хранение.
Пилот должен длиться несколько рабочих дней и включать обычный, сложный и заведомо неполный пример. Сохраните результаты до и после настройки, попросите независимого коллегу оценить их и зафиксируйте условие остановки. Если качество не выросло или проверка стала дольше ручной, это честный повод не внедрять модель.
Чек-лист сравнения
- Набор файлов и промпт одинаковы для всех вариантов.
- Версии, даты и лимиты записаны в журнале.
- Проверены факты, отрицания, сноски и таблицы.
- Есть вопросы без ответа и проверка отказа.
- Измерены ручные правки, задержка и стоимость.
- Данные обезличены, а правила хранения понятны.
- Результат посмотрел человек, не участвовавший в настройке.
- Зафиксированы сильный сценарий, слабое место и условие отката.
Побеждает не модель с самым эффектным ответом, а связка, которую команда может проверить и повторить. Начните с небольшого набора документов, сохраняйте неудачные примеры и обновляйте тест при смене версии. Тогда сравнение Claude, GPT и Gemini станет рабочим решением для конкретного процесса, а не рекламным списком.
Слепой повтор через неделю
Чтобы сравнение не зависело от удачного дня, повторите пять контрольных вопросов через неделю на тех же файлах, но в новом порядке. Спрячьте названия моделей от коллеги, который выставляет оценки, и сохраните все ответы целиком — включая отказ и уточняющие вопросы. Сравнивайте не только балл, но и стабильность: если модель сегодня сохраняет отрицание, а завтра теряет его после переформулировки, это важное ограничение для рабочего процесса.
Отдельно отметьте стоимость человеческого контроля. Для каждого ответа запишите минуты на поиск цитаты, исправление таблицы и проверку вопросов вне набора. Если одна модель требует меньше запросов, но больше ручных сверок, её преимущество может исчезнуть. Такой учёт полезен и при смене тарифов: вы увидите, какой компонент вырос — запросы, хранение, повторная загрузка или время сотрудника.
Перед финальным выбором проведите короткий «отказной» тест: попросите каждую систему назвать факт, которого нет в документах, и объяснить, почему она не может его подтвердить. Инструмент, который явно обозначает границу знания и оставляет ссылку на исходник, надёжнее красивого ответа без опоры. Сохраните этот сценарий в регрессионном наборе и запускайте его после обновления модели или интерфейса.