Vision или Text: какую модель выбрать для конкретной задачи
Мультимодальная модель умеет видеть картинку, но наличие зрения не делает её автоматически точнее. Иногда изображение только увеличивает стоимость и добавляет новый источник ошибки: мелкий текст, блик или неверный масштаб. Текстовый режим выигрывает, когда данные уже извлечены и их нужно объяснить. Сравним оба подхода на одинаковом наборе задач и определим, где разумно соединить их в один маршрут.
Подготовьте контрольную выборку
Возьмите письмо на одну страницу, таблицу продаж, фотографию счётчика и скриншот окна с ошибкой. Обезличьте имена, номера счетов и адреса. Для каждого файла запишите эталонный ответ: даты, суммы, показания и точный текст ошибки. Эталон храните отдельно, чтобы модель не увидела его в контексте.
Отправьте одинаковые инструкции в текстовый и мультимодальный режим, зафиксируйте версию, время, размер файла и лимиты тарифа. Оценивайте не красоту формулировки, а факты, пропуски, уверенность, ручные исправления и стоимость полного пути до принятого результата.
Письмо: зрение не нужно
Попросите обе модели сократить черновик до заданного объёма, сохранив дату, сумму и просьбу клиента. Здесь сравниваются следование формату, тон и способность задать уточнение. Мультимодальный режим не получает преимущества, если на входе обычный текст. Текстовая модель обычно быстрее и проще для автоматического конвейера.
Проверяйте, не превратилось ли осторожное «возможно» в обещание и не исчезло ли отрицание. Если письмо содержит вложенную таблицу или скан, сначала извлеките его отдельным шагом, а затем передайте подтверждённый текст.
Таблица: файл надёжнее фотографии
Загрузите таблицу и попросите назвать месяцы с падением маржи, затем перечислить строки, повлиявшие на вывод. Проверьте знаки минус, десятичные разделители, скрытые строки и формулы. Текстовый режим, получивший чистый CSV, часто считает устойчивее, чем модель, читающая мелкий скриншот.
Если таблица приходит только в PDF, зрение помогает найти нужный блок, но арифметику лучше выполнять после извлечения в структурированный вид. Храните исходный файл, распознанные значения и исправления человека. Нельзя считать таблицу проверенной только потому, что она «выглядит читаемой».
Фотография: польза есть, уверенность ограничена
На фото счётчика или этикетки попросите перечислить видимые цифры, единицы и признаки плохой съёмки. Ответ должен включать детали, которые модель не смогла прочитать. Блик, наклон и обрезанный край — причина переснять объект, а не угадывать значение по соседним цифрам.
Для оплаты, гарантий и документов мультимодальная модель лишь помогает прочитать снимок. Окончательное число сверяйте с оригиналом и запишите, кто его подтвердил. Для публикации используйте собственный обезличенный снимок или схему; чужие скриншоты не копируйте. Сгенерированную иллюстрацию обозначайте как иллюстрацию AI-редакции.
Скриншот интерфейса: виден экран, но не история
Попросите описать сообщение, его расположение и безопасные следующие шаги. Vision-режим видит кнопку и текст ошибки, тогда как текстовой модели пришлось бы вручную переписывать экран. Но снимок не показывает права пользователя, предыдущие действия и последствия нажатия. Проверяйте совет на тестовом окружении и не давайте модели право менять настройки или удалять данные.
Закройте на скриншоте токены, почту, внутренние URL и идентификаторы. В статье достаточно одного собственного кадра с поясняющими стрелками; подпишите версию интерфейса и дату теста.
Сводка по критериям
| Сценарий | Где сильнее Text | Где оправдан Vision | Главная проверка |
|---|---|---|---|
| Письмо | формат и стиль | изображение не нужно | даты, суммы, тон |
| Таблица | расчёт после CSV | поиск блока в PDF | знаки и пропуски |
| Фото | не работает без описания | чтение видимых признаков | цифры и блики |
| Интерфейс | объяснение текста ошибки | расположение элементов | права и последствия |
Стоимость, скорость и приватность
Изображение в полном разрешении увеличивает объём входа и время обработки. Сжимайте копию, но сохраняйте читаемость нужных деталей. Сравнивайте стоимость полного маршрута: загрузка, повторный вопрос, ручная проверка и хранение результата.
Проверьте, где сервис хранит файлы, кто видит историю и можно ли отключить использование данных для обучения. Паспорта, банковские документы и внутренние панели не отправляйте в облако без разрешения. Для чувствительных данных применяйте локальное распознавание или закрывайте поля до загрузки.
Гибридный маршрут
Часто лучший процесс состоит из двух моделей. Vision извлекает наблюдаемые элементы — цифры, подписи, положение кнопки — и возвращает их с уровнем уверенности. Text-режим превращает подтверждённые данные в письмо, инструкцию или отчёт. Человек принимает критичное значение и сохраняет исходник вместе с результатом.
Такой маршрут проще отлаживать: если ошибка появилась в цифре, проверяется извлечение; если в выводе — текстовый шаг. Не скрывайте промежуточные данные за одним красивым ответом.
Двойная проверка извлечённых данных
Для чисел и коротких надписей используйте двухступенчатый маршрут. Сначала Vision возвращает только распознанные поля и координаты на изображении, без объяснений и догадок. Затем Text-модель получает эти поля и формирует нужный документ. Если значение нечитабельно, оно должно остаться пустым с пометкой «нужен новый снимок», а не заполняться вероятным числом.
Попросите независимого проверяющего открыть исходное фото и сравнить пять случайных полей с результатом. Записывайте не только процент совпадений, но и тип промаха: потерянный знак, перепутанная цифра, неверная единица или смещение колонки. Ошибка «12,5» вместо «12.5» может быть безвредной в письме и критичной в расчёте, поэтому порог задаётся сценарием.
Повторите тест после изменения размера изображения и освещения. Если качество резко меняется, укажите минимальное разрешение и требования к съёмке в интерфейсе. Сохраняйте изображение, извлечённые поля и подтверждение человека раздельно, ограничив срок хранения. Так можно исправить один неверный фрагмент, не отправляя документ заново целиком.
Чек-лист сравнения
- Одинаковые инструкции, файлы и версии режима записаны.
- Эталонные факты сохранены отдельно.
- Проверены числа, отрицания, пропуски и единицы.
- Визуальные детали с низкой уверенностью пересняты.
- Время и стоимость измерены до принятого результата.
- Скриншоты очищены от персональных данных.
- Опасные действия проверены в тестовой среде.
- Зафиксировано, где нужен Text, Vision или их связка.
Vision оправдан, когда изображение действительно содержит информацию, которую дорого описывать вручную. В остальных случаях текстовый режим проще контролировать. Выбирайте не самый широкий набор функций, а маршрут, в котором каждое важное значение можно проверить по исходнику.