Markdown или PDF для базы знаний ИИ: что легче обновлять и проверять
Команда загружает сотню PDF в ИИ-поиск, задаёт простой вопрос и получает ответ с неправильным номером пункта. Первая реакция — заменить модель. Но иногда проблема раньше: текст извлечён в неверном порядке, таблица потеряла заголовок, а действующая версия смешалась со старой. Markdown решает часть этих задач ясной структурой, зато не заменяет подписанный оригинал и может терять визуальные схемы. PDF сохраняет утверждённый документ, но сложнее для автоматического чтения. Правильное сравнение начинается с назначения файла и процедуры обновления, а не с названия расширения.
Один документ, два представления
Представим инструкцию по возвратам: семь разделов, таблица сроков, схема эскалации и подпись руководителя. В PDF удобно показать именно ту версию, которую согласовали и разослали. На странице видны табличная сетка, сноска и подпись. Но поиск может извлечь правую колонку раньше левой, прочитать нижний колонтитул как часть ответа и не связать ячейку «14 дней» с её заголовком. Markdown проще разбить на разделы, индексировать и проверить в системе контроля версий. Однако перенос таблицы и схемы требует редакторской работы: автоматическая конвертация легко пропускает смысловую связь.
Мы бы хранили утверждённый PDF как юридический и операционный исходник, а Markdown — как подготовленную текстовую копию для поиска. Между ними нужна ссылка: номер версии, дата вступления в силу, владелец документа и адрес оригинала. Если копия меняется сама по себе, возникает новая опасность: ИИ уверенно цитирует неутверждённый текст. Такой подход работает не только с PDF. В гайде о рабочей базе знаний рассматривается роль редактора и жизненный цикл источника.
Что сравнивать в поиске
Возьмите 20 вопросов сотрудников: десять с прямым ответом в тексте, пять с таблицами, пять с условием или исключением. Для каждого заранее запишите точный пункт оригинала и допустимый ответ. Прогоните один и тот же набор через индекс PDF и через проверенный Markdown, сохраняя модель, параметры поиска и число возвращаемых фрагментов. Отдельно оцените точность найденного фрагмента и точность окончательного ответа. Иначе можно ошибочно похвалить формат за удачную генерацию, хотя поиск вернул не тот документ.
В PDF проверьте порядок абзацев, наличие текста в сканах и читаемость таблиц. Скан без текстового слоя потребует OCR; расхождение в одной цифре здесь важнее красивой верстки. В Markdown проверьте иерархию заголовков, единство терминов и ссылки на приложения. Большая таблица в виде сотни строк Markdown тоже может стать неудобной: поисковому фрагменту понадобится заголовок колонки и контекст строки. Поэтому не существует универсального правила «всё переводим в Markdown» или «оставляем только PDF». Тесты на реальных вопросах важнее общего совета.
Версии и обновление
PDF обычно появляется после согласования. Пока сотрудник правит проект, индекс может оставаться на старой версии. Markdown легче обновить в репозитории и увидеть diff, но скорость обновления не означает права публиковать черновик. Установите состояния: проект, на согласовании, действует, архив. ИИ-поиск должен по умолчанию видеть только действующие записи. Если нужен архивный ответ, пользователь должен явно указать дату и понимать, что это историческая информация. При конфликте версий система обязана показать обе даты, а не молча выбрать файл с более длинным названием.
Схемы и скриншоты требуют отдельного описания. В PDF человек видит стрелку между двумя блоками; текстовый индекс может не увидеть её вовсе. В Markdown можно записать словами, что после отказа запрос переходит ответственному, а не автоматически закрывается. Если эта фраза меняет процесс, её утверждают вместе с оригиналом. Не используйте генерацию картинки в качестве доказательства того, как выглядел исходный документ. В разборе Docling показан один из инструментов извлечения структуры, но контроль исходника остаётся обязательным.
Стоимость и права
PDF может быть проще раздать сотрудникам как файл, но сложнее ограничить отдельный абзац по роли. Markdown в базе знаний допускает точные метаданные и автоматические проверки, если система доступа настроена правильно. Ни один формат не гарантирует защиту: утечка случится, если индекс объединит внутренний регламент с публичными документами. Разделяйте коллекции, проверяйте права при каждом поисковом запросе и сохраняйте журнал того, какая версия была показана модели. Считайте стоимость не только по токенам, но и по времени редактора на поддержание двух представлений.
Что выбрать
Для утверждённой инструкции с подписью храните PDF как оригинал и делайте проверенную текстовую копию для поиска. Для живой технической документации, где важны частые правки и проверяемый diff, Markdown часто удобнее как основной формат. Для сканов, сложных таблиц и схем понадобится дополнительная ручная разметка независимо от выбора. Побеждает не расширение, а тот процесс, в котором каждый ответ можно вернуть к действующему пункту и проверить человеком.
Частые вопросы
Достаточно ли просто загрузить PDF в чат? Для разового чтения иногда да; для повторяемой корпоративной базы нужны версии, права и контроль извлечения.
Markdown всегда дешевле? Не обязательно. Подготовка и поддержание точной копии сложного документа могут стоить дороже парсинга PDF.
Что делать с таблицей сроков? Проверять, что каждая цифра связана с правильной строкой и колонкой в контрольных вопросах.
Можно ли удалить PDF после конвертации? Нет, если он служит утверждённым оригиналом или нужен для подтверждения прошлой редакции.