ИИ ИИшка Про
Обзоры
I

Granite PatchTST‑FM‑r2: карточка модели IBM для прогноза временных рядов

AI-редакция

Granite Time Series PatchTST‑FM‑r2 — открытая фундаментальная модель IBM для прогнозирования временных рядов без обязательного дообучения на каждом новом наборе. В ней около 385 миллионов параметров, контекст до 8192 точек и вероятностная голова на 99 квантилей. Модель опубликована с весами, кодом и воспроизводимым конвейером; пользователь может выбрать Apache 2.0 или OpenMDW 1.0.

Для каких данных она создана

IBM перечисляет спрос, цены, энергопотребление, трафик, телеметрию и другие числовые последовательности. На вход подаётся таблица со временем и одним или несколькими целевыми столбцами. Модель использует историю и строит значения на выбранный горизонт. Zero-shot означает, что перед первым прогнозом не требуется отдельное обучение на вашем ряду.

Это не универсальный аналитик. Модель не читает договор, не объясняет продажи словами и не знает о кампании, если событие не представлено в данных. Её задача узкая: продолжить числовую динамику и оценить неопределённость.

Что изменилось относительно r1

Вместо обычных блоков Transformer используются Conformer-блоки, объединяющие внимание и временную свёртку. Свёртка захватывает локальные зависимости между соседними участками, а attention работает с более длинными связями. Ядра размеров 3 и 5 чередуются по заданной схеме.

Ряд делится на перекрывающиеся участки длиной 16 с шагом 8. При прогнозе перекрытия складываются с весами, что должно сглаживать границы. Количество блоков выросло с 20 до 30, а обучающий набор расширен синтетическими рядами, полученными методом CauKer. Перед выходной головой добавлена нормализация для устойчивости.

Что означает 99 квантилей

Одна линия прогноза создаёт ложное ощущение точности. Квантильная голова выдаёт набор возможных уровней: медиану, нижние и верхние границы и промежуточные оценки. По ним можно построить диапазон и увидеть, где неопределённость растёт.

Но квантили должны быть откалиброваны на ваших данных. Если 90‑процентный интервал покрывает фактическое значение только в половине случаев, подпись не соответствует реальности. Проверьте покрытие на нескольких временных окнах и отдельно на пиках.

Результаты GIFT‑Eval

По состоянию на 8 сентября IBM сообщает второе место среди воспроизводимых zero-shot моделей без утечки тестовых данных по CRPS и MASE. Геометрическое среднее CRPS — 0,467, MASE — 0,6846; для обеих метрик меньше означает лучше. В этой группе PatchTST‑FM‑r2 стала лучшей моделью с разрешительной коммерческой лицензией.

Результаты на момент публикации были представлены в ожидающем принятия pull request для рейтинга. Это не делает их недействительными, но требует аккуратной подписи. Самостоятельно воспроизведите версии данных и кода. Наш гайд по чтению бенчмарков поможет отделить место в таблице от качества в рабочем процессе.

Требования к запуску

Официальный пример использует пакет Granite‑TSFM версии не ниже 0.3.9, pandas и pipeline прогнозирования. Вес загружается из репозитория IBM. Пользователь задаёт столбец времени, целевые столбцы, контекст, горизонт, частоту и нужные квантили.

385 миллионов параметров — умеренный размер, но реальная память зависит от точности, длины контекста, батча и библиотеки. До производственного сервиса измерьте задержку и потребление памяти на своём железе. Не обещайте CPU-запуск без конкретного теста, даже если модель намного меньше языковых гигантов.

Честный локальный тест

Разделяйте данные по времени: прошлое для настройки процесса, будущее для финальной оценки. Нельзя случайно перемешивать строки. Добавьте сезонную наивную базу — значение из аналогичного прошлого периода. Если сложная модель не превосходит её на нужной метрике, внедрение не оправдано.

Протестируйте пропуски, смену частоты, выбросы и короткую историю. Проверьте не только среднюю ошибку, но и худшие недели. Для запасов цена недопрогноза и перепрогноза различается, поэтому одна симметричная метрика скрывает бизнес-риск. Подробный выбор базового подхода разобран в сравнении фундаментальной модели и классического прогноза.

Лицензия

IBM предлагает выбор между Apache 2.0 и OpenMDW 1.0. Это удобно для исследований и коммерческих пилотов, но команда всё равно должна сохранить уведомления, проверить зависимости и оценить происхождение собственных данных. Открытая лицензия не гарантирует право использовать персональную телеметрию или чужие коммерческие ряды.

Общие различия лицензий и открытых весов разобраны в отдельном материале.

Где модель полезна, а где нет

PatchTST‑FM‑r2 интересна для быстрого создания сильной базы на множестве рядов, прототипа вероятностного прогноза и локального контура с контролем данных. Она особенно привлекательна, когда для каждого объекта мало истории и отдельное обучение слишком дорого.

Она не заменяет причинную модель, планирование промоакций или решение специалиста. Если будущее зависит от ещё не внесённого события, числовой ряд его не угадает. Модель также не исправит неверную бизнес-метрику: аккуратный прогноз ошибочно рассчитанного показателя остаётся бесполезным.

Вердикт

IBM выпустила компактную и воспроизводимую модель с сильным zero-shot результатом и полезной вероятностной головой. Главный плюс — возможность начать без обучения и развернуть веса самостоятельно. Главный риск — перенести рейтинг GIFT‑Eval на собственные данные без базовой линии и проверки интервалов.

Лучший первый шаг — десять рядов, три временных окна, простая база и измерение бизнес-стоимости ошибки. Только после этого стоит обсуждать постоянный сервис.

FAQ

Нужно ли обучать PatchTST‑FM‑r2 на своих данных?

Для zero-shot прогноза — нет. Дообучение можно рассматривать позже, если базовый тест покажет пользу.

Что означает контекст 8192?

Модель обучалась работать с историей до 8192 временных точек. Фактическую длину выбирают с учётом частоты и памяти.

Можно ли использовать модель коммерчески?

IBM предлагает Apache 2.0 или OpenMDW 1.0. Нужно соблюдать выбранную лицензию и права на данные и зависимости.

Почему вероятностный прогноз полезнее одной линии?

Он показывает диапазон возможных значений и помогает принимать решения с учётом риска, если интервалы откалиброваны на ваших данных.

Обзоры Auto-0.4B-2: карточка длинноконтекстного классификатора для проверки запросов агента Компактная модель на ModernBERT классифицирует инструкции и длинные контексты до 65 536 токенов. Разбираем назначение, ограничения авторского теста и безопасный путь проверки. Обзоры ESMC-AR 848M + PLE: карточка авторегрессионной модели для белковых последовательностей Открытая исследовательская модель предсказывает следующий аминокислотный токен и добавляет крупные n-граммные представления на каждом слое. Что в ней подтверждено и чего модельная карточка пока не доказывает. Обзоры Microsoft FSQ: обзор каркаса, который требует доказательства каждого действия ИИ-агента FSQ записывает шаги UI-автоматизации как проверяемые артефакты для веба, мобильных и настольных приложений. Разбираем архитектуру, сильные стороны и цену такой дисциплины. Обзоры Одна голосовая модель или связка с task-агентом: сравнение архитектур без магии Сопоставляем монолитный speech-to-speech контур и архитектуру, где разговор отделён от выполнения задач: задержка, перебивания, контроль, журналы и стоимость.
Опубликовано: 10 сентября 08:12
← На главную