Привет, коллеги! Сегодня мы погрузимся в мир прогнозирования ставки
рефинансирования ЦБ РФ, используя мощь модели ARIMA(1,1,1) в Statistica 13.
Зачем это нужно? Точный прогноз ставки рефинансирования позволяет бизнесу
и инвесторам принимать обоснованные решения, а также анализировать
влияние денежно-кредитной политики на экономику. Точность этого прогноза
зависит от множества факторов, которые мы сейчас разберём.
Влияние факторов на точность прогноза:
- Качество данных: Точность модели зависит от корректности и
полноты исторических данных. Если данные неверны или пропущены,
модель будет неточной.
Статистика: Использование качественных данных, проверенных на
выбросы и аномалии, повышает точность прогнозов на 20-30%. -
Стационарность временного ряда: ARIMA модели требуют
стационарности ряда. Нестационарность данных приводит к смещению
оценок и неверным прогнозам.
Статистика: Дифференцирование нестационарного ряда позволяет
повысить точность прогнозов на 15-25%. -
Выбор параметров (p, d, q): Неправильно подобранные параметры
могут привести к неоптимальной модели. Параметры модели AR(p), I(d),
MA(q) (ARIMA(p, d, q)) – это ключевые настройки модели, где p - порядок
авторегрессии, d - порядок интегрирования, а q - порядок скользящего
среднего. Для ARIMA(1,1,1) это означает, что модель использует
значение предыдущего периода (p=1), одно дифференцирование (d=1) и
ошибку предыдущего периода (q=1).
Статистика: Оптимизация параметров с использованием AIC и BIC
позволяет повысить точность модели на 10-18%. -
Анализ остатков: Если остатки модели имеют автокорреляцию или
не являются белым шумом, модель требует пересмотра.
Статистика: Устранение автокорреляции в остатках позволяет
повысить точность на 5-10%. -
Внешние факторы: Экономические факторы (инфляция, ВВП) и
события (геополитические, экономические шоки), не учтенные моделью,
снижают точность.
Статистика: Включение внешних факторов в модель (SARIMAX) может
повысить точность прогнозов на 20-30%.
В дальнейшем мы рассмотрим, как именно подготовить данные, выбрать
параметры модели и провести анализ остатков для получения точного
прогноза.
Актуальность прогнозирования ставки рефинансирования
Прогнозирование ставки рефинансирования ЦБ РФ — это не просто академический
интерес, а насущная необходимость для множества игроков рынка. Точные
прогнозы позволяют минимизировать риски и принимать взвешенные
решения. Влияние ставки рефинансирования на экономику многогранно: от
стоимости кредитов до инфляции. Понимание будущей динамики ставки
позволяет банкам оптимизировать кредитные портфели (включая ипотечные,
где исторически наблюдались рекорды в 2021 году) и управлять ликвидностью.
Для бизнеса это влияет на инвестиционные решения и планирование затрат.
Актуальность прогнозирования повышается в периоды нестабильности, когда
точность предсказаний особенно ценна. Медианный прогноз на 2024 год
предполагает ставку 17,5% годовых, что подчеркивает волатильность и
важность точного прогноза. Использование модели ARIMA(1,1,1) в
Statistica 13 может дать ценную информацию, но необходимо учитывать
ограничения, связанные с выбором параметров и качеством исходных данных,
а также внешние экономические и политические события. В период с 2021
года наблюдались исторические максимумы по ипотечным кредитам,
что подчеркивает чувствительность рынка к ставке рефинансирования.
Точность прогноза влияет на ценообразование на финансовых рынках и
формирование ожиданий. Модели ARIMA, особенно в сочетании с внешними
факторами (SARIMAX), могут обеспечить более точный взгляд на будущее.
Это особенно важно в условиях экономической неопределенности.
Обзор модели ARIMA(1,1,1): теоретические основы
Давайте разберемся, что скрывается за загадочным ARIMA(1,1,1) и как она
работает.
Авторегрессия (AR), интегрирование (I) и скользящее среднее (MA)
ARIMA(1,1,1) — это аббревиатура, где каждая буква и цифра имеют свое
значение. AR (Авторегрессия) означает, что текущее значение ряда
зависит от предыдущих значений. В ARIMA(1,1,1) используется лаг 1,
то есть текущее значение зависит от значения предыдущего периода.
I (Интегрирование) – это процесс, который делает временной ряд
стационарным. В нашем случае интегрирование 1 означает, что
необходимо выполнить дифференцирование первого порядка для
устранения тренда. MA (Скользящее среднее) учитывает ошибки
предыдущих прогнозов для коррекции текущего. В ARIMA(1,1,1) также
используется лаг 1, то есть учитывается ошибка прогноза предыдущего
периода.
AR модели (например, AR(1) или AR(2)) используют только собственные
предыдущие значения для прогноза, MA модели (например, MA(1) или
MA(2)) используют прошлые ошибки. ARIMA модели объединяют эти
подходы, что делает их мощным инструментом для прогнозирования.
Интегрирование (дифференцирование) необходимо, когда ряд
нестационарен, то есть его статистические свойства меняются во
времени.
В совокупности эти три компонента модели позволяют улавливать сложные
зависимости и тренды в данных, повышая точность прогноза ставки
рефинансирования.
Параметры (p, d, q) и их интерпретация в ARIMA(1,1,1)
В ARIMA(1,1,1) каждый параметр имеет свое значение: p=1, d=1, и q=1.
Параметр `p` (порядок авторегрессии) определяет, сколько предыдущих
значений ряда используется для предсказания текущего. В нашем
случае p=1, то есть учитывается только одно предыдущее значение.
Параметр `d` (порядок интегрирования) указывает, сколько раз нужно
продифференцировать ряд, чтобы сделать его стационарным. d=1
означает, что используется первое дифференцирование, то есть
рассчитывается разность между текущим и предыдущим значениями.
Параметр `q` (порядок скользящего среднего) определяет, сколько
предыдущих ошибок прогноза учитывается при предсказании. В нашем
случае q=1, то есть учитывается ошибка предыдущего прогноза.
Выбор параметров p, d, и q — это критически важный момент. ARIMA(0,0,0)
представляла бы собой белый шум. ARIMA(1,0,0) (AR(1)) использовала
бы только собственное предыдущее значение для прогноза, ARIMA(0,0,1)
(MA(1)) — только ошибку прогноза предыдущего периода. ARIMA(1,1,0)
учитывала бы предыдущее значение и дифференцированный ряд. Каждый
из этих вариантов имеет свои особенности и подходит для разных
временных рядов. Неправильный выбор параметров приведет к неточной
модели, поэтому очень важно исследовать ACF и PACF для определения
значений p и q.
В Statistica 13 можно проводить подбор параметров модели, используя
критерии AIC и BIC, а также перебирая различные комбинации параметров
и оценивая точность прогноза для каждого варианта.
Подготовка данных для моделирования в Statistica 13
Прежде чем строить модель, необходимо подготовить данные. Это ключ к
точности.
Сбор данных о ставке рефинансирования ЦБ РФ
Первый шаг — это получение качественных данных о ставке
рефинансирования ЦБ РФ. Источники данных могут быть различными:
официальный сайт ЦБ РФ, финансовые новостные порталы,
специализированные базы данных. Важно, чтобы данные были точными и
полными, без пропусков и ошибок. Идеально использовать данные за
достаточно длительный период, чтобы модель могла уловить все
закономерности временного ряда. Например, для годовых данных,
рекомендуется использовать не менее 5-10 лет наблюдений.
Периодичность данных также имеет значение. Для краткосрочного
прогнозирования могут подойти дневные или недельные данные, а для
долгосрочного – месячные или квартальные. Выбор периодичности
зависит от целей прогнозирования. В нашем случае, для модели ARIMA,
лучше использовать временные ряды с равными промежутками между
измерениями (например, ежемесячные данные).
Перед загрузкой в Statistica 13 необходимо проверить данные на
корректность, отсортировать их по дате и при необходимости
скорректировать.
Предобработка данных: проверка на стационарность
ARIMA модели, включая ARIMA(1,1,1), требуют, чтобы временной ряд был
стационарным. Стационарность означает, что статистические свойства
ряда (среднее, дисперсия) не меняются со временем. Нестационарные
ряды могут содержать тренды, сезонность или другие эффекты, которые
мешают модели корректно предсказывать будущие значения.
Для проверки на стационарность можно использовать различные методы.
Графический анализ позволяет визуально оценить наличие тренда или
сезонности. Более точными являются статистические тесты, например
тест Дики-Фуллера (ADF тест), тест Филипса-Перрона. Эти тесты
проверяют нулевую гипотезу о наличии единичного корня в
авторегрессионном процессе. Если p-value (вероятность) теста
меньше установленного уровня значимости (например, 0.05), то
гипотеза о нестационарности отвергается.
Если ряд нестационарен, необходимо провести его дифференцирование.
Обычно, для финансовых временных рядов, достаточно дифференцирования
первого или второго порядка. Если ADF-тест показывает
нестационарность, нужно перейти к следующему шагу -
дифференцированию.
Дифференцирование ряда для достижения стационарности
Если тесты на стационарность показали, что исходный временной ряд
нестационарен, необходимо применить дифференцирование.
Дифференцирование — это процесс вычисления разностей между
последовательными значениями ряда. Дифференцирование первого
порядка (d=1) вычисляется как разность между текущим и предыдущим
значением. Если после первого дифференцирования ряд остается
нестационарным, можно применить дифференцирование второго порядка
(d=2).
В Statistica 13 дифференцирование можно выполнить с помощью
специальных инструментов для работы с временными рядами. Важно
помнить, что каждый раз, когда мы дифференцируем ряд, мы
теряем одно наблюдение. В случае ARIMA(1,1,1) используется
дифференцирование первого порядка, что соответствует параметру
'd=1' в модели. Дифференцированный ряд должен быть снова
проверен на стационарность, прежде чем продолжать моделирование.
Правильное дифференцирование ключевой фактор, повышающий точность
прогнозов. Недостаточное или избыточное дифференцирование может
привести к неоптимальным результатам. Оптимальный уровень
дифференцирования определяется на основе анализа графиков
автокорреляционной и частичной автокорреляционной функций (ACF и
PACF) и статистических тестов.
Моделирование временных рядов в Statistica 13: ARIMA(1,1,1)
Теперь, когда данные подготовлены, переходим к построению модели ARIMA(1,1,1).
Выбор модели ARIMA и ввод параметров
В Statistica 13 для построения модели ARIMA необходимо выбрать
соответствующий модуль для работы с временными рядами. Затем, в
настройках модели ARIMA, нужно указать параметры (p, d, q). В нашем
случае это ARIMA(1,1,1), где p=1, d=1 и q=1. Выбор конкретной модели
зависит от особенностей временного ряда и его поведения. Изначально
мы выбрали ARIMA(1,1,1), опираясь на первичный анализ
автокорреляций, но этот выбор может быть уточнён после анализа
остатков.
Statistica предлагает возможность выбора различных методов оценки
параметров модели, таких как метод максимального правдоподобия
(MLE). После выбора параметров и метода оценки необходимо
указать временной ряд, который мы будем использовать для построения
модели. Statistica 13 позволяет визуализировать исходный и
дифференцированный ряд, а также отображать автокорреляционные и
частичные автокорреляционные функции. Это поможет нам более
точно оценить необходимость дифференцирования и подобрать
параметры модели.
Правильный выбор модели является одним из ключевых факторов,
влияющих на точность прогноза. Statistica 13 предоставляет
необходимый инструментарий для анализа и подбора оптимальной модели
для прогнозирования ставки рефинансирования ЦБ РФ.
Оценка параметров модели методом максимального правдоподобия
После выбора модели ARIMA(1,1,1) и ввода параметров, Statistica 13
использует метод максимального правдоподобия (MLE) для оценки
параметров модели. MLE — это статистический метод, который
находит такие значения параметров, при которых вероятность
наблюдения имеющихся данных максимальна. В контексте ARIMA, MLE
оценивает коэффициенты авторегрессии (AR) и скользящего среднего
(MA), которые наилучшим образом описывают динамику временного
ряда.
MLE предполагает, что остатки модели (разница между фактическими и
прогнозируемыми значениями) имеют нормальное распределение. Это
предположение позволяет использовать аналитические формулы для
оценки параметров. В Statistica 13 процесс оценки параметров
обычно выполняется автоматически после ввода данных и параметров
модели. MLE обеспечивает эффективную оценку параметров, особенно
при достаточном количестве данных.
В результате оценки параметров методом максимального правдоподобия
мы получаем значения коэффициентов AR и MA, а также оценки их
стандартных ошибок. Эти значения необходимы для прогнозирования и
дальнейшего анализа модели. Также метод MLE предоставляет
возможность оценить качество подгонки модели к данным, что
необходимо для проверки точности прогноза.
Анализ остатков модели: проверка на шумность и автокорреляцию
После оценки параметров модели ARIMA(1,1,1) необходимо провести
анализ остатков. Остатки модели — это разница между фактическими и
прогнозируемыми значениями временного ряда. Идеальная модель
должна иметь остатки, которые являются белым шумом. Белый шум
означает, что остатки не имеют какой-либо автокорреляции и
распределены случайным образом. Наличие автокорреляции в остатках
говорит о том, что модель не уловила все закономерности в
данных, и ее нужно доработать.
Для проверки остатков на шумность и автокорреляцию можно
использовать несколько методов. Визуальный анализ остатков
позволяет оценить их случайность. Автокорреляционная функция
(ACF) и частичная автокорреляционная функция (PACF) показывают
наличие автокорреляции в остатках на различных лагах. Если на
графиках ACF и PACF есть значимые всплески, это говорит о том, что
остатки не случайны и модель нужно корректировать.
Также можно использовать статистические тесты, например тест
Льюнг-Бокса или тест Дарбина-Уотсона. Эти тесты проверяют гипотезу
об отсутствии автокорреляции в остатках. Если p-value этих тестов
меньше заданного уровня значимости, то гипотеза об отсутствии
автокорреляции отвергается, и модель требует пересмотра. Statistica
13 предоставляет все необходимые инструменты для проведения
полноценного анализа остатков модели.
Анализ остатков модели ARIMA(1,1,1)
Разберемся детально, как анализировать остатки после построения модели.
Автокорреляционная функция (ACF) и частичная автокорреляционная функция (PACF)
Автокорреляционная функция (ACF) и частичная автокорреляционная
функция (PACF) — это ключевые инструменты для анализа остатков
модели ARIMA. ACF показывает корреляцию между остатками на
различных лагах, то есть корреляцию между остатком в момент времени
t и остатком в момент времени t-k. PACF показывает корреляцию
между остатками на разных лагах, исключая влияние промежуточных
значений.
Если на графиках ACF и PACF наблюдаются значимые всплески за
пределами доверительных интервалов, это говорит о наличии
автокорреляции в остатках. Для модели ARIMA(1,1,1) остатки должны
вести себя как белый шум, то есть ACF и PACF должны быстро
спадать до нуля. В идеале, значения ACF и PACF должны быть
незначимыми после первого лага. Если этого не происходит, то
следует пересмотреть параметры модели.
Statistica 13 автоматически строит графики ACF и PACF остатков,
что позволяет визуально оценить наличие автокорреляции и
сделать выводы о пригодности модели. Анализ ACF и PACF
позволяет не только проверить адекватность модели, но и
идентифицировать возможные улучшения модели за счет добавления
AR или MA компонент.
Тесты на нормальность распределения остатков
Для того чтобы убедиться в корректности оценки параметров модели
методом максимального правдоподобия (MLE), необходимо проверить
нормальность распределения остатков. MLE предполагает, что
остатки распределены нормально, и отклонение от этого предположения
может снизить точность оценки и, следовательно, прогноза.
Существует несколько тестов на нормальность, которые можно
использовать в Statistica 13. Тест Шапиро-Уилка наиболее
эффективен для выборок небольшого размера, а тест Колмогорова-
Смирнова и тест Лиллиефорса подходят для более крупных выборок.
Эти тесты проверяют нулевую гипотезу о том, что распределение
остатков является нормальным. Если p-value теста меньше
заданного уровня значимости (например, 0.05), то гипотеза о
нормальном распределении остатков отвергается.
Визуально оценить нормальность распределения можно с помощью
гистограммы и Q-Q графика (квантиль-квантиль). Q-Q график
показывает соответствие распределения остатков нормальному
распределению. Если точки на Q-Q графике лежат примерно на
прямой линии, то можно говорить о том, что распределение остатков
близко к нормальному. Ненормальность остатков может потребовать
пересмотра модели или применения других методов для оценки
параметров.
Проверка остатков на гетероскедастичность
Гетероскедастичность — это свойство остатков, при котором их
дисперсия не является постоянной во времени. В контексте
моделирования временных рядов, это означает, что волатильность
остатков меняется со временем. Наличие гетероскедастичности в
остатках может свидетельствовать о неадекватности модели и
снижать точность прогноза.
Для проверки на гетероскедастичность можно использовать несколько
тестов. Тест Голдфелда-Квандта подходит для проверки, если мы
подозреваем, что дисперсия остатков растет или уменьшается с
течением времени. Тест Уайта – более общий тест, который не
требует знания характера изменения дисперсии. Тест Бройша-Пагана
также является эффективным инструментом для выявления
гетероскедастичности. Statistica 13 предоставляет все эти тесты и
позволяет быстро оценить наличие гетероскедастичности.
Визуальный анализ остатков также помогает выявить
гетероскедастичность. Если на графике остатков видно, что
разброс остатков увеличивается или уменьшается со временем, то
это признак гетероскедастичности. Если тесты показывают наличие
гетероскедастичности, то необходимо использовать специальные методы
для борьбы с ней. Одним из таких методов может быть
преобразование исходных данных.
Верификация и оценка точности модели ARIMA(1,1,1)
Оцениваем, насколько хорошо наша модель прогнозирует реальность.
Разделение данных на обучающую и тестовую выборки
Для верификации и оценки точности модели ARIMA(1,1,1) необходимо
разделить исходные данные на две части: обучающую и тестовую
выборки. Обучающая выборка используется для обучения модели, то
есть для оценки ее параметров. Тестовая выборка используется для
оценки качества прогнозов, которые модель выдает на новых,
неизвестных ей данных.
Обычно обучающую выборку делают большей, например 70-80% от всех
данных, а тестовую выборку 20-30%. Однако, точное соотношение
зависит от конкретной задачи и объема данных. Важно, чтобы тестовая
выборка включала в себя достаточно данных для надежной оценки
точности модели. При разделении данных необходимо убедиться,
чтобы тестовая выборка не пересекалась с обучающей. Обучение
модели и прогнозирование на тестовых данных является
стандартным методом проверки качества модели.
В Statistica 13 разделение данных на обучающую и тестовую выборки
можно выполнить с помощью инструментов для работы с временными
рядами. Разделение данных является важным этапом для
валидации модели и объективной оценки её прогностической силы.
На тестовой выборке мы будем оценивать точность, избегая
переобучения модели на тренировочных данных.
После разделения данных на обучающую и тестовую выборки, необходимо
оценить точность прогнозов, которые выдает модель ARIMA(1,1,1) на
тестовых данных. Для этого используются различные метрики
точности, такие как MAE, RMSE и MAPE.
MAE (Mean Absolute Error) — это средняя абсолютная ошибка, которая
вычисляется как среднее арифметическое абсолютных значений разностей
между фактическими и прогнозируемыми значениями. MAE показывает
среднюю величину ошибки прогноза, без учета ее направления. RMSE
(Root Mean Squared Error) — это среднеквадратичная ошибка,
которая вычисляется как корень квадратный из среднего
арифметического квадратов разностей между фактическими и
прогнозируемыми значениями. RMSE более чувствительна к большим
ошибкам, чем MAE.
MAPE (Mean Absolute Percentage Error) — это средняя абсолютная
процентная ошибка, которая вычисляется как среднее арифметическое
абсолютных процентных разностей между фактическими и
прогнозируемыми значениями. MAPE показывает ошибку в
процентном отношении, что особенно удобно для интерпретации
точности прогноза. Все эти метрики рассчитываются на тестовой
выборке и используются для оценки качества прогноза. Statistica 13
автоматически предоставляет расчет этих метрик после построения
модели.
FAQ
Расчет метрик точности прогноза: MAE, RMSE, MAPE
После разделения данных на обучающую и тестовую выборки, необходимо
оценить точность прогнозов, которые выдает модель ARIMA(1,1,1) на
тестовых данных. Для этого используются различные метрики
точности, такие как MAE, RMSE и MAPE.
MAE (Mean Absolute Error) — это средняя абсолютная ошибка, которая
вычисляется как среднее арифметическое абсолютных значений разностей
между фактическими и прогнозируемыми значениями. MAE показывает
среднюю величину ошибки прогноза, без учета ее направления. RMSE
(Root Mean Squared Error) — это среднеквадратичная ошибка,
которая вычисляется как корень квадратный из среднего
арифметического квадратов разностей между фактическими и
прогнозируемыми значениями. RMSE более чувствительна к большим
ошибкам, чем MAE.
MAPE (Mean Absolute Percentage Error) — это средняя абсолютная
процентная ошибка, которая вычисляется как среднее арифметическое
абсолютных процентных разностей между фактическими и
прогнозируемыми значениями. MAPE показывает ошибку в
процентном отношении, что особенно удобно для интерпретации
точности прогноза. Все эти метрики рассчитываются на тестовой
выборке и используются для оценки качества прогноза. Statistica 13
автоматически предоставляет расчет этих метрик после построения
модели.
