Медиа

RL-агент, альтернативные данные и одна общая ловушка

Есть две темы, которые заслуживают отдельного разговора: reinforcement learning и альтернативные данные.

В RL — агент, который сам найдёт стратегию. В альтданных — датасет, который даст преимущество. И в обоих случаях — одна и та же ловушка.

Обучение с подкреплением (Reinforcement Learning / RL) — это метод машинного обучения, при котором торговый робот (агент) самостоятельно учится принимать оптимальные решения, совершая сделки на рынке и получая награду за прибыль или штраф за убытки. Этот подход нужен для создания полностью автономных адаптивных систем, которые способны на ходу подстраиваться под меняющиеся рыночные режимы без жестко заданных правил и жестких математических формул.

RL: агент учится обманывать бэктест, а не торговать

Самое точное объяснение механики провала дал «Мистер Z» - частный управляющий алгофондом на медленных стратегиях:
«Обычно агента учат не торговать рынок, а эксплуатировать дырки в бэктесте».
Это не метафора, а буквальное описание того, что происходит технически. Reward-функция — это упрощённая модель того, что вы хотите получить. Агент не понимает рынок, не понимает риск, не понимает деньги. Он понимает только одно: как максимизировать число, которое вы ему дали в качестве награды. Если в симуляции есть малейшая лазейка — нереалистичное исполнение, отсутствие проскальзывания, неучтённая комиссия — агент найдёт её быстрее, чем любой человек.

Дальше он же указывает, где RL всё-таки может работать:
«RL имеет смысл там, где хорошо описана механика исполнения и награда учитывает риски. Например, узкие RL-модули: оптимизация исполнения, нарезка ордера, выбор aggressiveness. Там задача ограничена, среду можно валидировать».
Разница между «агент торгует рынок» и «агент решает одну маленькую инженерную задачу» — принципиальная. Чем шире задача, тем сложнее описать reward без дыр. И тем увереннее агент найдёт способ обмануть именно вас, а не рынок.

Тихон Павлов, quantitative researcher ФК «Викинг», называет это «красивым тупиком»:
«RL сейчас пользуется модой в некоторых фондах. На мой взгляд, это красивый тупик. Реализация в 99,9% случаев очень спорная. Проблема в том, что рынок сегодня не похож на рынок завтра. Мы учим модель на прошлом, но правила игры постоянно меняются».

От «Биржевого Алгоритма»: Не видели команды, которые тратили месяцы на RL-проекты. И ни один не дошёл до продакшена. Кроме тех, кто использовал RL для узких задач: нарезка ордера, управление исполнением. Там — да. Всё, что шире — нет.
Ближайшее мероприятие
9 октября 2026 года в Москве пройдёт конференция «Биржевой Алгоритм — 2026».
  • 2 зала
  • 40 спикеров
  • дегустация вин
Только экспертиза, кейсы и живые диалоги
Подробности и регистрация: algoclub.pro/mainevent
Критерий Колмогорова-Смирнова (KS-test) — тест на стационарность распределения

Что это и зачем нужна:

Фундаментальный статистический тест, который проверяет, совпадает ли эмпирическое распределение данных с теоретическим (или совпадают ли два эмпирических распределения между собой). В контексте статьи это главный инструмент проверки того, действительно ли dollar bars и volume bars дают более стационарные данные, чем обычные временные свечи.

Расшифровка переменных:

D_n — статистика Колмогорова-Смирнова (максимальное отклонение).

sup_x — супремум (наибольшее значение) по всем точкам .

F_n(x) — эмпирическая функция распределения (то, что вы наблюдаете в реальных данных).

F(x) — теоретическая функция распределения (то, что вы ожидаете увидеть, например, нормальное распределение или распределение предыдущего периода).

Смысл:

Эта формула — математический фундамент блока про dollar bars и volume bars. Когда «Мистер Y» говорит, что «они показывают большую стационарность, чем обычные свечи», он имеет в виду именно это: если вы посчитаете для временных свечей и для dollar bars, для dollar bars значение будет значительно ниже. Это значит, что распределение доходностей на dollar bars стабильнее во времени — оно меньше «плывёт» от периода к периоду. Формула доказывает: dollar bars — это не просто «другой способ нарезать данные», а способ сделать данные статистически пригодными для машинного обучения. Если распределение нестационарно, любая ML-модель, обученная на истории, обречена на провал в продакшене.

Альтернативные данные: в России их почти нет

Разговоры про альтернативные данные обычно звучат так, будто где-то есть волшебный источник информации: спутниковые снимки парковок, данные кредитных карт, геолокация курьеров. В России эта картинка не работает почти полностью.

Тихон Павлов честно признаёт границу:
«В России вообще альтернативных данных очень мало. Мы находимся в другой ситуации, не как за рубежом. Что нам можно анализировать? Можно пытаться анализировать маркетплейсы — туда никто не смотрит из наших команд. Это прокси-индикатор потребительского спроса. Он неплохо опережает официальную статистику Росстата и коррелирует с выручкой ритейлеров. Если мы торгуем Озоном, можно до выхода отчётности делать выводы».
Но это скорее для инвестиционного горизонта, а не для спекулятивных стратегий. Не для HFT, не для быстрых решений.

Dollar bars и volume bars — единственное, что реально работает

«Мистер Y» отвечает на вопрос про альтернативные данные не рассказом об экзотическом источнике, а книгой, которая изменила его понимание самого термина «данные»:
«Книга Лопеса де Прадо — мне понравились долларовые бары, объёмные бары. Когда ты сам их делаешь, они показывают большую стационарность, чем обычные свечи».
Это принципиально другой взгляд на понятие «альтернативные данные». Dollar bars и volume bars — это не внешний источник, а способ иначе нарезать уже существующие данные о сделках: не по времени (минута, час, день), а по накопленному объёму торгов или долларовому обороту.

Свеча, построенная по времени, в спокойный час содержит мало информации и много шума, а в активный — сжимает огромное количество событий в один и тот же временной интервал. Бар, построенный по объёму или обороту, автоматически подстраивается под интенсивность торгов — и поэтому оказывается более стационарным статистически.
От «Биржевого Алгоритма»: мы сами проверяли маркетплейсы как источник. Да, там есть сигнал. Но он не для HFT. Он для тех, кто готов ждать недели. Единственное, что реально работает в России без покупки дорогих датасетов, — dollar bars. Не внешний источник, а способ иначе нарезать тиковые данные, которые у вас уже есть.
Спутниковые снимки, Telegram, sentiment — что из этого шум

Тихон продолжает:
«У нас в России доступ к коммерческим спутниковым снимкам в нужном разрешении в реальном времени очень сильно ограничен. Поэтому обработка спутниковых снимков — спорная идея».

Про sentiment анализ он говорит отдельно:

«Sentiment анализ новостного фона в Telegram — слышу из каждого утюга. Но влияет не сам тон сообщений, а всплеск сообщений. Он свидетельствует о волатильности, а не создаёт её».
Закон Ципфа (Zipf's Law) — анализ распределения объёмов и рангов в рыночных данных

Что это и зачем нужна:

Эмпирический закон, описывающий степенное распределение частоты событий в зависимости от их ранга. В контексте альтернативных данных и микроструктуры рынка он объясняет, почему большинство «сигналов» из альтернативных источников — это шум, и как правильно ранжировать данные по значимости.

Расшифровка переменных:

P(r) — частота (или объём) события с рангом .

C — константа нормировки.

r — ранг события (1 — самое частое/крупное, 2 — второе, и т.д.).

α (альфа) — показатель степени (обычно близок к 1 в рыночных данных).

Смысл:

Эта формула объясняет, почему в альтернативных данных (Telegram-каналы, новости, sentiment) работает не тон сообщений, а всплеск активности, о чём говорит Тихон. Закон Ципфа показывает: в любом потоке данных несколько топ-источников генерируют львиную долю значимой информации, а длинный хвост рангов — это чистый шум. Если вы пытаетесь анализировать все Telegram-каналы одинаково, вы тонете в шуме. Если вы ранжируете их по закону Ципфа и работаете только с топ-рангами — вы получаете реальный сигнал. То же самое работает для объёмов торгов в dollar bars: несколько крупных сделок определяют форму распределения, а тысячи мелких — это статистический фон. Формула доказывает: в альтернативных данных ценность не в количестве источников, а в правильном ранжировании.

Ближайшее мероприятие
9 октября 2026 года в Москве пройдёт конференция «Биржевой Алгоритм — 2026».
  • 2 зала
  • 40 спикеров
  • дегустация вин
Только экспертиза, кейсы и живые диалоги
Подробности и регистрация: algoclub.pro/mainevent

Что из этого реально годится в работу

Если собрать все мнения вместе, получается отрезвляющая картина:

Dollar bars и volume bars — не поиск нового источника, а более качественная предобработка того, что у вас уже есть. Это единственный совет, который применим независимо от рынка и класса активов.

Маркетплейсы как прокси потребительского спроса — конкретная, проверяемая гипотеза. Но требующая самостоятельного сбора данных и подходящая скорее для среднесрочных инвестиционных решений, чем для быстрой торговли.

Всё остальное — либо шум, либо гипотеза, которую нужно проверять годами. Спутниковые снимки в России не работают. Sentiment — только через всплески, а не через тон. И готовых датасетов, которые можно купить и сразу использовать, просто нет.

Быстрый взгляд: как изменилось отношение к RL и альтернативным данным за 10 лет
Параметр
2015–2020 год
2025 год
Отношение к RL
хайп, «агент сам найдёт стратегию»
признают «красивым тупиком» для широких задач
Где RL реально работает
верили, что везде
только в узких задачах (execution, нарезка ордера)
Альтернативные данные в России
мечтали о спутниках и сентименте
почти ничего нет, кроме маркетплейсов
Dollar bars / Volume bars
почти не использовали
единственное, что реально работает
Sentiment-анализ
считали прорывом
понимают: работает не тон, а всплеск активности
Спутниковые снимки
обсуждали как перспективу
в России недоступны в нужном разрешении
Главная ловушка
искали волшебный датасет
агент учится обманывать бэктест, а не торговать
Правила входа: как не попасть в ловушку RL и альтернативных данных

1. Помните: RL-агент учится обманывать бэктест, а не торговать. Reward-функция — это упрощённая модель того, что вы хотите получить. Агент не понимает рынок, не понимает риск, не понимает деньги. Он понимает только одно: как максимизировать число, которое вы ему дали. Если в симуляции есть малейшая лазейка — нереалистичное исполнение, отсутствие проскальзывания, неучтённая комиссия — агент найдёт её быстрее, чем любой человек.

2. Используйте RL только для узких задач. Широкие задачи («пусть агент сам найдёт стратегию») — обречены. Узкие задачи: нарезка крупного ордера, выбор агрессивности исполнения, управление очередью. Там задача ограничена, среду можно валидировать, reward можно описать без дыр. Всё, что шире — не работает.

3. Не ищите волшебных альтернативных данных в России — их почти нет. Спутниковые снимки недоступны в нужном разрешении. Sentiment-анализ Telegram — работает только через всплески активности, а не через тон сообщений. Готовых датасетов, которые можно купить и сразу использовать, просто нет. Придётся строить самим.

4. Используйте dollar bars и volume bars — это единственное, что реально работает. Не внешний источник, а способ иначе нарезать уже существующие данные: не по времени (минута, час), а по накопленному объёму торгов или долларовому обороту. Это даёт более стационарное распределение, чем обычные свечи, и не требует покупки дорогих датасетов.

5. Проверяйте стационарность данных через критерий Колмогорова-Смирнова. Если распределение доходностей на ваших данных «плывёт» от периода к периоду — любая ML-модель обречена на провал. Dollar bars дают более стабильное распределение — и это можно проверить численно, а не верить на слово.

Часто задаваемые вопросы

1. Почему Reinforcement Learning не работает в широких задачах?

Потому что RL-агент не понимает рынок, он понимает только reward-функцию. Если в симуляции есть лазейка (нереалистичное исполнение, отсутствие проскальзывания, неучтённая комиссия), агент найдёт её и начнёт «зарабатывать», обманывая бэктест, а не торгуя рынок. Это не «агент учится торговать», это «агент учится обманывать вашу симуляцию».

2. Где RL всё-таки может работать в трейдинге?

В узких инженерных задачах: нарезка крупного ордера на части, выбор агрессивности исполнения, управление очередью заявок. Там среда ограничена, reward можно описать без дыр, а результат можно валидировать на реальных данных. Всё, что шире («пусть агент сам найдёт стратегию») — не работает.

3. Что такое dollar bars и почему они лучше обычных свечей?

Это способ нарезать тиковые данные не по времени (минута, час), а по накопленному долларовому обороту. В спокойный час обычная свеча содержит мало информации и много шума. В активный — сжимает огромное количество событий в один интервал. Dollar bars автоматически подстраиваются под интенсивность торгов и дают более стационарное распределение, что критически важно для ML-моделей.

4. Работают ли альтернативные данные в России?

Почти нет. Спутниковые снимки в нужном разрешении недоступны. Sentiment-анализ Telegram — только через всплески активности, а не через тон. Готовых датасетов нет. Единственное, что реально работает, — маркетплейсы как прокси-индикатор потребительского спроса, но это для среднесрочных инвестиционных решений, а не для HFT.

5. Что такое критерий Колмогорова-Смирнова и зачем он нужен в трейдинге?

Это статистический тест, который проверяет, совпадает ли распределение данных с эталонным или с распределением другого периода. В трейдинге он используется для проверки стационарности данных. Если распределение «плывёт» от периода к периоду — любая ML-модель, обученная на истории, обречена на провал в продакшене. Dollar bars дают более стабильное распределение — это можно проверить численно.

6. Почему сентимент-анализ Telegram переоценён?

Потому что влияет не тон сообщений, а всплеск активности. Всплеск сообщений свидетельствует о волатильности, а не создаёт её. Анализировать тон тысяч сообщений — значит тонуть в шуме. Работает только ранжирование источников по закону Ципфа и отслеживание аномальных всплесков объёма.

7. Стоит ли тратить время на альтернативные данные в России?

Да, но только на то, что реально доступно: маркетплейсы (прокси потребительского спроса) и dollar bars (способ предобработки тиковых данных). Всё остальное — либо шум, либо гипотеза, которую нужно проверять годами. Готовых решений нет, придётся строить самим.

TOTAL

Альтернативные данные в России — это не про поиск экзотического источника, который никто ещё не нашёл. Это про то, чтобы честно признать дефицит готовой инфраструктуры и либо переработать то, что уже есть (dollar bars), либо самостоятельно построить прокси-индикатор там, где официальная статистика опаздывает (маркетплейсы).

Всё остальное — либо шум, либо гипотеза, которую нужно проверять годами. Спутниковые снимки в России не работают. Sentiment — только через всплески. Готовых датасетов нет. И даже RL, с которого мы начали, — это та же история: поиск волшебной таблетки вместо работы с тем, что уже есть.

Ближайшее мероприятие 9 октября 2026 года. Конференция "Биржевой алгоритм - 2026". Прикладные знания и авторитетные мнения. Мы соберем экспертов в управлении активами и алгоритмическом трейдинге. Подробности на странице мероприятия (http://algoclub.pro/mainevent)

Статья создана «Биржевым Алгоритмом». Копирование без ссылки на источник — нарушение авторских прав. Мы это отслеживаем и преследуем. Даже если вы думаете, что никто не заметит.