Отличить рабочую закономерность от случайности — центральный навык количественного трейдинга и, возможно, самый недооценённый. Проблема фундаментальна: в достаточно больших данных можно «найти» практически любой паттерн, даже если он чистая случайность. Человеческий мозг эволюционно ищет закономерности и находит их даже в шуме; компьютерный перебор гипотез усугубляет это, выдавая красивые, но мнимые связи. Трейдер, не умеющий отличать реальное от случайного, обречён торговать шум и терять деньги. Пройдёмся по тому, почему в данных так легко найти мнимую закономерность, какие признаки отличают рабочую закономерность от случайной и почему наличие причины часто важнее красоты статистики.
Фундаментальная проблема — в больших данных случайность неизбежно порождает паттерны. Если перебрать достаточно много гипотез, некоторые покажут «преимущество» чисто случайно, без всякой реальной причины. Классическая аналогия: если подбросить тысячу монет много раз, у некоторых случайно выпадет длинная серия орлов — но это не значит, что монета «умеет» выпадать орлом. Так и в рыночных данных: перебор множества условий, параметров, паттернов гарантированно выдаст несколько красивых закономерностей, которые на самом деле случайны. Усугубляет это склонность мозга видеть закономерности даже в шуме (мы эволюционно настроены находить паттерны). В результате и человек, и компьютерный перебор легко «находят» мнимые закономерности. Это не редкость, а норма: большинство ярких паттернов, найденных перебором данных, — случайность. Понимание этого — первый шаг к дисциплине: относиться к любой найденной закономерности как к подозреваемой в случайности, пока не доказано обратное.
Ключевые наблюдения
- В больших данных можно «найти» практически любой паттерн, даже если он чистая случайность.
- Главные признаки рабочей закономерности — устойчивость, работа на новых данных и наличие понятной причины.
- Случайные корреляции без причины и красивые паттерны из перебора данных (data mining) не работают в будущем.
- Наличие механизма, объясняющего, почему закономерность должна существовать, часто важнее красоты статистики.
В данных всегда найдётся закономерность — вопрос лишь в том, реальна она или вы её выдумали. Настоящую от случайной отличает не красота на графике, а три вещи: она устойчива, работает на данных, которых не видела, и у неё есть причина. Без них любой паттерн — просто удачно оформленный шум.
— Noob_X
Признак 1: устойчивость
Первый признак рабочей закономерности — устойчивость. Реальная закономерность не должна критически зависеть от точных параметров или конкретного участка данных. Практическая проверка: слегка измените параметры (порог, период) — если закономерность сохраняется при близких значениях, образуя «плато», она устойчива; если исчезает при малейшем изменении, это, скорее всего, переоптимизация под случайность. Аналогично, реальная закономерность работает на разных участках истории, а не только на одном удачном отрезке. Случайно найденный паттерн, напротив, обычно хрупок: он идеален на конкретных данных и параметрах, под которые подобран, и разваливается при малейшем отклонении. Устойчивость — это признак того, что закономерность улавливает что-то реальное, а не подгоняется под шум конкретного участка. Хрупкость, наоборот, выдаёт случайность. Поэтому проверка на устойчивость к изменению параметров и участков данных — базовый фильтр против мнимых закономерностей.
Признак 2: работа на новых данных
Второй и решающий признак — закономерность работает на данных, которые не участвовали в её поиске. Это самый честный тест: случайная закономерность, найденная подгонкой под конкретные данные, почти наверняка развалится на новых, невиданных данных, тогда как реальная — сохранится (пусть и с некоторым ухудшением). Практически это проверка out-of-sample и walk-forward: настраивать на одной части истории, проверять на другой, отложенной. Если закономерность хороша на данных настройки и рушится на проверочных — это случайность или подгонка. Важная тонкость: если перебирать много закономерностей через одну и ту же проверочную выборку и брать лучшую, вы снова начинаете подгонять — уже под out-of-sample. Поэтому финальным барьером остаётся форвард-тест на действительно новых данных вперёд. Работа на невиданных данных — это то, что отделяет закономерность, улавливающую реальность, от красиво оформленного совпадения. Именно поэтому проверка на новых данных незаменима.
Признак 3: наличие причины
Третий признак, часто недооцениваемый, — наличие понятной причины, механизма, объясняющего, почему закономерность должна существовать. Реальные рыночные закономерности обычно имеют объяснение: поведенческую ошибку участников, структурную особенность рынка, институциональные потоки. Закономерность с причиной надёжнее, потому что причина объясняет, почему она работала и, возможно, продолжит работать. Случайная же корреляция без причины (классический пример — нелепые совпадения вроде «рынок растёт, когда происходит некое не связанное с ним событие») не имеет оснований работать в будущем. Наличие причины — мощный фильтр, а часто и более важный, чем красота статистики: закономерность со скромной, но объяснимой статистикой надёжнее эффектной, но необъяснимой. Вопрос «почему это должно работать?» — один из главных, который квант задаёт своей находке. Если внятного ответа нет, а есть лишь «так получилось на данных», — это серьёзный повод подозревать случайность, как бы красиво ни выглядела статистика.
Ошибки, которые дорого стоят
Первая — принимать любую найденную в данных закономерность за реальную. Вторая — не проверять устойчивость к изменению параметров и участков данных. Третья — не проверять работу на новых, не участвовавших в поиске данных. Четвёртая — торговать закономерность без понятной причины. Пятая — перебирать много гипотез и брать лучшую без поправки на случайность (data mining).
Читайте также
Частые вопросы
Почему в данных легко найти мнимую закономерность?
Потому что случайность в больших данных неизбежно порождает паттерны: перебор множества гипотез гарантированно выдаст несколько красивых, но случайных. Плюс мозг склонен видеть закономерности в шуме.
Как отличить реальную закономерность от случайной?
По трём признакам: устойчивость (сохраняется при изменении параметров и участков), работа на новых данных (out-of-sample, форвард) и наличие причины (механизм, объясняющий, почему она должна существовать).
Что важнее — красивая статистика или причина?
Часто причина. Закономерность со скромной, но объяснимой статистикой надёжнее эффектной, но необъяснимой. Вопрос «почему это должно работать?» — ключевой фильтр против случайных корреляций.
Что запомнить
- В больших данных можно найти практически любой паттерн, даже если он случайность.
- Рабочую закономерность отличают устойчивость, работа на новых данных и наличие причины.
- Случайные корреляции без причины и красивые паттерны из перебора данных не работают в будущем.
- Наличие механизма, объясняющего закономерность, часто важнее красоты её статистики.
