Когда требуется оценить, как новое изменение в интерфейсе повлияло на пользовательский поток, но провести полноценный A/B-тест не получается, продуктовому аналитику приходится искать альтернативные методы. Это часто происходит из-за технических ограничений, низкой базы пользователей, быстрого внедрения изменений или просто из-за невозможности сегментировать аудиторию. В таких случаях мы используем квазиэкспериментальные подходы, которые позволяют с разумной степенью уверенности судить о причинно-следственной связи, хоть и с определёнными оговорками по сравнению с идеальным A/B-тестом. Основные методы включают анализ временных рядов и сравнение «до и после» с учётом внешних факторов.
Почему A/B-тест не всегда возможен или оптимален
A/B-тестирование — это золотой стандарт в продуктовой аналитике для проверки гипотез и измерения влияния изменений. Его главный принцип — случайное разделение пользователей на две группы (контрольную и тестовую), что позволяет быть уверенным в том, что все остальные факторы, кроме тестируемого изменения, распределены равномерно. Таким образом, любое статистически значимое различие в метриках можно отнести именно к изменению. Однако на практике не всегда удаётся его применить.
Существует несколько распространённых причин. Во-первых, технические ограничения. Некоторые изменения затрагивают фундаментальные части архитектуры продукта, что делает сложным или невозможным одновременное поддержание двух версий для разных групп пользователей. Во-вторых, небольшая аудитория. Для получения статистически значимых результатов A/B-тест требует достаточного объёма данных. Если ваш продукт имеет ограниченное число активных пользователей, на сбор нужного количества конверсий могут уйти месяцы, что замедлит развитие продукта. В-третьих, так называемый сетевой эффект. Когда изменение влияет на взаимодействие между пользователями, как, например, в социальных сетях или маркетплейсах, разделить аудиторию на независимые группы очень сложно, так как пользователи из одной группы могут взаимодействовать с пользователями из другой, «загрязняя» результаты.
В-четвёртых, быстрые изменения и критичность фичи. Иногда изменение настолько срочное или критичное для бизнеса (например, исправление серьёзной уязвимости), что нет времени на длительный A/B-тест. В таких случаях изменение выкатывается сразу, и нужно оценить его эффект постфактум. Наконец, эффект новизны. Некоторые изменения, особенно визуальные, могут вызывать временный всплеск активности просто потому, что они новые. Этот эффект искажает результаты A/B-теста, если он проводится слишком короткий период, и требует более сложных подходов для долгосрочной оценки.
«Идеальный A/B-тест — это роскошь, которую не всегда может себе позволить продуктовая команда. Наша задача как аналитиков — найти наиболее надёжный способ оценки влияния, доступный в текущих условиях, даже если он не идеален».
— Кристина Захарова, ведущий продуктовый аналитик
Квазиэкспериментальные методы оценки
Если прямой A/B-тест невозможен, мы прибегаем к квазиэкспериментам. Это такие исследования, где невозможно осуществить рандомизацию испытуемых или полностью контролировать все переменные, но мы всё равно пытаемся максимально приблизиться к условиям контролируемого эксперимента. Главное здесь — тщательный сбор и анализ данных до и после изменения, а также учёт внешних факторов.
Анализ временных рядов: «до и после» с учётом трендов
Анализ временных рядов — один из наиболее распространённых методов для оценки влияния изменения, когда у нас есть достаточно данных о поведении метрики до и после его внедрения. Мы строим график выбранной метрики за длительный период, чтобы понять её естественное поведение: сезонность, общие тренды, аномалии. Затем на этом графике отмечаем момент внедрения изменения и смотрим, как изменилось поведение метрики после этого момента. Для этого метода крайне важны данные за продолжительное время.
Предположим, вы изменили кнопку «Купить» на сайте и хотите понять, как это повлияло на конверсию из просмотра товара в покупку. Вы собираете данные по этой метрике за несколько месяцев до изменения и за несколько недель или месяцев после. Если до изменения конверсия колебалась в пределах 1,5-1,7%, а после стабильно держится на уровне 2,0-2,2% без видимых других причин (таких как акции или сезонность), это сильный аргумент в пользу положительного влияния вашего изменения. Чтобы исключить случайность, необходимо применить статистические методы, например, регрессионный анализ с фиктивной переменной для обозначения периода «после изменения» или использовать более сложные модели ARIMA.
Ловушка интерпретации: легко спутать влияние изменения с влиянием сторонних факторов. Например, если вы выкатили новую кнопку в период предновогодних распродаж, рост конверсии может быть связан не с кнопкой, а с общей покупательской активностью. Чтобы минимизировать такие ошибки, нужно искать так называемые «контрольные метрики» — те, которые не должны быть затронуты изменением, но чувствительны к общим рыночным или сезонным колебаниям. Если контрольная метрика тоже изменилась, это сигнал, что вы, возможно, наблюдаете не эффект кнопки, а влияние внешнего фактора.
Сравнение групп «до» и «после»
Этот метод является упрощённой версией анализа временных рядов, когда мы сравниваем средние значения метрики за определённые периоды до и после изменения. Он менее точен, но легче в реализации. Для этого метода важно выбрать репрезентативные периоды. Например, если вы выпустили обновление в среду, не стоит сравнивать конверсию за всю неделю до обновления с конверсией за всю неделю после. Выходные дни, начало и конец месяца могут сильно влиять на метрики. Лучше брать сопоставимые периоды — например, 14 дней до и 14 дней после, исключая период непосредственно после релиза, когда могут возникать технические проблемы или пользователи ещё не привыкли к изменениям.
Для статистической оценки можно использовать t-тест или U-критерий Манна-Уитни для сравнения средних значений метрики в двух периодах. Это позволит определить, является ли наблюдаемая разница статистически значимой или это лишь случайные колебания. Например, если средняя конверсия до составила 2.1% (стандартное отклонение 0.3%) за 14 дней, а после изменения — 2.5% (стандартное отклонение 0.4%) за аналогичный период, статистический тест покажет, насколько уверенно мы можем говорить о реальном росте.
Минус подхода: он не учитывает тренды. Если ваша метрика в принципе постоянно растёт, то даже без изменений она бы показала рост между двумя периодами. Чтобы компенсировать это, необходимо анализировать динамику метрики за более долгий срок до изменения и экстраполировать её, чтобы увидеть, насколько фактический результат после изменения отклоняется от прогнозируемого тренда.
Синтетический контроль
Метод синтетического контроля — более продвинутый подход, который становится полезен, когда у вас есть несколько схожих объектов (например, регионов, магазинов, сегментов пользователей), и вы можете провести изменение только в одном из них, а остальные использовать как контрольные. Суть метода заключается в создании «синтетической» контрольной группы, которая максимально точно имитирует поведение группы, подвергшейся изменению, до момента внедрения этого изменения.
Допустим, вы внедрили новую систему лояльности в одном городе, а остальные города пока работают по старой схеме. Вы собираете данные по ключевым метрикам (например, средний чек, частота покупок) за несколько месяцев до внедрения в целевом городе и во всех остальных. Затем с помощью статистических методов (например, взвешенной регрессии) вы находите такую комбинацию других городов, чьё объединённое поведение наиболее точно воспроизводит динамику целевого города до момента внедрения. После внедрения, вы сравниваете фактическое поведение целевого города с поведением созданной «синтетической» контрольной группы. Отклонение будет указывать на эффект вашего изменения.
Этот метод требует более сложной статистической обработки и достаточного количества релевантных «контрольных» единиц, но даёт более надёжные результаты, чем простое сравнение «до и после», поскольку он контролирует множество внешних факторов, влияющих на все единицы одновременно.
«Квазиэксперименты не заменят рандомизированные контрольные испытания, но при умелом использовании они становятся мощным инструментом для принятия решений, когда идеальные условия недостижимы».
— Доктор Эмили Картер, исследователь в области эконометрики
Конкретный кейс: Изменение формы оформления заказа
Представим, что продуктовая команда одного онлайн-магазина решила упростить форму оформления заказа, сократив количество полей и изменив их расположение. Провести полноценный A/B-тест оказалось невозможно из-за интеграции с внешней платёжной системой, которая не позволяла легко развернуть две версии формы одновременно. Задача аналитика — оценить влияние этого изменения на конверсию и другие ключевые метрики воронки.
Сбор данных и выбор метрик
В качестве ключевых метрик были выбраны:
- Конверсия из просмотра корзины в успешный заказ (главная метрика)
- Время, затрачиваемое на заполнение формы заказа
- Количество ошибок валидации формы (например, неверный формат телефона)
- Средний чек (контрольная метрика, не должна сильно измениться)
- Трафик на сайт (контрольная метрика).
Данные собирались ежедневно за 60 дней до внедрения изменения и за 30 дней после. Это дало достаточно длинный временной ряд для анализа.
Анализ «до и после» с учётом трендов
Продуктовый аналитик Роман Гаврилов построил графики динамики всех метрик. Для конверсии из корзины в заказ он заметил следующую картину: до изменения средняя конверсия колебалась вокруг 4,2%, демонстрируя лёгкий восходящий тренд (примерно +0,01% в день). После внедрения новой формы, средняя конверсия поднялась до 5,1% и стабилизировалась на этом уровне. Это визуально показало значительный скачок.
Чтобы исключить влияние тренда, Роман использовал линейную регрессию на данных «до», чтобы спрогнозировать ожидаемую конверсию в период «после». Прогноз показал, что без изменения конверсия могла бы достичь примерно 4,5%. Фактические 5,1% оказались статистически значительно выше прогнозного значения, что подтвердило положительный эффект. Статистическая значимость была подтверждена с помощью t-теста, сравнивающего наблюдаемые значения после изменения с предсказанными моделью.
Также было отмечено, что среднее время на заполнение формы сократилось с 90 секунд до 65 секунд, а количество ошибок валидации упало на 15%. Эти метрики подтвердили гипотезу об упрощении формы. Контрольные метрики — средний чек и общий трафик на сайт — не показали существенных изменений или аномалий в тот же период, что позволило исключить влияние крупных внешних факторов, таких как маркетинговые кампании или сезонность.
Выводы по кейсу
На основе проведённого квазиэксперимента, команда сделала вывод, что упрощение формы оформления заказа привело к статистически значимому увеличению конверсии примерно на 0,6 процентных пункта (с 4,5% прогнозных до 5,1% фактических), сокращению времени заполнения и уменьшению количества ошибок. Это изменение было признано успешным и было решено его сохранить.
Важно отметить, что такой анализ всегда сопряжён с допущениями. Например, мы допускаем, что никаких других существенных изменений, влияющих на конверсию, в тот же период не происходило. Именно поэтому крайне важно не только смотреть на одну метрику, но и анализировать контекст, проверять контрольные метрики и искать возможные сторонние факторы, которые могли бы объяснить наблюдаемые изменения.
Что ещё учитывать при квазиэкспериментах
Сезонность и цикличность
Многие продуктовые метрики обладают ярко выраженной сезонностью или цикличностью: дневной, недельной, месячной или годовой. Например, конверсия в B2B-сегменте может падать в выходные, а в B2C — расти перед праздниками. При анализе «до и после» обязательно убедитесь, что вы сравниваете сопоставимые периоды с точки зрения этих циклов. Лучше брать данные за несколько полных циклов до и после изменения, чтобы сгладить случайные колебания и выявить истинный эффект.
Внешние события
Всегда проверяйте календарь внешних событий. Промо-акции конкурентов, запуск крупной рекламной кампании, выход новостей, изменения в законодательстве — всё это может существенно повлиять на поведение пользователей и исказить результаты вашего анализа. Если такое событие совпало по времени с вашим изменением, отделить одно влияние от другого будет крайне сложно, а иногда и невозможно. Отслеживайте внешние события, которые могут влиять на вашу сферу.
Сложность интерпретации и ограничения
Главное ограничение квазиэкспериментов — это невозможность полностью исключить влияние неучтённых переменных. В отличие от A/B-теста, где рандомизация распределяет эти факторы равномерно, здесь всегда есть риск, что наблюдаемый эффект вызван чем-то иным, а не вашим изменением. Поэтому выводы квазиэкспериментов всегда следует формулировать с некоторой осторожностью. Мы можем говорить о «высокой вероятности влияния» или «корреляции, которая имеет сильные основания быть причинной», но не о «доказанном причинно-следственном эффекте» с той же уверенностью, что и в рандомизированном эксперименте.
Практические выводы и рекомендации
- Не отказывайтесь от анализа, если A/B-тест невозможен. Квазиэксперименты — это рабочий инструмент, который даёт ценные инсайты для принятия решений.
- Собирайте данные за достаточно долгий период до изменения, чтобы понять естественную динамику метрик и учесть сезонность.
- Используйте контрольные метрики. Это показатели, на которые ваше изменение не должно влиять, но которые чувствительны к общим рыночным или сезонным факторам. Если они тоже меняются, это сигнал к осторожности.
- Визуализируйте данные. Графики временных рядов могут быстро выявить аномалии, тренды и потенциальные сдвиги после изменения.
- Применяйте статистические методы. Регрессионный анализ, t-тесты или U-критерий Манна-Уитни помогут оценить статистическую значимость наблюдаемых изменений.
- Документируйте все внешние события: маркетинговые акции, изменения у конкурентов, выход новостей. Это поможет объяснить неожиданные колебания метрик.
- Осознавайте ограничения квазиэкспериментов. Всегда признавайте, что существует вероятность влияния неучтённых факторов, и делайте выводы с соответствующей степенью уверенности.
Когда квазиэксперименты становятся необходимостью: глубокий взгляд
Полноценный A/B-тест, безусловно, золотой стандарт для измерения влияния изменений. Он позволяет выделить причинно-следственные связи, изолировав эффект одного изменения от всех остальных факторов. Однако на практике встречаются ситуации, когда запуск A/B-теста либо технически невозможен, либо экономически нецелесообразен, либо этически неприемлем. Как продуктовый аналитик, вы обязаны понимать эти ограничения и владеть альтернативными методами. Нельзя просто развести руками и сказать: «мы не можем измерить». Надо искать способ получить максимально достоверные данные в имеющихся условиях. Мы должны стремиться к принятию решений на основе данных, даже когда идеальных данных нет.
Технические и ресурсные ограничения
Одним из самых распространённых барьеров для A/B-тестирования становится техническая сложность реализации. Например, вносить изменения в ключевые компоненты бэкенда или в критически важные части интерфейса, затрагивающие основы архитектуры, может быть крайне дорого и трудоёмко. Создание параллельных версий для A/B-теста требует значительных инженерных усилий. Если изменение касается фундаментальных пользовательских флоу, например, логики регистрации или авторизации, раскатить его на 50% аудитории и иметь параллельную версию для остальных 50% может быть технически очень сложным или даже рискованным для стабильности системы.
Ещё один аспект — размер выборки. Для статистически значимого A/B-теста иногда требуется очень большая аудитория. Если у вас нишевый продукт или малоактивная часть пользовательской базы, для достижения необходимой мощности теста могут потребоваться недели или даже месяцы. За такой срок внешний контекст может измениться настолько, что результаты теста станут неактуальными. В этих случаях квазиэксперимент позволяет получить более быстрый ответ, хоть и с большей долей допущений.
Ограничения, связанные с пользовательским опытом и этикой
Иногда изменения настолько радикальны или потенциально критичны для пользовательского опыта, что рисковать значительной частью аудитории просто нельзя. Представьте, что вы меняете ключевую логику навигации в сложном профессиональном инструменте. Если A/B-тест выявит серьёзные проблемы в новой версии, это может привести к значительному оттоку или даже срыву рабочих процессов у части ваших клиентов. В таких ситуациях поэтапный раскат или квазиэкспериментальные методы, позволяющие быстро отреагировать на негативные эффекты, могут быть предпочтительнее.
Также существуют этические соображения. Некоторые изменения могут затрагивать чувствительные данные или конфиденциальность. Разделение пользователей на контрольную и тестовую группы в таких сценариях может быть проблематичным с точки зрения соблюдения норм или внутренних политик. В таких случаях мы можем внедрить изменение для всех и затем анализировать его влияние через квазиэксперимент, фокусируясь на защите данных и минимизации рисков для всех пользователей.
Модель «разность в разностях» (Difference-in-Differences, DiD)
Модель «разность в разностях» — это мощный квазиэкспериментальный подход, который помогает оценить влияние изменения, когда у нас нет возможности провести рандомизированный A/B-тест. Суть метода заключается в сравнении изменения метрики в группе, подвергшейся воздействию (тестовая группа), с изменением той же метрики в контрольной группе, которая воздействию не подвергалась. При этом сравниваются не абсолютные значения, а именно *изменения* до и после.
Основное допущение DiD заключается в том, что в отсутствие воздействия тренды изменения метрики в тестовой и контрольной группах были бы параллельными. То есть, если бы изменения не произошло, обе группы развивались бы по одной траектории. Это допущение критически важно и требует тщательной проверки.
Пример применения DiD
Представьте, что мы внедряем новый механизм рекомендаций в интерфейс онлайн-магазина, но только для пользователей из определённого региона, например, «Регион А». Пользователи из «Региона Б» не получают это изменение. Мы хотим измерить влияние нового механизма на средний чек.
- До внедрения (период 1): Средний чек в «Регионе А» был 1000 рублей, в «Регионе Б» — 950 рублей.
- После внедрения (период 2): Средний чек в «Регионе А» стал 1150 рублей, в «Регионе Б» — 1020 рублей.
Рассчитаем изменения:
- Изменение в «Регионе А» (тестовая группа): 1150 - 1000 = +150 рублей.
- Изменение в «Регионе Б» (контрольная группа): 1020 - 950 = +70 рублей.
Эффект нововведения по методу DiD:
Эффект = Изменение в тестовой группе – Изменение в контрольной группе = 150 - 70 = +80 рублей.
Таким образом, мы оцениваем, что новый механизм рекомендаций увеличил средний чек на 80 рублей. Это происходит потому, что мы учли общий тренд роста среднего чека на 70 рублей, который, предположительно, произошёл бы и в «Регионе А» без изменений.
Проверка допущения о параллельных трендах
Ключевая слабость метода DiD — это допущение о параллельных трендах. Если до внедрения изменения метрики в обеих группах росли или падали по-разному, то результат будет смещён. Поэтому крайне важно проанализировать динамику метрики в обеих группах за длительный период *до* внедрения изменения. Визуализация трендов на графиках поможет убедиться, что они действительно развивались схожим образом.
Если тренды не параллельны, необходимо либо искать другую контрольную группу, либо применять более сложные методы, такие как синтетический контроль, который мы уже обсуждали. Однако если вы можете убедительно показать параллельность трендов, DiD даёт надёжную оценку эффекта.
«В условиях невозможности идеального эксперимента, ваша задача — минимизировать искажения, а не игнорировать проблему измерения. Используйте DiD, но всегда сначала доказывайте параллельность трендов, иначе вы рискуете прийти к ложным выводам.»
— Роман Гаврилов, Продуктовый аналитик
Анализ когорт и их динамики в квазиэкспериментах
Когортный анализ — это мощный инструмент для понимания поведения пользователей с течением времени. В контексте квазиэкспериментов он становится незаменимым, позволяя нам отслеживать влияние изменений не только на всю аудиторию, но и на определённые группы пользователей, которые начали взаимодействовать с продуктом в определённый период или получили доступ к новой функциональности.
Основная идея когортного анализа заключается в группировке пользователей по какому-либо общему признаку, чаще всего по времени первого взаимодействия (например, по месяцу регистрации). Затем мы отслеживаем поведение этих групп (когорт) по ключевым метрикам (удержание, конверсия, средний чек) на протяжении определённого времени. Это помогает увидеть, как изменения в продукте влияют на новые когорты пользователей, а как — на уже существующих.
Использование когорт в анализе «до и после»
Когда мы внедряем изменение без A/B-теста, мы можем разделить всех пользователей на две большие когорты: те, кто начал пользоваться продуктом *до* внедрения изменения, и те, кто начал пользоваться *после*. Затем мы сравниваем их поведение. Например, если мы улучшили процесс онбординга, мы ожидаем, что когорты, зарегистрировавшиеся после изменения, будут показывать более высокое удержание или конверсию на первом этапе.
Но важно быть осторожным. Простое сравнение когорт «до» и «после» может быть недостаточно. Возможно, в период «после» изменились и другие факторы: маркетинговые кампании привлекли другую аудиторию, конкуренты выпустили новый продукт, начался сезонный всплеск. Поэтому, комбинируя когортный анализ с анализом временных рядов, мы получаем более полную картину. Мы смотрим на динамику удержания когорт, запущенных до и после изменения, и сравниваем, как их кривые удержания отклоняются от ожидаемого тренда.
Пример когортного анализа для изменения интерфейса
Предположим, 1 июня мы обновили интерфейс главной страницы, сделав блок поиска более заметным. Мы хотим понять, как это повлияло на количество поисковых запросов на пользователя. Мы возьмём когорты пользователей, зарегистрированных в мае (до изменения) и в июне (после изменения).
- Когорта «Майские новички»: Пользователи, зарегистрированные в мае. Отслеживаем среднее количество поисковых запросов в июне и июле.
- Когорта «Июньские новички»: Пользователи, зарегистрированные в июне. Отслеживаем среднее количество поисковых запросов в июне и июле.
Допустим, данные показывают следующее:
- «Майские новички» (в июне): 2.5 запроса/пользователь. «Майские новички» (в июле): 2.3 запроса/пользователь. (Снижение на 0.2, что может быть нормальным паттерном для старых когорт).
- «Июньские новички» (в июне): 3.1 запроса/пользователь. «Июньские новички» (в июле): 2.9 запроса/пользователь.
Если бы мы просто сравнивали среднее количество запросов в июне (после изменения) с маем (до изменения) для всей аудитории, мы могли бы получить смещённый результат. Анализ когорт позволяет нам видеть, что «Июньские новички» с самого начала показывают более высокую активность в поиске (3.1 против 2.5). Это является индикатором того, что новое изменение интерфейса могло положительно повлиять на взаимодействие с поиском для новых пользователей.
Однако для более точного вывода мы должны учесть и другие факторы, такие как сезонность или изменение маркетинговых источников, которые могли повлиять на качество пришедших пользователей. Идеально, если у нас есть похожий продукт или регион, который не затронут изменением, и мы можем провести DiD анализ когорт: сравнить разницу в поведении «до» и «после» в тестовых когортах, и аналогичную разницу в контрольных когортах.
Статистическая значимость в квазиэкспериментах
При работе с квазиэкспериментами вопрос статистической значимости становится ещё более деликатным, чем в A/B-тестах. В A/B-тестах рандомизация гарантирует, что группы изначально сопоставимы по всем факторам, кроме тестируемого изменения. Это позволяет нам применять стандартные статистические тесты (t-тест, хи-квадрат) для оценки вероятности того, что наблюдаемая разница вызвана случайностью.
В квазиэкспериментах мы не можем гарантировать идеальную сопоставимость групп, и именно это делает интерпретацию сложнее. Однако это не означает, что мы должны полностью отказаться от статистических методов. Напротив, мы должны применять их с повышенной осторожностью, понимая их ограничения.
Адаптация стандартных тестов
При анализе «до и после» с учётом трендов, а также при использовании DiD, мы часто работаем с временными рядами или с изменениями средних значений. Для оценки значимости можно использовать регрессионные модели. Например, в DiD-модели мы строим регрессию, где целевая метрика объясняется фиктивными переменными (dummy variables) для группы (тестовая/контрольная), для периода (до/после) и для их взаимодействия. Коэффициент при переменной взаимодействия как раз и показывает оцененный эффект изменения. Его статистическая значимость укажет, с какой уверенностью мы можем утверждать, что эффект не случаен.
Для анализа временных рядов можно использовать авторегрессионные интегрированные скользящие средние (ARIMA) или другие модели, которые учитывают автокорреляцию данных. Введение в такие модели фиктивной переменной, отмечающей начало воздействия, позволяет оценить статистическую значимость «скачка» или изменения тренда после внедрения. Важно убедиться, что остатки модели не коррелированы и не показывают других паттернов, указывающих на неадекватность модели.
Осторожность в интерпретации p-value
В A/B-тестах низкое p-value (например, < 0.05) обычно интерпретируется как сильное свидетельство в пользу того, что наблюдаемая разница не случайна и вызвана изменением. В квазиэкспериментах, даже если статистические тесты показывают «значимость», мы не можем с такой же уверенностью утверждать причинно-следственную связь. Это связано с тем, что, как мы уже говорили, потенциально существуют неучтённые вмешивающиеся факторы, которые могли повлиять на результаты. "Значимость" здесь означает лишь, что *если бы* все допущения были верны, то эффект не случаен.
Поэтому, при интерпретации результатов квазиэкспериментов, статистическая значимость должна быть лишь одним из аргументов, но не единственным. Её нужно рассматривать в совокупности с другими доказательствами: логикой изменения, отсутствием альтернативных объяснений, проверкой параллельности трендов, подтверждением эффекта на разных метриках и когортах. Если вы видите статистически значимый эффект, но при этом тренды в контрольной группе не были параллельны, или были крупные внешние события, которые могли повлиять, ваша уверенность в причинности должна быть снижена.
«Статистическая значимость в квазиэксперименте — это лишь приглашение к дальнейшему расследованию, а не окончательный вердикт. Ваша работа как аналитика — критически относиться к каждому допущению и искать возможные альтернативные объяснения наблюдаемым данным.»
— Роман Гаврилов, Продуктовый аналитик
Комментарии (0)
Без регистрации. Комментарии проверяются автоматически перед публикацией.
Пока нет комментариев. Будьте первым!