Оценка начинается с контрфакта
Новая функция выходит не в стерильную среду: меняются трафик, рассылки, квартал, работа поддержки, часть пользователей получает релиз раньше. Рост активации после запуска без контроля не доказывает эффект: нужно спросить, какой была бы метрика без релиза.
Этот ненаблюдаемый сценарий — контрфакт; его восстанавливают по динамике до запуска, похожим когортам или внешним группам. Квазиэксперимент не заменяет идеальный A/B-тест: он показывает, какую долю изменения удалось отделить от фона и на каких допущениях.
Заранее фиксируют целевую аудиторию, действие полученной ценности, окно эффекта и единицу анализа: для B2B это часто аккаунт, для потребительского сервиса — пользователь, для маркетплейса — заказ или продавец. Ошибка здесь обесценивает и аккуратную статистику.
Наблюдаемое изменение не равно эффекту
Сравнение до/после показывает сдвиг метрики, но не причину. Его формируют релиз, сезонность, состав аудитории, кампании, сбои трекинга и возврат к среднему после необычной недели: наблюдаемое изменение = эффект функции + внешний фон. Дизайн должен оценить фон через доступное сравнение, а не считать его нулевым.
Например, SaaS для интернет-магазинов добавил импорт каталога. Доля аккаунтов, опубликовавших первый товар за семь дней, выросла с 38% до 47%, но партнёрская кампания одновременно привела магазины с готовыми файлами. Нужен не рост после релиза, а добавочный рост относительно сопоставимой аудитории без раннего доступа.
Нужна защита от локальной победы: импорт может повысить активацию, но увеличить ошибки публикации, обращения в поддержку или отмены подписки. Задают одну метрику успеха и ограничители: ошибки, время задачи, возвраты, жалобы, платёжную конверсию. Сдвиг без их ухудшения убедительнее одной линии на дашборде.
Почему аккуратное «до/после» всё равно ломается
Даже длинная история не гарантирует честную оценку. Пользователи могут ждать релиза, продажи — дать доступ наиболее заинтересованным, а аудитория после запуска отличаться не только датой регистрации. Среднее тогда смешивает воздействие и отбор.
Частые ошибки:
- Сезонность и календарь. В рабочих продуктах важны дни недели, в ecommerce — распродажи и праздники.
- Параллельные изменения. Тариф, письмо, онбординг или исправление бага сдвигают ту же метрику.
- Регрессия к среднему. Функцию выпускают после провала, и часть восстановления произошла бы без неё.
- Перетекание воздействия. Ранняя волна обучает коллег, делится шаблоном или экспортирует результат; контроль уже не чистый.
Проверка трендов до запуска снижает риск, но не создаёт причинный факт. Если сегменты расходились до релиза, разность разностей не спасёт; если изменилась логика события, ряд пересчитывают или отказываются от сравнения. Слабые места документируют явно.
Четыре дизайна для релиза без A/B-теста
Метод зависит от того, как функция дошла до пользователей. Материал для оценки часто создаёт менеджер релиза: ограничивает первую волну, сохраняет правила отбора и не меняет одновременно соседние части сценария.
| Дизайн | Когда подходит | Сравнение | Главный риск |
|---|---|---|---|
| Phased rollout | Доступ волнами | Ранние и поздние получатели | Раннюю волну выбрали вручную |
| ITS | Релиз почти всем сразу | Уровень и тренд до/после даты | Одновременное внешнее событие |
| DiD | Есть затронутые и незатронутые | Разница изменений групп | Непараллельные тренды |
| Synthetic control | Нет одного подходящего контроля | Цель и взвешенные доноры | Плохое покрытие истории |
Phased rollout даёт практичный контрфакт: функцию сначала получают менее рискованные регионы, тарифы или аккаунты, а поздняя волна служит сравнением до своего запуска. Нужны заранее заданная очередь, одинаковое окно наблюдения и контроль утечек через общие рабочие пространства.
Анализ прерванных временных рядов (ITS) применяют, когда релиз нельзя задержать. Метрику строят равными интервалами, например неделями, и оценивают скачок в дату запуска и новый наклон: один коэффициент отражает немедленный сдвиг, другой — ускорение или замедление тренда. Метод слаб, если одновременно пришла кампания или сменился состав новых пользователей.
Разность разностей (DiD) сравнивает изменение у получивших доступ с изменением у сравнения. Одинаковые стартовые уровни не нужны, но нужна похожая дорелизная динамика, проверяемая графиком нескольких периодов, а не фразой в презентации.
Matched cohorts применяют при неслучайной выдаче: каждому получателю подбирают неполучателя по тарифу, размеру компании, давности регистрации, прежней активности и каналу привлечения. Это уменьшает отбор, но не убирает скрытые причины — например, готовность внедрять новинку или качество менеджера клиента.
Synthetic control строит искусственный контроль из рынков, сегментов или продуктовых линий, подбирая веса для близкой дорелизной линии; последующее расхождение трактуют как возможный эффект. Нужна длинная устойчивая история: для десятка аккаунтов метод чаще создаёт видимость строгости, чем знание.
Разность разностей на рабочем примере
В гипотетическом сервисе управления проектами функция согласования задач в марте стала доступна 40 аккаунтам первой волны, ещё 40 схожих из очереди — через месяц. Метрика — доля аккаунтов, где задача за неделю прошла полный цикл согласования. До релиза это 52,5% и 51%, после — 63% и 54%.
DiD: (63% − 52,5%) − (54% − 51%) = 7,5 п.п.. При допущении параллельных трендов функция связана с добавочным ростом недельного завершения согласования на 7,5 процентного пункта; это не обещает сохранения эффекта после открытия всем.
До публикации проверяют восемь предрелизных недель: не расходились ли линии, не было ли у первой волны необычной активности, не менялась ли логика события «согласование завершено». Затем проводят чувствительный анализ: исключают крупнейших клиентов, берут окна две и четыре недели, меняют подбор когорт. Если знак эффекта исчезает от одного разумного решения, он не аргумент для масштабного инвестирования.
Для ITS поиск запускают всем в один день и строят еженедельную долю успешно найденных документов за несколько месяцев до и после. Модель отделяет базовый тренд от скачка в неделю релиза и нового наклона. Если одновременно был редизайн навигации, нельзя приписать изменения одному поиску: честнее указать «совокупный эффект пакета изменений».
Метрика должна пережить проверку контекстом
Оценка держится на заранее описанных правилах, а метрика — на ценности функции: для редактора документов это завершённая совместная правка, не открытия панели комментариев; для платежного сервиса — успешная оплата, не просмотр формы.
| Элемент доказательства | Что зафиксировать |
|---|---|
| Популяция | Включения и исключения: боты, тестовые аккаунты, сотрудники |
| Экспозиция | Как и с какой даты получена функция |
| Метрика | Формулу, знаменатель, период, источник события |
| Контрфакт | Контроль, временной тренд или синтетическую линию |
| Ограничители | Качество, ошибки, скорость, обращения, финансовые потери |
Одинаково названная метрика может считать разное: «активный аккаунт» без критического действия — пустая прокси. Проверяют и задержку эффекта: обучение может занять две недели, а окно в три дня ложно объявит функцию провалом. Окно нельзя растягивать после результата, иначе период подбирают под желаемую картину.
С ростом продукта меняется единица воздействия
На малом продукте можно отследить каждого получателя; с ростом появляются общие домены, пространства, интеграции и заражение сегментов. Если сотрудник раннего доступа создаёт шаблон для компании, пользователь не независимая единица: анализируют аккаунт или рабочее пространство.
Географические волны контролируют доступ, но регионы различаются спросом и локальными кампаниями; волны по тарифам удобны, но тариф связан с размером клиента и зрелостью процессов. Для каждого правила распределения называют риск смещения и показывают признаки, по которым группы сравнили до запуска.
Synthetic control полезнее при нескольких сопоставимых рынках или продуктовых единицах с общей историей. Но веса, исключения и дату вмешательства нельзя менять после желаемого эффекта. Версию расчёта, доноров и код графика хранят с релизным решением, иначе позже не восстановить, почему линия стала контролем.
Доказательство, которое выдерживает спор
Для полного запуска недостаточно слайда «метрика выросла». Нужен артефакт со схемой и датами волн, целевой аудиторией, графиком до/после, методом контрфакта, расчётом эффекта, ограничителями и допущениями, чтобы руководитель, аналитик и инженер одинаково понимали границы знания.
Для DiD добавляют предшествующие тренды и правила matched cohorts; для ITS — все параллельные продуктовые и маркетинговые изменения; для synthetic control — донорский пул и качество дорелизного совпадения линии. Неопределённость — свойство данных, не дефект отчёта.
Зрелая команда не ждёт невозможного идеального эксперимента: она проектирует релиз с возможностью причинной оценки, отделяет факт изменения от гипотезы о причине и не масштабирует функцию только потому, что график пошёл вверх.