Как читать данные исследований и не построить медиаплан на чужой ошибке
Цифра из исследования обладает свойством, которое делает её опасной: она выглядит как факт. В презентации она набрана крупно, рядом стоит логотип исследовательской компании, и обсуждать её как будто неприлично – данные же. В результате цифра проходит через бриф, стратегию и медиаплан, ни разу не будучи проверенной.
Между тем ошибка почти никогда не бывает в самих данных. Исследовательские компании считают аккуратно. Ошибка появляется на этапе пересказа: когда из таблицы делают вывод, из вывода – слайд, а из слайда – решение по бюджету.
Ниже – семь правил чтения, каждое разобрано на живом примере. Примеры не выдуманы: это реальная выгрузка MMI 2025 и сводка, которая приехала вместе с ней. Ошибки в сводке типичные, и в этом её ценность как учебного материала.
Коротко: перед тем как использовать цифру, проверьте семь вещей – какая база, какая выборка, из какого вопроса взят ответ, не сложены ли ответы на разные вопросы, мультивыбор это или единственный выбор, процент это или абсолют, и что означает вариант «никогда». Каждый пункт занимает минуту и снимает большую часть ошибок.
Почему ошибка в чтении данных дороже ошибки в расчёте
Коротко: арифметическую ошибку в медиаплане ловят на согласовании. Неправильно прочитанную цифру не ловит никто, потому что она выглядит как проверенный факт и попадает в основание всей стратегии.
Ошибка в расчёте бюджета видна: суммы не сходятся, кто-нибудь пересчитает. Ошибка в чтении данных ведёт себя иначе. Она не противоречит ничему внутри документа, её невозможно заметить при вычитке, и живёт она долго – переходит из презентации в презентацию и постепенно превращается в «общеизвестный факт рынка».
Цена такой ошибки – не косметическая. Из неверно прочитанной цифры вырастает выбор аудитории, выбор каналов и распределение бюджета. Кампания при этом может быть выполнена безупречно и всё равно не дать результата, потому что целилась не туда.
И ещё одно: такие ошибки обычно не злонамеренны. Они возникают при сжатии – когда таблицу на сорок строк нужно превратить в три пункта выводов. Именно на этом шаге теряются базы, сноски и формулировки вопросов.
Правило 1. Первым делом – база: кого именно посчитали
Коротко: один и тот же отчёт часто содержит блоки с разными базами. В разобранной выгрузке брендовый блок посчитан по Алматы (около 469 тыс. человек), а остальные – по всей стране (1 985 тыс.). Смешивать их в одном выводе нельзя.
Самая частая ошибка и самая незаметная. В выгрузке MMI 2025, с которой мы работали, соседние блоки таблицы имели разные базы:
- блок знания, потребления и лояльности брендов – срез по Алматы, база около 469 тыс. человек;
- блоки предпочтений, частоты покупки, критериев выбора и места покупки – национальный срез, база 1 985,5 тыс. человек.
Разница в четыре с лишним раза. Алматы – это 23,6% национальной базы среза, то есть меньше четверти.
В сводке, приехавшей вместе с файлом, эти блоки были соединены в одну фразу: «В Алматы и по всему Казахстану доминирует Piala Gold (41,5% лояльности)». Показатель 41,5% относится только к Алматы. Про «весь Казахстан» в этой строке данных нет вообще.
Как проверять. В любой профессиональной выгрузке база подписана: в шапке блока или в отдельной строке. Если подписи нет, база вычисляется из самих данных – разделите абсолютное значение на процент. В нашем случае: 376 тыс. / 80,1% = 469 тыс., и это сразу показывает, что перед вами не национальная цифра.
Одна минута деления защищает от вывода, который потом ляжет в основание географии кампании.
Правило 2. Какую разницу можно считать разницей?
Коротко: у любой цифры из опроса есть погрешность. При выборке 821 человек она около ±3,4 процентного пункта, при подвыборке в 210 человек – около ±6,8. Разница в 0,4 пункта между двумя показателями – это не разница, а шум.
Выборка разобранного среза – 821 респондент. Для долей около 50% это даёт статистическую погрешность порядка ±3,4 процентного пункта при 95% доверительной вероятности. Для подвыборки по одному городу – около 200–220 человек – погрешность вырастает примерно до ±6,8 пункта.
Что из этого следует практически:
- разница между 26,1% и 25,7% (доверие к мега-блогерам против средних) – статистически неразличима, это одно и то же значение;
- разница между 41,5% и 11,6% (лояльность двух брендов) – реальна и содержательна;
- любой вывод, построенный на разнице в один-два пункта, скорее всего описывает шум.
Две оговорки, о которых полезно помнить. Погрешность зависит от величины доли: у показателей около 5% или 95% она меньше, чем у показателей около 50%. И взвешивание данных обычно увеличивает фактическую погрешность по сравнению с формулой для простой случайной выборки – то есть приведённые значения скорее оптимистичны.
Практическое правило для работы: относиться серьёзно к разрывам в 10 пунктов и больше, к разрывам в 3–10 пунктов – с осторожностью, а разницу меньше 3 пунктов не интерпретировать вовсе.
Если нужна вторая пара глаз на данных, которые лягут в основу кампании, – обсудите задачу с Media Insider. Проверка баз и формулировок вопросов входит в нашу обычную работу с исследованиями до того, как из них собирается медиаплан.
Правило 3. Не складывайте ответы на разные вопросы
Коротко: «60% выбирают чёрный гранулированный чай» – так выглядела строка в сводке. В данных 59,9% относятся к вопросу о типе чая, а гранулированный – это 41,3% из другого вопроса, про вид. Два разных вопроса склеились в один вывод.
Разберём эту ошибку подробно, потому что она показательна.
В исследовании были два отдельных вопроса.
Вопрос о типе чая:
- чай чёрный без добавок – 59,9%;
- не имеет значения – 18,7%;
- чай чёрный с добавками – 12,5%;
- зелёный без добавок – 3,7%;
- зелёный с добавками – 3,2%;
- остальное – около 2%.
Вопрос о виде чая:
- гранулированный (СТС) – 41,3%;
- не имеет значения – 28,3%;
- пакетированный – 12,2%;
- листовой – 6,2%.
В сводке из первого вопроса взято 59,9% («чёрный»), из второго – слово «гранулированный», и получилось утверждение, которого нет ни в одной строке: «60% выбирают чёрный гранулированный». Реальная доля тех, кто предпочитает именно гранулированный, – 41,3%, и это на 18,6 пункта меньше.
Разница не академическая. На цифре 60% строится вывод «категория гранулированная, форматная борьба закончена». На цифре 41,3% при 28,3% ответивших «не имеет значения» вывод обратный: форма выпуска для трети покупателей не решающая, и это открытое поле для пакетированного и листового формата.
Как проверять. Всегда возвращайтесь от вывода к строке таблицы: у каждой цифры в выводе должна быть одна конкретная строка-источник. Если под утверждение нельзя показать одну строку – утверждение сконструировано, а не измерено.
Правило 4. Почему один предмет в двух вопросах даёт разные цифры?
Коротко: в той же выгрузке соцсети встречаются дважды – 40,5% в списке способов проводить свободное время и 80,2% в вопросе о частоте посещения. Обе цифры верные, потому что это ответы на разные вопросы. Для медиаплана нужна вторая.
Ситуация выглядит как противоречие в данных, но противоречия нет.
В блоке «проведение свободного времени» респондент отмечает занятия, которыми заполняет досуг. Соцсети отмечают 40,5%: остальные заходят туда постоянно, но не считают это досугом – так же, как никто не считает досугом проверку почты.
В частотном блоке тот же человек отвечает на прямой вопрос, как часто он бывает в соцсетях. Здесь 80,2% отвечают «каждый день», и только 5,1% – «никогда».
Та же история с онлайн-видео: 79,6% в списке занятий и 48,5% «каждый день» в частотном блоке. И с онлайн-ТВ: 25,1% в списке занятий, но 68,2% отвечают «никогда» в частотном.
Правило выбора: для оценки охвата и планирования контактов берут частотный блок – он измеряет поведение. Списки занятий измеряют самоописание, они полезны для понимания образа жизни и для креатива, но не для расчёта медиавеса.
Общий принцип шире конкретного примера: формулировка вопроса – часть данных. Цифра без вопроса, из которого она получена, не интерпретируется.
Правило 5. Мультивыбор не суммируется в 100%
Коротко: критерии выбора в разобранной категории дают в сумме 179,9%, а список используемых соцсетей – 302,1%. Это нормально: вопрос допускал несколько ответов. Ненормально – считать доли от такой суммы.
Два примера из выгрузки.
Критерии выбора марки: качество – 69%, цена – 47,1%, марка – 45%, внешний вид – 10,4%, страна – 8,4%. Сумма – 179,9%.
Используемые соцсети: Instagram – 80,1%, TikTok – 63,7%, Telegram – 58,1%, Одноклассники – 32,7%, Facebook – 25,8%, ВКонтакте – 20,5%, Мой мир – 9,2%, Pinterest – 6,5%, Threads – 5,5%. Сумма – 302,1%.
Обе суммы больше 100%, потому что респондент выбирал несколько вариантов. Кстати, вторая сумма сама по себе содержательна: в среднем человек из этой аудитории пользуется тремя соцсетями. Это полезный факт для планирования пересечений охвата.
Чего делать нельзя: пересчитывать такие доли «в структуру». Утверждение вида «Instagram занимает 26% медиапотребления соцсетей» (80,1 / 302,1) – бессмысленно: исходный вопрос не измерял ни время, ни объём потребления, только факт использования.
Как отличить мультивыбор от единственного выбора: сложите столбец. Около 100% – единственный выбор, заметно больше – множественный. В той же выгрузке блок предпочтений по добавкам даёт в сумме 100,2%, то есть выбор был один, а блок критериев – 179,9%, то есть несколько.
Правило 6. Проценты и абсолюты отвечают на разные вопросы
Коротко: в выгрузках рядом стоят взвешенные тысячи человек и взвешенный процент от базы. Проценты нужны для сравнения между собой, абсолюты – для оценки масштаба и для сравнения между разными базами.
В стандартной выгрузке MMI по каждому показателю идут три колонки: wTotal (взвешенное значение в тысячах человек), Sample (сколько реальных респондентов дали такой ответ) и Col % Weighted (взвешенный процент от базы).
Когда что использовать:
- Проценты – когда сравниваете показатели внутри одной базы: этот бренд против того, этот канал против другого.
- Абсолюты – когда оцениваете масштаб («80,1% Instagram» звучит абстрактно, «1,59 млн человек» – понятно) и когда сравниваете показатели с разными базами.
- Sample – когда решаете, можно ли вообще опираться на строку. Если в ячейке 15–20 респондентов, показатель приводится справочно, и строить на нём выводы нельзя.
Последний пункт часто упускают. В разобранной выгрузке есть строки с выборкой 8–16 человек: например, лечебный чай – 8 респондентов, покупка через интернет – 16. Такие значения корректно читать как «мало», но не как «1,2%» или «1,5%»: точность там иллюзорная.
Правило 7. «Никогда» – это тоже данные
Коротко: 68,2% аудитории никогда не смотрят онлайн-ТВ. Вариант «никогда» обычно пропускают, потому что смотрят на топ ответов, а он говорит о канале больше, чем любая другая строка.
Взгляд по умолчанию – сверху вниз: смотрят на первые строки, где большие числа. Но в частотных блоках самая информативная строка часто внизу.
Пример из выгрузки: у онлайн-ТВ первая строка – «никогда, 68,2%». Ежедневная аудитория – 10,3%. Если читать блок сверху, останется впечатление, что канал есть и работает. Если прочитать строку «никогда», становится ясно, что для двух третей аудитории канала не существует.
Тот же приём применим к любым частотным вопросам: доля «никогда» – это верхняя граница потенциального охвата канала. Она не меняется от размера бюджета.
Как это использовать в медиаплане: считать не «сколько людей пользуется каналом», а «сколько людей физически невозможно достать через этот канал». Второй вопрос быстрее отсекает каналы, которые попали в план по инерции. Пример такого разбора по конкретной аудитории – в материале Медиапортрет женщины 30–55 в Казахстане.
Как выглядит корректная ссылка на исследование
Коротко: в ссылке должны быть название исследования, компания, волна, описание базы, размер выборки и отдельно – кто делал расчёты. Без описания базы ссылка не проверяема.
Минимальный корректный формат:
Источник: Media Marketing Index (MMI) 2025, K Research Central Asia. База: женщины 30–55 лет, города Казахстана 100 тыс.+, выборка 821 респондент. Расчёты и интерпретация – Media Insider.
Что здесь важно и зачем:
- Название и компания – позволяют найти первоисточник и понять методику.
- Волна или год – медиапотребление в цифровых каналах меняется за год заметно.
- Описание базы – главный элемент. Без него цифра не проверяема, а с ним читатель сразу видит границы применимости.
- Размер выборки – даёт понять допустимую точность.
- Разделение источника и расчётов – если вы сами считали конверсии, доли или средневзвешенные значения, это ваша аналитика, а не данные исследования. Смешивать их некорректно по отношению и к исследователю, и к читателю.
Последний пункт стоит подчеркнуть. Синдицированное исследование даёт таблицу. Всё, что вы из неё вывели, – конверсии воронки, средние частоты, сценарии – это ваша интерпретация, и подписывать её нужно своим именем. Так делаем и мы во всех материалах, где используются данные MMI.
Чек-лист: что спросить, когда вам приносят цифру
Коротко: шесть вопросов, которые занимают пару минут и снимают большую часть ошибок интерпретации.
- Какая база? Кто именно посчитан: город, возраст, пол, пользователи категории. Сколько это человек.
- Какой размер выборки у этой конкретной строки? Не у исследования целиком, а у той ячейки, о которой идёт речь.
- Как звучал вопрос дословно? Особенно если цифра описывает поведение: «пользуетесь» и «пользуетесь ежедневно» – разные вопросы.
- Один вариант ответа или несколько? Сумма столбца сразу это показывает.
- Это данные исследования или чей-то расчёт по ним? Если расчёт – по какой формуле.
- Какой год или волна? И насколько показатель устойчив во времени.
Если на первые два вопроса нет ответа, цифру в медиаплан лучше не брать. Не потому, что она неверна, а потому, что её нельзя проверить и нельзя корректно применить.
Красные флаги в презентациях с данными
Коротко: круглые числа без базы, проценты без сноски, «исследование показывает» без названия исследования, сравнение показателей из разных источников и вывод, под который нельзя показать строку таблицы.
Признаки, при которых слайд стоит перепроверить:
- Круглые числа. «60% покупателей», «каждый третий», «две трети» – при пересчёте из таблицы такие значения появляются редко. Обычно это округление, за которым потерялась исходная строка.
- Нет сноски с базой. Самый надёжный индикатор: если базы нет, автор слайда, скорее всего, сам её не смотрел.
- «Исследования показывают». Без названия, компании и года это риторическая фигура, а не ссылка.
- Показатели из разных источников в одной таблице. Знание бренда из своего опроса и лояльность конкурентов из чужого исследования нельзя ставить в соседние колонки: разные выборки, формулировки и базы.
- Вывод без строки. Попросите показать конкретную строку таблицы под конкретным утверждением. Если такой строки нет – перед вами гипотеза.
- Точность не по размеру выборки. «12,7% аудитории» при выборке в 60 человек – ложная точность: корректно сказать «около 13%, оценка на малой выборке».
Ни один из этих признаков не означает, что данные плохие. Он означает, что нужно вернуться к таблице. Это дешевле, чем построить на слайде квартальный медиаплан.
Если вы хотите, чтобы такие проверки происходили до того, как цифра попадает в бюджет, – обсудите работу с Media Insider. Мы работаем с исследовательскими данными по рынку Казахстана и переводим их в медиарешения с указанием баз, выборок и того, где заканчиваются данные и начинается интерпретация.
Источники
- Media Marketing Index (MMI) 2025, волна MMI_ALL_2025 – K Research Central Asia, синдицированное исследование медиапотребления и потребительского поведения, города Казахстана 100 тыс.+
- Примеры в материале – реальная выгрузка MMI 2025: национальный срез (база 1 985,5 тыс. человек, выборка 821) и городской срез по Алматы (база около 469 тыс. человек)
- Расчёты погрешностей, разбор ошибок интерпретации и выводы – собственная аналитика рекламного агентства Media Insider
FAQ
Как быстро посчитать погрешность выборки?
Для долей около 50% при 95% доверительной вероятности приближение простое: 98 разделить на корень из размера выборки. Для 821 респондента получается около ±3,4 процентного пункта, для 400 – около ±4,9, для 200 – около ±6,9. У долей около 10% или 90% погрешность меньше. Взвешивание данных фактическую погрешность увеличивает, поэтому результат стоит воспринимать как нижнюю границу.
Что делать, если в отчёте не указана база?
Вычислить её самостоятельно: разделить абсолютное значение на процент. Если в таблице есть колонка с тысячами человек и колонка с процентами, база получается делением одного на другое и должна совпадать по всем строкам блока. Если не совпадает – в блоке смешаны разные базы, и это повод запросить исходную выгрузку.
Насколько устойчивы такие данные во времени?
По-разному. Структура дня, транспортные привычки, частота покупки в зрелых категориях меняются медленно – на такие показатели можно опираться год-два. Доли отдельных цифровых площадок, форматов видео и предпочтений по блогерам меняются быстро, и их имеет смысл перепроверять к каждой крупной кампании.
Можно ли сравнивать данные разных исследований между собой?
С большой осторожностью и почти никогда напрямую. Разные компании используют разные выборки, формулировки вопросов, периоды и способы взвешивания. Сравнивать корректно динамику внутри одного исследования от волны к волне; сравнение уровней между исследованиями обычно даёт разницу в методике, а не в реальности.
Чем синдицированное исследование отличается от заказного?
Синдицированное (как MMI) проводится исследовательской компанией по своей программе, а подписчики покупают доступ к данным. Плюс – сопоставимость с рынком, конкурентами и предыдущими волнами, а также цена. Минус – вопросы заданы не под вашу задачу. Заказное исследование отвечает точно на ваш вопрос, но стоит дороже и не даёт исторического и конкурентного контекста.
Кто должен проверять данные – агентство или клиент?
На практике – обе стороны, и это нормальная часть работы, а не проявление недоверия. Агентство обязано показывать базы и выборки в своих материалах, клиент – задавать вопросы из чек-листа выше. Цена невыявленной ошибки ложится на бюджет клиента, поэтому пара минут на проверку окупается всегда.

