← Documentación

Medición e incrementalidad

Significación estadística en pruebas de anuncios

Un resultado de prueba puede ser ruido, no señal. Qué es la significación estadística en anuncios, cuántos datos necesitas y cuándo declarar ganador.

YieldBI TeamGrowth ResearchActualizado jul 2026

Qué es la significación estadística

La significación estadística mide la probabilidad de que una diferencia observada entre dos variantes de anuncio, como dos creatividades o dos audiencias, refleje una diferencia real subyacente y no el azar. Toda prueba implica una muestra de personas, no a toda la población que podría llegar a ver el anuncio, y las muestras pequeñas producen de forma natural algo de variación incluso cuando no hay una diferencia real entre variantes.

Cuando un resultado de prueba es estadísticamente significativo, significa que es improbable que la brecha observada se deba únicamente al ruido aleatorio de quién vio y respondió a cada variante. No significa que el resultado sea grande, importante o permanente. Solo significa que la brecha probablemente sea real y no un golpe de suerte de esa muestra concreta.

Cómo se mide

La prueba de significación compara la diferencia observada entre dos variantes con la variación que cabría esperar si realmente no hubiera diferencia alguna. Este cálculo depende de tres factores: el tamaño del efecto observado, el tamaño de la muestra en cada grupo y la variabilidad de la métrica subyacente. Muestras más grandes y efectos mayores facilitan alcanzar la significación; muestras pequeñas y efectos sutiles la dificultan, a veces hasta hacerla imposible dentro de una duración de prueba razonable.

El resultado suele expresarse como un nivel de confianza, habitualmente 90% o 95%. Un nivel de confianza del 95% significa que si repitieras la misma prueba en condiciones idénticas sin diferencia real entre variantes, verías una brecha de este tamaño o mayor solo alrededor del 5% de las veces por azar.

Por qué importa

Las plataformas publicitarias y los paneles suelen declarar un “ganador” en cuanto una variante va por delante en cifras brutas, pero una ventaja tras unos pocos cientos de clics puede revertirse fácilmente con más datos. Actuar sobre resultados antes de alcanzar la significación significa optimizar con frecuencia a partir de ruido, lo que desperdicia presupuesto desplazando el gasto hacia variantes que en realidad no son mejores, y puede incluso perjudicar el rendimiento si el aparente ganador era un falso positivo.

Esto es especialmente relevante para eventos de bajo volumen, como las compras en una cuenta con poco tráfico, donde alcanzar un tamaño de muestra fiable puede llevar semanas en lugar de días. Las diferencias en tasa de conversión sobre un número reducido de conversiones son el tipo de resultado de prueba menos fiable.

Cómo actuar sobre ella

Decide tu tamaño de muestra mínimo antes de empezar una prueba, basándote en tu tasa de conversión habitual y en el efecto mínimo que realmente te interesa detectar. Deja que la prueba corra hasta alcanzar ese tamaño de muestra o la duración planificada, lo que llegue más tarde, en lugar de detenerla en cuanto una variante parezca ir por delante. Evita revisar los resultados a diario y reaccionar a oscilaciones a corto plazo: las ventajas tempranas en una prueba son poco fiables por naturaleza.

Cuando los resultados son interesantes en dirección pero aún no significativos, trátalos como una hipótesis que merece otra prueba, no como un hallazgo confirmado.

Errores habituales

Terminar una prueba en cuanto una variante toma la delantera, una práctica a veces llamada peeking, infla la probabilidad de un falso positivo muy por encima del nivel de confianza declarado. Ejecutar pruebas en campañas de muy bajo volumen esperando una respuesta rápida y fiable aboca a la decepción o a malas decisiones. Confundir significación estadística con importancia práctica, tratando una diferencia apenas significativa pero minúscula como un hallazgo importante, malgasta esfuerzo en ganancias marginales. Probar demasiadas variantes a la vez sin ajustar por el número de comparaciones aumenta las probabilidades de que al menos una parezca ganar solo por azar.