Estadística descriptiva, inferencial y multivariada
Estadística rigurosa, sin código
Sube tu hoja de cálculo y StatsPro se encarga del resto: estadística descriptiva con
gráficas editables, comprobación de los supuestos del ANOVA, regresión y comparación de medias
(Tukey, Duncan y otros 12 métodos), correlación y análisis multivariado (PCA, FAMD/MCA y
clustering) — todo con figuras de calidad para tesis. Sin instalar nada, sin escribir una línea de código.
Todo el cálculo ocurre en tu navegadorNingún dato sale de tu computadoraFiguras PNG / SVG / PDF listas para publicarGratis y sin cuenta
Cómo funciona
Un recorrido de seis bloques. Cada uno revisa tus datos y te explica qué encontró antes
de pasar al siguiente; la decisión final siempre es tuya.
Qué incluye
Pulsa una tarjeta para ir directo a ese bloque.
Por qué existe
Programar el análisis nunca es lo difícil: cualquier paquete devuelve un valor p. Lo que decide si una tesis
o un artículo sostienen sus conclusiones son las decisiones de alrededor —¿se cumplen los supuestos?,
¿qué prueba de medias corresponde?, ¿cuántos componentes retener?, ¿la relación es lineal?— y ahí la
mayoría de los programas calcula la cifra y se detiene. StatsPro pone el argumento metodológico junto
al número que lo justifica, en el momento en que hay que decidir.
Qué necesitas
Un navegador reciente (Chrome, Edge o Firefox) — computadora, tablet o celular.
Conexión a internet la primera vez que abres cada bloque (para cargar Python).
Tus datos en una hoja de cálculo: primera fila con los nombres de las variables.
1. Sube tu archivo de datos
Formato .xlsx o .csv. La primera fila debe tener los nombres de las variables
y cada fila siguiente una observación (como el archivo iris.xlsx). Las columnas pueden ser
numéricas (mediciones) o categóricas (grupos, tratamientos, especies…).
⬆
Arrastra tu archivo aquí o haz clic para elegirlo
.xlsx · .xls · .csv · .tsv
Hoja del libro:
Revisa las variables
StatsPro detectó automáticamente el tipo de cada columna. Ajusta si hace falta:
una variable numérica con pocos valores enteros (p. ej. un código de tratamiento) suele convenir marcarla como categórica.
Vista previa
⌗ numérica · ⌸ categórica · ∅ excluida
2. Estadística descriptiva
El cálculo corre en Python dentro de tu navegador (Pyodide). La primera vez tarda ~1 min en cargar.
Variables numéricas a resumir
Resumen numérico
Normalidad rápida (Shapiro-Wilk)
Un primer vistazo. Los supuestos completos (con gráficos para tesis) están en el Bloque 3.
Frecuencias de una variable categórica
Datos faltantes
Estudio de gráficas
Elige el tipo de gráfico y edítalo en vivo. Exporta en PNG de alta resolución, o en PDF/SVG vectorial para revistas.
Configura el gráfico…
Bloques 3 a 6 (supuestos, regresión, correlación y multivariado) se irán habilitando en las siguientes entregas.
3. Supuestos del análisis de varianza
El ANOVA (y cualquier modelo lineal) supone que los residuales son
independientes, tienen varianza constante (homocedasticidad) y siguen una
distribución normal. Aquí ajustamos tu modelo y comprobamos los tres supuestos con
pruebas formales y figuras listas para tesis.
Factores (grupos / tratamientos)
Modelo ajustado (contexto)
La prueba de hipótesis completa y las comparaciones de medias (Tukey, Duncan) están en el Bloque 4. Aquí sólo se usa el modelo para obtener los residuales.
Diagnóstico general
Empieza por aquí: un vistazo rápido a los cuatro gráficos de diagnóstico. Edita el estilo de todas las figuras de este bloque abajo — se aplica al instante.
1 · Normalidad de los residuales
¿Qué es y por qué importa?
El ANOVA compara medias suponiendo que el error aleatorio se distribuye normalmente.
Con muestras grandes el ANOVA es robusto a desviaciones moderadas (teorema del límite central),
pero con n pequeño o asimetría fuerte conviene transformar la respuesta o usar una prueba no paramétrica.
Shapiro-Wilk es la prueba más potente para n < 50; Anderson-Darling y Lilliefors dan peso a las colas;
la asimetría y la curtosis describen cómo se aleja de la normal.
Normalidad dentro de cada grupo (Shapiro-Wilk)
2 · Homocedasticidad (igualdad de varianzas)
¿Qué es y por qué importa?
Si unos grupos varían mucho más que otros, el valor F del ANOVA se distorsiona
(sobre todo con grupos desbalanceados). Levene con la mediana (Brown-Forsythe) y
Fligner-Killeen son robustas a la no normalidad; Bartlett es potente pero
exige normalidad. Como regla práctica, una razón entre la varianza mayor y la menor
por debajo de 3–4 suele ser tolerable. Si falla: ANOVA de Welch o Kruskal-Wallis.
Dispersión por grupo
3 · Independencia de los residuales
¿Qué es y por qué importa?
Cada observación debe aportar información nueva. Se viola con medidas repetidas sobre
el mismo individuo, pseudorréplicas, cercanía espacial o temporal, o efecto de bloque no modelado.
Durbin-Watson detecta autocorrelación de primer orden (≈2 = sin autocorrelación);
la prueba de rachas y Ljung-Box detectan patrones en el orden de los datos.
La mejor defensa es un buen diseño (aleatorización).
Observaciones influyentes y atípicas
Resumen y recomendación
4. Regresión y comparación de medias
StatsPro ajusta una batería de modelos (paramétricos y no paramétricos), los compara
por error de predicción con validación cruzada y te dice cuál es el mejor y qué tipo de regresión
se acopla a tus datos.
Predictores numéricos (X)
Predictores categóricos (X)
Recomendación
Comparación de modelos
Ordenados por RMSE de validación cruzada (5 particiones) — menor es mejor. La fila verde es la recomendada.
Pruebas F entre modelos anidados
¿Vale la pena la complejidad extra? Compara un modelo simple contra uno más flexible.
Detalle del modelo
Edita el estilo de todas las figuras de este bloque:
Ajuste
Residuales vs. predichos
Q–Q de residuales
Teoría: ¿qué modelo elegir?
R² siempre sube al añadir variables; usa R² ajustado, AIC/BIC
(equilibran ajuste y complejidad; menor es mejor) y sobre todo el RMSE de validación cruzada,
que mide qué tan bien predice datos nuevos. BIC penaliza más la complejidad que AIC.
Las pruebas F entre modelos anidados dicen si los términos extra aportan de forma significativa;
las pruebas t de cada coeficiente dicen si esa variable contribuye.
Los métodos regularizados (Ridge, Lasso, Elastic Net) sirven con muchas variables o colinealidad;
los no paramétricos (LOESS, splines, isotónica, kNN, bosque aleatorio) no imponen una forma
y son buenos para explorar; los robustos (Huber, Theil-Sen) resisten valores atípicos;
los GLM ajustan la distribución del error (Gamma para respuestas positivas asimétricas,
Poisson para conteos).
ANOVA (una o dos vías) + Welch + Kruskal-Wallis, tamaños de efecto, y comparación
de medias por parejas con muchos métodos, letras de significancia y gráficos para tesis.
Factores
ANOVA
Tamaño del efecto
¿Qué significan η², ω², ε²?
η² (eta cuadrada) = proporción de la varianza total explicada por el factor.
η² parcial descuenta la varianza de otros factores (útil en diseños de dos vías).
ω² (omega) y ε² (épsilon) son estimadores menos sesgados de η², preferidos para
publicación. f de Cohen: 0.10 pequeño, 0.25 mediano, 0.40 grande. Un p pequeño con η²
pequeño = efecto real pero de poca magnitud práctica.
Resumen por grupo
Comparación de medias por parejas
Letras de significancia
Todas las parejas
Figuras
Medias con letras de significancia
La figura clave para tesis: grupos que comparten letra no difieren.
Diferencias por parejas (IC)
Cajas con marcas de significancia
Gráfico de interacción
5. Análisis de correlación
Estilo de todas las figuras de este bloque (se aplica a cualquier pestaña):
Variables numéricas
Mapa de calor
Corrplot (círculos)
Red de correlaciones
Matriz de dispersión
Todas las parejas
Análisis a fondo de dos variables: los tres coeficientes con IC, la
correlación de distancia (detecta cualquier tipo de dependencia, incluso no monótona) y
un diagrama con recta de ajuste, elipses de confianza e histogramas marginales.
¿Correlación parcial y semiparcial?
La correlación parcial entre A y B controla el efecto de las demás variables en ambas:
revela si una asociación fuerte es espuria (producida por una tercera variable). La
semiparcial quita el efecto de las demás sólo de una de las dos: su cuadrado es la
varianza que un predictor explica de forma única (lo que aporta más allá del resto).
Correlación parcial (controlando todas las demás)
Correlación semiparcial (varianza única de cada predictor)
Predictores:
Asociación cuando hay variables categóricas: η (razón de correlación) y
r biserial-puntual para numérica × categórica; V de Cramér corregida y
U de Theil para categórica × categórica.
¿Correlación canónica?
Generaliza la correlación a dos conjuntos de variables. Busca la combinación lineal
del grupo X y la del grupo Y que estén lo más correlacionadas posible (dimensión 1), luego otra
independiente (dimensión 2), etc. El test de Wilks dice cuántas dimensiones son
significativas; las cargas canónicas dicen qué variables pesan en cada eje; la
redundancia es la varianza de un grupo explicada por el otro.
Grupo X
Grupo Y
Dimensiones canónicas
Cargas del grupo X
Cargas del grupo Y
Variates canónicas
Cargas canónicas
6. Análisis multivariado
Variables numéricas
Variables categóricas
StatsPro revisa tus datos (tipo de variables, factorabilidad con KMO y Bartlett,
tendencia de agrupamiento con Hopkins) y sugiere qué análisis multivariado encaja mejor.
Al final tú decides.
KMO por variable
KMO < 0.5 en una variable = candidata a excluirse del PCA.