Estadística multivariada para biología, ecología y agronomía

Encuentra los ejes que ordenan tus datos

Del archivo crudo a una figura lista para publicar: comprueba si tus datos admiten un ACP, decide cuántos componentes retener con ocho criterios en lugar de uno, rota si hace falta, lee los mapas factoriales y exporta un informe completo. Sin programar y sin instalar nada.

Todo el cálculo ocurre en tu navegador Ningún dato sale de tu computadora Figuras SVG / PNG hasta 12× Libre y de código abierto

Cómo funciona

Un recorrido guiado. Cada paso explica la idea en palabras llanas, revisa tus datos y recomienda qué hacer después. La decisión siempre la tomas tú: la plataforma pone delante el argumento, no la respuesta.

Qué incluye

Seis bloques, en orden. Pulsa una tarjeta para ir directo.

Por qué existe

El cálculo de un ACP nunca es el problema: cualquier programa devuelve los valores propios. Lo que decide si el análisis se sostiene son las decisiones de alrededor —cómo tratas los faltantes, si estandarizas, cuántos componentes retienes, qué cargas interpretas— y ahí el software habitual calcula la cifra y se detiene. PCAPro pone el argumento metodológico junto al número que lo justifica, en el momento en que hay que decidir.

Si publicas con la plataforma, cítala

Marco teórico del Análisis de Componentes Principales

Todo lo que conviene tener claro antes de tocar los datos. Despliega la sección que necesites; las secciones marcadas con ▸ Bloque N se aplican más adelante en la plataforma.

1 · ¿Qué es el ACP y qué problema resuelve?

El Análisis de Componentes Principales (ACP; PCA en inglés) es una técnica de estadística multivariada descriptiva que resume la información contenida en muchas variables cuantitativas correlacionadas en un número pequeño de variables nuevas —los componentes principales— construidas como combinaciones lineales de las originales, no correlacionadas entre sí y ordenadas por la cantidad de varianza que retienen.

Fue formulado por Karl Pearson (1901) como el problema de encontrar la recta (o el plano) que mejor se ajusta a una nube de puntos en el sentido de mínimos cuadrados ortogonales, y desarrollado independientemente por Harold Hotelling (1933) desde el punto de vista de la maximización de la varianza. Ambas formulaciones conducen al mismo resultado: los ejes principales son los vectores propios de la matriz de covarianzas (o de correlaciones) de los datos.

Para qué se usa realmente:

  • Reducción de dimensiones. Pasar de 20 variables a 2 o 3 ejes que conserven el 70–90 % de la información.
  • Visualización. Representar en un plano individuos y variables que viven en un espacio de p dimensiones.
  • Detección de estructura. Descubrir grupos de variables que se comportan juntas (síndromes, gradientes, ejes ecológicos).
  • Depuración de la multicolinealidad. Generar predictores ortogonales para regresión (Principal Component Regression).
  • Detección de atípicos y control de calidad de una base de datos.
  • Construcción de índices sintéticos (calidad, productividad, condición) a partir del primer componente.
Idea clave El ACP no inventa información: la reorganiza. La varianza total del conjunto no cambia; solo se redistribuye en ejes ordenados de mayor a menor. Si las variables no están correlacionadas, no hay nada que resumir y el ACP devuelve prácticamente las mismas variables rotadas.
2 · La matemática, en una página

Partimos de una matriz de datos X con n filas (individuos) y p columnas (variables cuantitativas). Se centra cada columna restando su media, y opcionalmente se divide entre su desviación estándar:

Z[i,j] = ( X[i,j] − media_j ) / s_j (estandarización z)

Con los datos centrados se calcula la matriz de covarianzas (o de correlaciones si además se dividió entre s):

S = (1 / (n − 1)) · Xᶜᵀ · Xᶜ (p × p, simétrica)

El ACP resuelve el problema de valores propios:

S · v_k = λ_k · v_k con v_kᵀ · v_k = 1 y v_kᵀ · v_m = 0 (k ≠ m)
  • λ_k (valor propio o eigenvalue) = varianza que captura el componente k. Se cumple Σ λ_k = traza(S), es decir la varianza total. Con matriz de correlaciones, traza = p y por eso el criterio de Kaiser es λ > 1.
  • v_k (vector propio o eigenvector) = dirección del componente en el espacio de las variables. Sus elementos son los coeficientes o pesos de la combinación lineal.
  • Puntuaciones (scores): coordenadas de los individuos sobre el nuevo eje, F_k = Xᶜ · v_k.
  • Cargas (loadings): correlación entre la variable original y el componente, carga_jk = v_jk · √λ_k. Son lo que se interpreta y lo que se dibuja en el círculo de correlaciones.

Numéricamente es preferible obtener lo mismo por descomposición en valores singulares (SVD) de la matriz centrada, que evita construir S y es más estable:

Xᶜ = U · D · Vᵀ → λ_k = d_k² / (n − 1), componentes = columnas de V

Propiedades que conviene recordar:

  • Los componentes son ortogonales (no correlacionados) por construcción.
  • El primer componente es la dirección de máxima varianza; el segundo, la de máxima varianza entre las direcciones perpendiculares al primero, y así sucesivamente.
  • El ACP es la mejor aproximación de rango k a la matriz de datos en el sentido de mínimos cuadrados (teorema de Eckart–Young).
  • Los signos de los vectores propios son arbitrarios: un eje espejado no cambia la interpretación.
3 · Postulados y supuestos del ACP esencial

El ACP es una técnica descriptiva: no plantea un modelo probabilístico ni contrasta hipótesis, así que sus «supuestos» son menos rígidos que los de un ANOVA. Pero para que el resultado sea interpretable y reproducible deben cumplirse las siguientes condiciones. La app verifica automáticamente las que están marcadas con ✔.

  1. Variables cuantitativas continuas ✔. El ACP clásico opera sobre variables de intervalo o de razón. Con variables categóricas hay que usar otras técnicas: AC (análisis de correspondencias) para dos variables cualitativas, ACM para varias, AFDM para datos mixtos. Las escalas Likert con 5 o más niveles se aceptan en la práctica, pero conviene reportarlo.
  2. Linealidad de las relaciones ✔ (parcial). El ACP solo captura estructura lineal, porque parte de covarianzas o correlaciones de Pearson. Si dos variables se relacionan en forma de U, el ACP no lo verá. Revisa los diagramas de dispersión y, si hace falta, transforma (log, raíz) o usa ACP no lineal / kernel PCA.
  3. Correlaciones suficientes entre variables ✔. Es el requisito de fondo: si R ≈ I (matriz identidad) no hay redundancia que resumir. Se comprueba con la prueba de esfericidad de Bartlett, el índice KMO y la inspección de la matriz de correlaciones (debe haber varios |r| ≥ 0.30).
  4. Tamaño de muestra adecuado ✔. Reglas de uso común: n ≥ 100 (o al menos 50); razón de al menos 5 individuos por variable, preferiblemente 10:1; y siempre n > p. Muestras pequeñas producen cargas inestables que no se replican.
  5. Ausencia de multicolinealidad extrema y de singularidad ✔. Correlaciones |r| > 0.90 o determinante de R ≈ 0 indican que hay variables que son combinación lineal casi exacta de otras (por ejemplo incluir largo, ancho y área = largo × ancho). Infla el primer componente y hace inestable la rotación.
  6. Escalas comparables o estandarización previa ✔. El ACP sobre covarianzas está dominado por la variable de mayor varianza. Si las unidades difieren (mm, g, µm, %), hay que estandarizar y trabajar sobre la matriz de correlaciones.
  7. Ausencia de valores atípicos influyentes ✔. Como el método maximiza varianza, un solo caso extremo puede generar un componente propio. Se detectan con la distancia de Mahalanobis y se reporta el análisis con y sin ellos.
  8. Tratamiento explícito de los datos faltantes ✔. El ACP clásico necesita una matriz completa; hay que decidir entre eliminar filas o imputar, y declararlo.
  9. Normalidad multivariante: no es obligatoria. El ACP descriptivo funciona sin ella. Se vuelve necesaria si se van a usar pruebas inferenciales sobre los valores propios o si se interpreta la prueba de Bartlett de forma estricta, ya que esta última la supone. Sí conviene evitar asimetrías extremas (|g₁| > 2), porque distorsionan las correlaciones de Pearson.
  10. Homogeneidad de la muestra. El ACP asume que todos los individuos provienen de la misma población. Si mezclas poblaciones muy distintas, el primer eje solo reflejará esa separación; considera analizar por separado o usar las variables de grupo como suplementarias.
  11. Independencia de las observaciones. Cada fila debe ser un individuo distinto. Con medidas repetidas o datos espaciales/temporales la interpretación cambia y existen variantes específicas.
Lo que no es un supuesto No se requiere ni variable respuesta, ni grupos definidos, ni homocedasticidad, ni normalidad univariada de cada variable. El ACP no «prueba» nada: describe.
4 · Pruebas previas obligatorias: Bartlett, KMO, determinante

Prueba de esfericidad de Bartlett (1950). Contrasta la hipótesis nula de que la matriz de correlaciones poblacional es la identidad, es decir, que las variables no están correlacionadas:

χ² = − [ (n − 1) − (2p + 5)/6 ] · ln |R| con gl = p(p − 1)/2

Se busca rechazar H₀: un valor p < 0.05 indica que existen correlaciones suficientes y que el ACP tiene sentido. Cuidado: con n grande casi siempre resulta significativa, así que es una condición necesaria pero no suficiente. Supone normalidad multivariante.

Índice de Kaiser–Meyer–Olkin (KMO) y MSA. Compara la magnitud de las correlaciones observadas con la de las correlaciones parciales. Si las variables comparten factores comunes, las correlaciones parciales serán pequeñas y el KMO alto:

KMO = Σ Σ r²ᵢⱼ / ( Σ Σ r²ᵢⱼ + Σ Σ a²ᵢⱼ ) (i ≠ j; a = correlación parcial)
KMOCalificación de KaiserDecisión
≥ 0.90Excelente («maravilloso»)Adelante
0.80 – 0.89MeritorioAdelante
0.70 – 0.79Aceptable («mediano»)Adelante
0.60 – 0.69MediocreCon reservas
0.50 – 0.59BajoRevisar variables
< 0.50InaceptableNo hacer ACP

El mismo cálculo aplicado a cada variable da su MSA (measure of sampling adequacy). Las variables con MSA < 0.50 se eliminan una a una, recalculando después de cada eliminación.

Determinante de R. Debe ser mayor que 0 pero no demasiado grande. Un valor cercano a 0 (< 10⁻⁵) señala multicolinealidad severa o singularidad; un valor cercano a 1 significa que R ≈ I y no hay nada que resumir.

5 · Tamaño de muestra: cuánta gente / cuántas parcelas hacen falta
  • Regla del número absoluto. Comrey y Lee: 50 = muy deficiente, 100 = deficiente, 200 = aceptable, 300 = bueno, 500 = muy bueno, 1000 = excelente.
  • Regla de la razón n:p. Entre 5:1 (mínimo) y 20:1 (ideal); 10:1 es el consenso habitual.
  • Regla de la comunalidad (más moderna, MacCallum et al. 1999). Lo que importa no es tanto n como la fuerza de la estructura: con comunalidades altas (> 0.60) y 3–4 variables marcadoras por componente, n = 60–100 puede bastar; con comunalidades bajas (< 0.40) pueden hacer falta n > 300.
  • Regla práctica de campo. Si vas a interpretar cargas, exige al menos 3 variables con carga alta por cada componente que quieras retener.

Umbral de significación de una carga según el tamaño de muestra (Hair et al., α = 0.05, potencia 80 %):

n50607085100120150200250350
|carga| mínima0.750.700.650.600.550.500.450.400.350.30
6 · Datos faltantes: qué hacer con los huecos

El ACP clásico exige una matriz completa. Las opciones, de menor a mayor sofisticación:

  1. Eliminación por lista (listwise, la opción por defecto aquí). Se descartan las filas con algún vacío. Es honesta y no distorsiona correlaciones, pero puede costar mucha muestra. Aceptable si se pierde menos del 5–10 % de los individuos y los vacíos son aleatorios (MCAR).
  2. Imputación por la media o la mediana. Rápida y disponible en la app. Preserva el tamaño de muestra pero reduce artificialmente la varianza y atenúa las correlaciones; la mediana es preferible si la variable es asimétrica. Declara siempre cuántas celdas imputaste.
  3. Imputación por regresión o por vecinos más cercanos (kNN). Conserva mejor la estructura de correlación.
  4. ACP iterativo regularizado (Josse y Husson, 2012). Es la opción recomendada en la literatura cuando hay más de un 10 % de vacíos: estima los valores faltantes usando la propia estructura de componentes, de forma iterativa.
Antes de imputar, mira el patrón Si los vacíos se concentran en una variable o en un grupo de individuos, no son aleatorios y ninguna imputación los arregla: probablemente convenga eliminar esa variable. Para eso sirve el mapa de datos faltantes que genera esta app.
7 · Estandarización, transformaciones y la elección covarianza / correlación

Es la decisión más importante de la preparación, porque cambia por completo el resultado.

OpciónFórmulaCuándo usarla
Sin escalar (ACP sobre covarianzas)x Todas las variables en la misma unidad y con varianzas comparables. Conserva las unidades originales.
Solo centrarx − x̄ Equivalente a la anterior; el centrado es obligatorio en cualquier caso.
Estandarización z (ACP sobre correlaciones)(x − x̄) / s Opción por defecto. Unidades distintas o varianzas muy dispares. Toda variable pesa lo mismo.
Pareto(x − x̄) / √s Metabolómica y espectros. Reduce la dominancia de las variables grandes sin igualarlas del todo; conserva parte de la estructura de magnitud.
VAST(x − x̄) · x̄ / s² Cuando interesa dar más peso a las variables estables (con bajo coeficiente de variación).
Rango [0, 1](x − mín) / (máx − mín) Índices y variables acotadas. Muy sensible a atípicos.
Robusta(x − mediana) / MAD Presencia de atípicos que no se quieren eliminar. Reduce su influencia sobre el escalado.

Transformaciones previas (se aplican antes del escalado):

  • Logarítmica — variables con asimetría positiva fuerte, crecimiento multiplicativo, conteos grandes, concentraciones. Linealiza relaciones de potencia y estabiliza la varianza.
  • Raíz cuadrada — conteos y abundancias con asimetría moderada (varianza proporcional a la media).
  • Inversa (1/x) — tasas y tiempos con colas muy largas.
  • Box–Cox / Yeo–Johnson — familia general que estima el exponente óptimo; útil cuando ninguna de las anteriores basta.
Regla práctica Si tus variables están en unidades distintas —y en biología casi siempre lo están— la respuesta es estandarización z. Si además alguna variable tiene |g₁| > 1, prueba primero una transformación logarítmica y compara el diagnóstico.
8 · Variables e individuos activos frente a suplementarios

Distinción central en la escuela francesa de análisis de datos (Benzécri, Lebart, Escofier–Pagès), que es la que sigue esta plataforma:

  • Variables activas. Construyen los ejes. Son las que entran en el cálculo de los valores propios.
  • Variables cuantitativas suplementarias. No participan en el cálculo, pero se proyectan después sobre el círculo de correlaciones para ayudar a interpretar los ejes. Ideales para variables de resultado (rendimiento, biomasa final) que no quieres que definan los componentes.
  • Variables cualitativas (grupos). Se usan para colorear los individuos, dibujar elipses de confianza por grupo y calcular los centroides de cada categoría sobre el plano factorial.
  • Individuos suplementarios. Casos que se proyectan sin haber intervenido en la construcción de los ejes (por ejemplo, una nueva campaña de muestreo o un testigo).

En el Bloque 1 tú asignas ese papel a cada columna. La app propone una asignación automática, pero la decisión es tuya y es una decisión teórica, no estadística: las variables activas deben responder a una misma pregunta conceptual.

9 · ¿Cuántos componentes retener? ▸ Bloque 2
  • Criterio de Kaiser (λ > 1). Solo válido sobre matriz de correlaciones: retiene los componentes que explican más que una variable original. Es el más usado y el que más tiende a sobreestimar el número de componentes, sobre todo con p > 30.
  • Gráfico de sedimentación (scree plot, Cattell 1966). Se retienen los componentes que quedan antes del «codo». Es visual y algo subjetivo, pero muy informativo.
  • Porcentaje de varianza acumulada. Retener hasta alcanzar un 70–80 % (ciencias naturales) o un 60 % (ciencias sociales). Nunca como criterio único.
  • Análisis paralelo de Horn (1965). El más recomendado hoy. Compara los valores propios observados con los que se obtendrían de datos aleatorios del mismo tamaño; se retiene mientras λ_observado > λ_aleatorio.
  • Bastón roto (broken stick). Compara con el reparto esperado de un segmento partido al azar. Muy usado en ecología; es conservador.
  • MAP de Velicer y validación cruzada (predicción de celdas omitidas). Los más rigurosos.
  • Criterio de interpretabilidad. Un componente que no se puede nombrar no sirve, aunque cumpla todos los criterios numéricos.

La buena práctica es combinar al menos tres criterios y reportarlos todos.

10 · Rotaciones: varimax, quartimax, equamax, promax, oblimin ▸ Bloque 3

Los ejes que salen del ACP maximizan varianza, pero no tienen por qué ser fáciles de interpretar: es habitual que todas las variables carguen sobre el primer componente. La rotación gira los ejes retenidos —sin cambiar la varianza total explicada por el conjunto— buscando una estructura simple en el sentido de Thurstone: que cada variable cargue fuerte en un solo componente y casi cero en los demás.

Rotaciones ortogonales (los componentes siguen sin correlacionarse):

  • Varimax (Kaiser, 1958). La más usada. Maximiza la varianza de las cargas al cuadrado dentro de cada componente, es decir, empuja las cargas hacia 0 o hacia ±1 columna por columna. Tiende a repartir las variables entre varios componentes bien definidos.
    maximizar Σ_k [ p·Σ_j (a²ⱼₖ)² − ( Σ_j a²ⱼₖ )² ] / p²
  • Quartimax. Simplifica por filas: busca que cada variable cargue en el menor número posible de componentes. Suele producir un primer factor general muy dominante.
  • Equamax. Compromiso entre varimax y quartimax (simplifica filas y columnas a la vez). Menos estable.
  • Parsimax y Orthomax: familia general que engloba a las anteriores según un parámetro γ (γ = 0 quartimax, γ = 1 varimax, γ = p/2 equamax).

Rotaciones oblicuas (permiten que los componentes se correlacionen entre sí):

  • Promax. Parte de una solución varimax y la eleva a una potencia κ (habitualmente 4) para exagerar el contraste entre cargas altas y bajas. Rápida y muy usada en muestras grandes.
  • Oblimin directo. Controla el grado de oblicuidad con el parámetro δ (δ = 0 es el más usado).
  • Geomin y Quartimin. Alternativas modernas, frecuentes en análisis factorial exploratorio.
¿Ortogonal u oblicua? Usa ortogonal (varimax) si necesitas componentes independientes —por ejemplo para usarlos como predictores en una regresión— o si teóricamente esperas dimensiones no relacionadas. Usa oblicua (promax / oblimin) si es razonable que las dimensiones estén correlacionadas, que es lo habitual en fenómenos biológicos y sociales. Con rotación oblicua se reportan dos matrices: la de patrón (coeficientes únicos, la que se interpreta) y la de estructura (correlaciones variable–componente).
Advertencia La rotación pertenece propiamente al análisis factorial. Al rotar componentes principales dejan de maximizar varianza individualmente y de estar ordenados por λ; lo que se conserva es la varianza total del subconjunto retenido. Es una práctica aceptada y muy extendida, pero hay que declararla: «ACP con rotación varimax sobre los k primeros componentes».
11 · ACP frente a Análisis Factorial (y otras confusiones frecuentes)
ACPAnálisis factorial exploratorio
ObjetivoResumir la varianza totalExplicar la varianza común (covarianza)
ModeloSin modelo: transformación de los datosModelo latente con error específico
Diagonal de RUnos (varianza total)Comunalidades estimadas
DirecciónComponente = función de las variablesVariable = función de los factores
Uso típicoReducción, índices, visualizaciónIdentificar constructos latentes

Otras técnicas emparentadas, por si tu pregunta no es de ACP:

  • Análisis de correspondencias (AC / ACM) — datos categóricos, tablas de contingencia.
  • Análisis factorial de datos mixtos (AFDM) — cuantitativas y cualitativas juntas.
  • Análisis factorial múltiple (AFM) — variables organizadas en grupos o bloques.
  • Análisis discriminante — hay grupos conocidos y se quiere separarlos (el ACP no busca separar).
  • Escalamiento multidimensional (NMDS) y PCoA — se parte de una matriz de distancias.
  • Regresión por componentes principales (RCP) — los componentes se usan como predictores en regresión para esquivar la multicolinealidad.
12 · Errores frecuentes que arruinan un ACP
  • Meter variables derivadas de otras (área = largo × ancho, porcentajes que suman 100). Genera dependencia lineal exacta y ejes artificiales.
  • No estandarizar cuando las unidades difieren, y luego «descubrir» que el primer componente es simplemente la variable con números más grandes.
  • Interpretar cargas pequeñas. Fija un umbral (0.30–0.40, o el de la tabla del punto 5) y respétalo.
  • Retener componentes solo por el criterio de Kaiser.
  • Interpretar el plano 1–2 cuando explica el 35 % de la varianza, sin advertirlo.
  • Olvidar que el signo de un componente es arbitrario.
  • Confundir la proximidad de dos individuos con la de dos variables: en el biplot se leen con reglas distintas (distancias entre puntos, ángulos entre vectores).
  • Usar el ACP como si fuera una prueba de hipótesis o como sustituto de un análisis discriminante.
  • No reportar el preprocesamiento (transformación, escalado, tratamiento de faltantes y de atípicos).
13 · Glosario y lecturas
TérminoSignificado
Valor propio (λ)Varianza capturada por un componente.
Vector propioDirección del componente; sus elementos son los coeficientes.
Carga (loading)Correlación entre una variable y un componente.
Puntuación (score)Coordenada de un individuo sobre un componente.
ComunalidadProporción de la varianza de una variable explicada por los componentes retenidos.
cos²Calidad de representación de un punto sobre un eje o plano.
ContribuciónAporte porcentual de un individuo o variable a la construcción de un eje.
Círculo de correlacionesRepresentación de las variables en el plano factorial; radio 1.
BiplotIndividuos y variables superpuestos en el mismo plano.
Estructura simpleSituación ideal tras la rotación: cada variable carga en un solo componente.

Referencias base de esta plataforma

  • Kassambara, A. (2017). Practical Guide to Principal Component Methods in R. STHDA. — criterios de visualización, cos², contribuciones, elementos suplementarios.
  • Gray, V. (ed.). Principal Component Analysis: Methods, Applications and Technology. Nova Science.
  • Suryanarayana, T.M.V. y Mistry, P.B. Principal Component Regression for Crop Yield Estimation. Springer.
  • Jolliffe, I.T. (2002). Principal Component Analysis, 2ª ed. Springer. — referencia canónica.
  • Hair, J.F. et al. Multivariate Data Analysis. — reglas prácticas de tamaño de muestra y cargas.
  • Lebart, Morineau y Piron. Statistique exploratoire multidimensionnelle. — escuela francesa, elementos activos y suplementarios.

1.1 · Sube tu base de datos

Formato .xlsx, .xls o .csv. La primera fila debe contener los nombres de las variables y cada fila siguiente una observación (una planta, una parcela, un individuo, una muestra…). Una sola tabla por hoja, sin filas ni columnas en blanco intercaladas y sin celdas combinadas.

⬆

Arrastra tu archivo aquí o haz clic para elegirlo

.xlsx · .xls · .csv · .tsv · .txt

Importante si tu hoja de cálculo usa configuración regional en español.
Solo aplica a archivos de texto plano.

Extracción de componentes: teoría

Qué se calcula exactamente en este paso y cómo se decide cuántos ejes conservar.

1 · Qué produce la extracción

Sobre la matriz ya preparada en el Bloque 1 se calcula la matriz de dispersión —de correlaciones si estandarizaste, de covarianzas si no— y se resuelve su descomposición espectral. De ahí salen cuatro objetos que se usarán en todos los bloques siguientes:

  • Valores propios λ₁ ≥ λ₂ ≥ … ≥ λ_p. Cuánta varianza captura cada eje. Su suma es la varianza total (igual a p si se trabaja con correlaciones, porque cada variable estandarizada aporta varianza 1).
  • Vectores propios. Los coeficientes de la combinación lineal que define cada componente.
  • Puntuaciones (scores). La coordenada de cada individuo sobre cada eje: es la nueva base de datos reducida, y se puede descargar y usar en regresión, ANOVA o clasificación.
  • Cargas (loadings). La correlación entre cada variable original y cada componente, carga_jk = v_jk · √λ_k / s_j. Es lo que se interpreta y lo que dibuja el círculo de correlaciones.

El porcentaje de varianza de un componente es λ_k / Σλ. El acumulado hasta k es la fracción de información original que conservarías si te quedaras con esos k ejes.

La comunalidad Para cada variable, la suma de sus cargas al cuadrado sobre los componentes retenidos indica qué proporción de su varianza queda recogida. Una variable con comunalidad < 0.50 está mal representada: o hacen falta más ejes, o esa variable no comparte estructura con las demás.
2 · Los criterios de retención, uno por uno

Kaiser–Guttman (λ > 1). Retiene los componentes que explican más varianza que una variable original estandarizada. Simple y universal, pero es el que más sobreestima: con p grande tiende a retener aproximadamente p/3 componentes aunque los datos sean puro ruido. Solo tiene sentido sobre la matriz de correlaciones; con covarianzas el equivalente es «λ mayor que el promedio de los λ».

Jolliffe (λ > 0.7). Versión relajada de Kaiser propuesta por Jolliffe al observar que el corte en 1 descartaba componentes útiles por variación muestral.

Gráfico de sedimentación / codo (Cattell, 1966). Se grafican los λ en orden y se busca el punto donde la caída se aplana: los componentes anteriores al codo son estructura, los posteriores son ruido. La app estima el codo con la máxima segunda diferencia (aceleración) de la curva, pero conviene mirarlo a ojo: es un criterio visual por naturaleza.

Varianza acumulada. Retener hasta alcanzar un porcentaje objetivo: 70–80 % en ciencias naturales, 60 % en ciencias sociales, más del 90 % si el ACP es un paso previo a una compresión o a una regresión. Nunca debe usarse como criterio único, porque siempre se puede alcanzar cualquier umbral añadiendo ejes.

Análisis paralelo de Horn (1965). Es hoy el criterio mejor evaluado en los estudios de simulación. La idea: generar muchas matrices de datos sin estructura del mismo tamaño (mismo n, mismo p), calcular sus valores propios y quedarse solo con los componentes cuyo λ observado supera el λ que produciría el azar. La app ofrece dos formas de generar esos datos:

  • Permutación de tus propios datos (opción por defecto): baraja cada columna por separado. Destruye la correlación entre variables pero conserva las distribuciones marginales reales y las varianzas, así que no supone normalidad y funciona igual con covarianzas que con correlaciones.
  • Datos normales aleatorios: la versión clásica de Horn, sobre matrices de correlación simuladas.

Se compara contra el percentil 95 de los λ aleatorios (criterio de Glorfeld), más estricto y estable que compararlos contra la media.

Bastón roto (broken stick, Frontier 1976). Si se parte un bastón de longitud 1 en p trozos al azar, la longitud esperada del trozo k-ésimo es b_k = (1/p) · Σ_{i=k..p} (1/i). Se retienen los componentes cuyo λ supere ese reparto aleatorio. Es conservador —suele retener menos ejes que los demás criterios— y es muy usado en ecología numérica.

MAP de Velicer (1976, revisado en 2000). Para cada número posible de componentes extraídos se calcula el promedio de las correlaciones parciales al cuadrado entre las variables una vez removidos esos componentes. Mientras se extrae varianza común, ese promedio baja; cuando se empieza a extraer varianza específica, vuelve a subir. Se retiene el número que da el mínimo. La versión con cuarta potencia (MAP4) es algo más precisa con muestras pequeñas.

Criterio de interpretabilidad. El último y el más importante: un componente que no se puede nombrar ni conectar con la teoría del problema no sirve para nada, cumpla o no los criterios numéricos.

Cómo decidir en la práctica Corre todos los criterios, mira dónde coinciden y elige el número dentro de ese rango que dé la solución más interpretable. En el artículo se reporta así: «se retuvieron k componentes con base en el análisis paralelo, el gráfico de sedimentación y la interpretabilidad, que en conjunto explican X % de la varianza».
Sobre el error estándar de λ La tabla incluye EE(λ) ≈ λ·√(2/(n−1)), la aproximación asintótica de Anderson. Solo es válida bajo normalidad multivariante y con valores propios bien separados; tómala como una referencia del orden de magnitud de la incertidumbre, no como un intervalo exacto. Si dos λ consecutivos difieren menos que su error estándar, el plano que forman es inestable y su orientación no debe interpretarse.
3 · Errores frecuentes en este paso
  • Usar solo el criterio de Kaiser y acabar con seis componentes de los cuales tres son ruido.
  • Retener tantos ejes que la varianza acumulada llegue al 95 % — eso ya no es reducir dimensiones.
  • Interpretar el plano 1–2 sin decir qué porcentaje explica.
  • Aplicar el corte λ > 1 a un ACP hecho sobre covarianzas, donde la varianza total no es p y el número 1 no significa nada.
  • Olvidar que el signo de cada componente es arbitrario: si tu CP1 sale invertido respecto a lo esperado, puedes multiplicarlo por −1 sin cambiar nada, solo hay que declararlo.

2.1 · Extraer los componentes

Se usará la matriz preparada en el Bloque 1.

La permutación no supone normalidad y respeta tus distribuciones reales.
Matrices aleatorias que se simulan para el percentil 95.

Rotación: teoría

Por qué rotar, qué método elegir y cómo se reporta.

1 · El problema que resuelve la rotación

Los ejes que salen del ACP maximizan varianza, no interpretabilidad. El resultado típico es que casi todas las variables cargan fuerte en el CP1 —porque ese eje recoge el «tamaño» o el nivel general del fenómeno— y los componentes siguientes quedan como contrastes difíciles de nombrar.

La rotación aprovecha un hecho geométrico: el subespacio de los k componentes retenidos representa la misma información sea cual sea la orientación de los ejes dentro de él. Se pueden girar esos ejes buscando una posición más interpretable sin perder nada.

Qué se conserva y qué cambia Se conserva: la varianza total explicada por el conjunto de los k componentes, y las comunalidades de cada variable.
Cambia: el reparto de la varianza entre los componentes, las cargas individuales, y el orden —tras rotar los ejes ya no van de mayor a menor λ, por eso aquí se renombran CPR1, CPR2…
2 · Estructura simple: el objetivo de Thurstone

Thurstone (1947) definió los criterios de la estructura simple, que siguen siendo el objetivo:

  1. Cada variable debe tener al menos una carga próxima a cero.
  2. Cada componente debe tener varias variables con carga próxima a cero.
  3. Para cada par de componentes, debe haber variables con carga alta en uno y nula en el otro.
  4. Con cuatro o más componentes, la mayoría de las variables deben tener carga nula en la mayoría de ellos.
  5. Los solapamientos (cargas altas en varios componentes) deben ser pocos.

La app mide qué tan cerca estás de ese ideal con tres indicadores:

  • Variables limpias: superan el umbral en un solo componente.
  • Cargas cruzadas: superan el umbral en dos o más. Son las que estropean la interpretación.
  • Complejidad de Hofmann: c = (Σa²)² / Σa⁴. Vale 1 si la variable carga en un único componente y crece hacia k si se reparte por igual entre todos. Una media por debajo de 1.3 indica una solución muy limpia.
3 · Rotaciones ortogonales: la familia ortomax

Mantienen los ejes perpendiculares, así que los componentes siguen sin correlacionarse. Todas maximizan el mismo criterio general con distinto parámetro γ:

Q(γ) = Σ a⁴ᵢⱼ − (γ/p) · Σⱼ ( Σᵢ a²ᵢⱼ )²
MétodoγQué simplificaCuándo usarla
Quartimax0Filas (variables) Cuando esperas un factor general y quieres que cada variable cargue en pocos ejes.
Varimax1Columnas (componentes) La opción por defecto. Da componentes bien diferenciados, cada uno con su grupo de variables.
Equamaxk/2Ambas Compromiso. Puede ser inestable con pocas variables o pocos componentes.
Parsimaxp(k−1)/(p+k−2)Ambas, con más peso Busca la máxima parsimonia global; poco frecuente pero bien fundamentada.

Varimax (Kaiser, 1958) maximiza la varianza de las cargas al cuadrado dentro de cada columna: empuja cada carga hacia 0 o hacia ±1. Es, con diferencia, la rotación más reportada en la literatura.

Normalización de Kaiser. Antes de rotar, cada fila de la matriz de cargas se divide entre su comunalidad (se lleva a longitud 1) y después se restaura. Así las variables mal representadas no pesan menos en la rotación. Es el comportamiento por defecto habitual en los programas de estadística, y aquí también.

4 · Rotaciones oblicuas: cuando los ejes pueden correlacionarse

Renuncian a la perpendicularidad. En fenómenos biológicos, ecológicos y sociales las dimensiones reales suelen estar relacionadas, así que forzar la ortogonalidad puede ser un artificio.

  • Quartimin — la oblicua más simple; oblimin con δ = 0.
  • Oblimin directo — familia general con parámetro δ: valores negativos producen ejes más próximos a la ortogonalidad, positivos los hacen más oblicuos. δ = 0 es el uso habitual y casi siempre suficiente.
  • Promax (Hendrickson y White, 1964) — parte de una solución varimax y eleva las cargas a una potencia κ (habitualmente 4) para exagerar el contraste entre altas y bajas; luego ajusta por mínimos cuadrados. Es muy rápida y la preferida con muestras grandes.
Con rotación oblicua se leen tres matrices Patrón: el coeficiente único de cada variable sobre cada componente, controlando los demás. Es la que se interpreta y la que se reporta.
Estructura: la correlación simple variable–componente. Incluye el efecto indirecto de los otros componentes, así que sus valores son más altos y menos «limpios».
Φ (phi): la matriz de correlaciones entre los propios componentes. Si todas sus correlaciones fuera de la diagonal son menores que ≈0.15, la oblicuidad no aportó nada y conviene volver a varimax; si superan 0.32 (10 % de varianza compartida), la rotación oblicua está claramente justificada.

Con rotación ortogonal patrón y estructura coinciden, y Φ es la identidad.

5 · ¿Es legítimo rotar componentes principales?

Es una pregunta razonable y conviene tenerla clara. La rotación nació en el análisis factorial, donde la orientación de los ejes es indeterminada por definición del modelo. En ACP los ejes sí están determinados: son las direcciones de máxima varianza.

Al rotar componentes principales se pierden dos propiedades: los componentes dejan de maximizar varianza individualmente y dejan de estar ordenados por λ. Lo que sí se conserva es la varianza total del subconjunto retenido y las comunalidades.

La práctica está muy extendida y es aceptada —los principales programas de estadística la ofrecen por defecto— siempre que se declare con claridad. Fórmula habitual en la sección de métodos:

«Se realizó un análisis de componentes principales sobre la matriz de correlaciones. Se retuvieron k componentes con base en el análisis paralelo y el gráfico de sedimentación, que explican X % de la varianza. Sobre ellos se aplicó una rotación varimax con normalización de Kaiser. Se interpretaron las cargas con |a| ≥ 0.40.»
Si tu objetivo es reducir dimensiones para otro análisis (una regresión, un clustering) probablemente no debas rotar: los componentes sin rotar son ortogonales y están ordenados, que es justo lo que necesita el análisis siguiente. Rota cuando el objetivo es interpretar las dimensiones.
6 · Cómo elegir el umbral de las cargas

Una carga solo se interpreta si supera un umbral. Criterios de uso común:

  • 0.30 — mínimo para considerarla; explica un 9 % de la varianza de la variable.
  • 0.40 — el más habitual; el que trae la app por defecto.
  • 0.50 — prácticamente significativa; la variable comparte un 25 % con el componente.
  • 0.55–0.75 — necesario con muestras pequeñas (ver la tabla de Hair del Bloque 1, sección 5).

El umbral debe fijarse antes de mirar los resultados y declararse en el reporte. Cambiarlo hasta que la solución «se vea bien» es una forma de sobreajuste.

3.1 · Elegir la rotación

Fíjalo antes de mirar los resultados.
Iguala el peso de las variables durante la rotación. Es el comportamiento habitual de los programas de estadística.

Mapas factoriales: teoría

Cómo se construye cada gráfico y, sobre todo, cómo se lee sin equivocarse.

1 · Las dos nubes: individuos y variables

Un ACP produce dos representaciones distintas del mismo análisis, y se leen con reglas diferentes. Confundirlas es el error más común al interpretar un ACP.

Nube de individuosNube de variables
Qué se dibujaUn punto por observaciónUn vector por variable
CoordenadaPuntuación (score) sobre el ejeCarga = correlación con el eje
Qué se leeDistancias entre puntos: dos individuos próximos tienen perfiles parecidos Ángulos entre vectores respecto al origen
EscalaLa de las puntuaciones (varía por eje)Siempre entre −1 y 1

Reglas de lectura del círculo de correlaciones:

  • Vectores que apuntan en la misma dirección (ángulo pequeño): variables correlacionadas positivamente.
  • Vectores opuestos (ángulo de 180°): correlación negativa.
  • Vectores perpendiculares (90°): variables no correlacionadas en ese plano.
  • Vectores largos, cerca del círculo unitario: la variable está bien representada en el plano. Un vector corto no significa que la variable sea poco importante, sino que su información está en otros ejes; no interpretes su dirección.
2 · cos² y contribuciones: las dos medidas que evitan malinterpretar

cos² (coseno al cuadrado) — calidad de representación. Es el cuadrado del coseno del ángulo entre el punto y el eje; equivale a la proporción de la información de ese elemento que el eje recoge:

cos²(i, k) = coord²(i,k) / d²(i, centroide)

Para las variables, con ACP sobre correlaciones, cos² = carga². Sumado sobre todos los ejes da 1. Interpretación: cos² ≥ 0.7 muy buena, 0.5–0.7 aceptable, 0.3–0.5 pobre, < 0.3 no interpretable en ese plano. Un punto con cos² bajo está mal proyectado: aparece en el mapa donde no le corresponde.

Contribución — cuánto pesa el elemento en la construcción del eje.

contrib(i, k) = 100 · coord²(i,k) / Σᵢ coord²(i,k)

Suma 100 % por eje. La referencia es el valor esperado si todos contribuyeran por igual: 100/p para variables y 100/n para individuos (la línea roja de la figura de contribuciones). Los elementos por encima de esa línea son los que definen el eje.

No son lo mismo Una variable puede tener cos² alto y contribución baja (está bien representada, pero el eje lo definen otras) o contribución alta y cos² bajo —caso raro y sospechoso, típico de un atípico que arrastra el eje—. Reporta las dos.
3 · El biplot y su escala

El biplot (Gabriel, 1971) superpone las dos nubes en un solo gráfico. Es el más informativo y el más fácil de sobreinterpretar, porque individuos y variables viven en escalas distintas y hay que multiplicar los vectores por un factor arbitrario para que se vean juntos. Ese factor no tiene significado estadístico: por eso aquí es un control deslizante, no un número fijo.

Lo que sí se puede leer en un biplot:

  • La proyección de un individuo sobre la dirección de una variable estima su valor en ella: si un punto cae lejos, en el sentido de la flecha, ese individuo tiene valores altos en esa variable.
  • Los grupos de individuos que se sitúan en la dirección de un grupo de variables se caracterizan por ellas.

Lo que no se debe leer: la longitud absoluta de las flechas comparada con la distancia entre puntos, ni distancias entre un punto y una punta de flecha.

4 · Elipses: cuál dibujar y qué significa cada una

Las elipses resumen dónde cae cada grupo, pero responden a preguntas distintas y confundirlas cambia por completo la conclusión.

TipoQué encierraCuándo usarla
Elipse de concentración
(de los datos)
Aproximadamente el 95 % de las observaciones del grupo, bajo normalidad bivariante. Su tamaño no depende de n. Para describir la dispersión y el solapamiento real entre grupos. Es la opción por defecto aquí.
Elipse de confianza de la media La región donde está el centroide del grupo con un 95 % de confianza. Es √n veces más pequeña. Para argumentar que dos grupos difieren en promedio. Con n grande se vuelve diminuta.
Envolvente convexa El polígono mínimo que contiene todos los puntos del grupo. No supone ninguna distribución. Cuando los grupos no son elípticos o hay pocos individuos.
Cuidado con la conclusión Que dos elipses de confianza de la media no se solapen sugiere que los centroides difieren, pero no es una prueba estadística: para eso hace falta un MANOVA, un PERMANOVA o un análisis discriminante. Y que dos elipses de concentración se solapen mucho significa que los grupos no se separan bien en ese plano, aunque sus medias difieran.

Recuerda además que el ACP no busca separar grupos: es una técnica no supervisada que ignora la variable de agrupación. Si tu objetivo es discriminar, la herramienta es el análisis discriminante o el PLS-DA.

5 · Elementos suplementarios

Las variables que marcaste como suplementarias en el Bloque 1 no intervinieron en el cálculo de los ejes, pero se proyectan ahora sobre ellos:

  • Cuantitativas suplementarias: su coordenada sobre cada eje es simplemente su correlación con las puntuaciones de ese eje. Aparecen en el círculo con trazo discontinuo. Sirven para «etiquetar» los ejes con variables de resultado sin dejar que los definan.
  • Categorías suplementarias: cada nivel se sitúa en el centroide (la media) de los individuos que lo comparten. Una categoría alejada del origen caracteriza esa zona del plano.

Es la forma correcta de responder a «¿se separan mis tratamientos?» sin contaminar el análisis: los ejes se construyen solo con las mediciones, y el factor se proyecta después.

6 · Convenciones al publicar una figura de ACP
  • Los rótulos de los ejes siempre con el porcentaje de varianza: «CP1 (41.2 %)».
  • Declara si la solución está rotada y con qué método.
  • Indica el tipo de elipse y su nivel de confianza en el pie de figura.
  • El signo de un eje es arbitrario: puedes invertirlo para que la lectura sea más natural, pero decláralo.
  • Usa una paleta apta para daltónicos si la figura va a impresión (Okabe–Ito está disponible en el editor).
  • Exporta en SVG si la revista lo acepta; si pide mapa de bits, mínimo 300 ppp (opción 4×) y preferiblemente 600 ppp (8×).

4.1 · Construir los mapas

Si no aplicaste rotación, se usa la solución original.
Colorea individuos y dibuja elipses. Se toma de las columnas marcadas como cualitativas en el Bloque 1.

Interpretación: teoría

De los números a las frases: cómo se nombra un eje, cómo se caracteriza y hasta dónde se puede llegar sin salirse de lo que el ACP permite afirmar.

1 · Qué significa «interpretar» un componente

Un componente es una combinación lineal; por sí mismo no significa nada. Interpretarlo es encontrar el concepto de tu disciplina que explica por qué esas variables varían juntas, y darle un nombre. El procedimiento estándar:

  1. Mira las variables con |carga| por encima del umbral que fijaste (aquí, el mismo del Bloque 3).
  2. Separa las de carga positiva de las de carga negativa. Si hay de ambos signos, el eje es un contraste: opone dos conjuntos de características, no mide «más o menos» de una sola cosa.
  3. Busca qué tienen en común: ¿tamaño?, ¿velocidad de crecimiento?, ¿estrategia adquisitiva frente a conservativa?, ¿un gradiente ambiental?
  4. Ponle un nombre corto y sustantivo. Si no consigues nombrarlo, ese componente probablemente no deba retenerse, por muchos criterios numéricos que lo respalden.
  5. Confirma el nombre con los elementos suplementarios y con los individuos extremos: ¿los que están en el lado positivo son los que tu conocimiento del sistema esperaría?
El signo es arbitrario Puedes invertir un eje para que la lectura sea más natural (por ejemplo, que «grande» quede a la derecha). Solo hay que declararlo. Lo que no puedes es invertirlo en una figura y no en otra.
2 · El valor test (v.test): cómo se caracteriza un eje con categorías

Es el estadístico de la escuela francesa de análisis de datos, el que se usa en la descripción automática de dimensiones (Lebart et al., 2006). Responde a: ¿el centroide de esta categoría está más lejos del origen de lo que cabría esperar por azar?

v = ( x̄_categoría − x̄_global ) / √[ (s² / n_q) · (N − n_q)/(N − 1) ]

Bajo la hipótesis nula de que los n_q individuos de la categoría son una muestra al azar del total, v se distribuye aproximadamente como una normal estándar. Por tanto:

  • |v| ≥ 1.96 → la categoría se sitúa significativamente a un lado del eje (p < 0.05).
  • |v| ≥ 2.58 → p < 0.01.
  • El signo indica de qué lado del eje cae la categoría.

Es especialmente útil porque convierte «el Sitio C está a la derecha» en una afirmación cuantificada, y porque se puede ordenar: las categorías con |v| más alto son las que mejor caracterizan el eje.

3 · ¿Los grupos difieren en los componentes? — y la trampa de la circularidad

Una vez tienes las puntuaciones, es natural comparar los grupos sobre cada eje con un ANOVA de una vía. La app lo hace y añade el tamaño del efecto, que importa más que el valor p:

  • η² (eta cuadrada) = proporción de la varianza del componente explicada por el factor. Referencias de Cohen: 0.01 pequeño, 0.06 medio, 0.14 grande.
  • ω² (omega cuadrada) es una versión menos sesgada de lo mismo; con n pequeña conviene reportarla.
  • Se incluye además el Kruskal–Wallis, que no supone normalidad, por si las puntuaciones son asimétricas o hay grupos muy desiguales.
La advertencia importante Estos contrastes son legítimos porque el ACP no usó la variable de agrupación para construir los ejes: los componentes se calcularon solo con las variables activas. Pero sí hay dos límites que declarar:
• Estás haciendo k pruebas (una por componente) sin corrección por comparaciones múltiples.
• Los ejes fueron elegidos a posteriori por maximizar varianza, así que el p-valor es optimista.
Úsalos como descripción. Si tu pregunta de investigación es «¿difieren los grupos?», la respuesta correcta es un MANOVA, un PERMANOVA o un análisis discriminante sobre las variables originales.

Lo mismo vale para los valores p de las correlaciones variable–eje: los ejes se construyeron con esas variables, así que esas pruebas son circulares. Están ahí como ayuda de lectura, no como evidencia.

4 · Calidad del ajuste: matriz reproducida y RMSR

Los k componentes retenidos permiten reconstruir la matriz de correlaciones original:

R̂ = A · Aᵀ (rotación ortogonal o sin rotar) R̂ = P · Φ · Pᵀ (rotación oblicua)

La diferencia entre lo observado y lo reproducido son los residuos. Su resumen es el RMSR (residuo cuadrático medio, sobre los elementos fuera de la diagonal):

RMSR = √( Σ residuo²ᵢⱼ / [p(p−1)/2] ) (i < j)
  • RMSR < 0.05 — ajuste bueno; los componentes retenidos reproducen bien la estructura.
  • 0.05 – 0.08 — aceptable.
  • > 0.08 — se está perdiendo estructura: considera retener un componente más.

Regla complementaria muy usada: que menos del 10 % de los residuos superen 0.05 en valor absoluto. Un par concreto con residuo grande señala dos variables cuya relación no queda recogida por ningún eje.

5 · Cómo se escriben los resultados

La sección de resultados de un ACP suele tener esta estructura, y la app te genera un borrador con tus propios números al final del bloque:

  1. Adecuación: n, p, KMO, Bartlett, tratamiento de faltantes y escalado.
  2. Extracción: cuántos componentes, con qué criterio, y qué porcentaje explican.
  3. Rotación: método y normalización, si se usó.
  4. Interpretación: cada componente con su porcentaje, sus variables marcadoras y su nombre.
  5. Ajuste: RMSR o comunalidades.
  6. Figuras: círculo de correlaciones y mapa de individuos, con el porcentaje en los rótulos de eje.

Errores frecuentes al redactar: llamar «factores» a los componentes (son cosas distintas), decir que un componente «explica» una variable cuando la relación es descriptiva, afirmar que el ACP «demostró» que los grupos difieren, y omitir el preprocesamiento.

5.1 · Configuración

Ejecuta un ANOVA y un Kruskal–Wallis por componente.

Agrupamiento sobre los componentes: teoría

El análisis factorial ordena a los individuos en un espacio continuo. Agruparlos es una operación distinta y opcional: convierte esa nube en un pequeño número de clases con nombre.

1 · Por qué agrupar sobre los ejes y no sobre las variables

El HCPC —hierarchical clustering on principal components, de Husson, Josse y Pagès— agrupa sobre las coordenadas factoriales, no sobre la tabla original. Hay dos razones y las dos son prácticas:

  • Quita el ruido. Los ejes que no retuviste son, en su mayor parte, variación sin estructura. Agrupar sobre los primeros ejes es agrupar sobre una versión limpia de la tabla.
  • Unifica los tipos de dato. Sobre las coordenadas de un ACM o de un AFDM se puede usar la distancia euclídea aunque las variables originales sean cualitativas. Sin ese paso previo habría que elegir un coeficiente de similitud entre las decenas que existen, y esa elección cambia el resultado.
Cuántos ejes Pocos ejes suavizan demasiado y fabrican grupos limpios que no están en los datos; demasiados devuelven el ruido. La costumbre es usar los mismos que retuviste en el bloque 2.
2 · El criterio de Ward

En cada paso se unen los dos grupos cuya fusión menos inercia intra añade. El coste de unir A con B es

Δ(A, B) = [wA · wB / (wA + wB)] · d²(gA, gB)

con g los centros y w las masas. Es la altura a la que aparece la fusión en el dendrograma: una rama alta significa que unir esos dos grupos costó caro, es decir, que eran distintos.

Ward es el criterio natural aquí porque habla el mismo idioma que el análisis factorial: los dos reparten la inercia total entre una parte intra y una parte entre. La inercia entre grupos dividida por la total es la proporción de la nube que la partición explica.

3 · Cuántos grupos

No existe una respuesta única, igual que con el número de componentes. Se calculan tres reglas y se muestra si coinciden:

  • Mayor salto de altura. El corte se pone donde la siguiente fusión sería desproporcionadamente cara.
  • Mayor pérdida relativa de inercia. La misma idea, pero relativa a la altura anterior; es la regla que usan Husson y Josse y la que decide cuando las tres discrepan.
  • Máxima silueta media. Para cada individuo compara su distancia media a los suyos con la distancia media al grupo vecino más próximo. Por encima de 0.5 la estructura es clara; por debajo de 0.25 no hay estructura que reportar, y conviene decirlo.
Cuando discrepan Elegir un número distinto del consenso es legítimo si tienes una razón de tu disciplina. Lo que no es legítimo es presentar la partición como si el número hubiera salido de los datos.
4 · La consolidación por k-medias

El árbol tiene una limitación: una fusión, una vez hecha, no se deshace. Un individuo que quedó del lado equivocado en un paso temprano se queda ahí. La consolidación arregla eso: partiendo de los centros del corte, reasigna cada individuo al centro más cercano y repite hasta que nadie se mueva.

Nunca empeora la inercia intra —si lo hiciera sería un error de programación, y la suite de pruebas lo comprueba—. A cambio, la partición final puede dejar de coincidir con el dendrograma: si algún individuo cambió de grupo, el árbol y el mapa discrepan en esos casos y aquí se te avisa de cuántos son.

5 · Cómo se describe un grupo

Un grupo se describe diciendo en qué se aparta del conjunto. El valor test mide ese apartamiento en desviaciones típicas, bajo el modelo de que los individuos del grupo se hubieran sacado al azar y sin reemplazo del total. Por encima de |1.96| la diferencia no se explica por ese reparto al azar.

Además se dan dos clases de individuos:

  • Paragones: los más cercanos al centro de su grupo. Son los ejemplares típicos, los que enseñarías para explicar qué es ese grupo.
  • Individuos específicos: los más alejados de todos los demás centros. Son los que menos se confunden con otro grupo, útiles cuando hay que elegir casos para un estudio de seguimiento.
6 · Lo que un agrupamiento no demuestra

El algoritmo siempre devuelve grupos, también sobre datos sin ninguna estructura. Tres cautelas que conviene tener escritas antes de mirar el resultado:

  • Los valores test describen la partición, no la ponen a prueba. Los grupos se construyeron precisamente para maximizar esas diferencias, así que presentarlos como contrastes de hipótesis es circular.
  • Una silueta baja con una inercia entre grupos alta significa que la partición reparte bien la varianza pero que los grupos no están separados: la nube es continua y la has cortado en rebanadas.
  • Si los grupos coinciden con una variable que ya conocías —el tratamiento, la especie, el sitio—, eso no es un descubrimiento del agrupamiento: compruébalo con esa variable como suplementaria y dilo así.

5b.1 · Configuración del agrupamiento

Informe y exportación

Reúne todo lo hecho en los cinco bloques anteriores en un documento único y en un paquete de archivos listo para archivar o compartir.

Qué produce este bloque
  • Informe en HTML autocontenido: portada, métodos redactados automáticamente con tus propios parámetros, tablas con formato de publicación, las figuras tal como las editaste (vectoriales, incrustadas en el propio archivo), interpretación, limitaciones y referencias. Un solo archivo, sin dependencias: se abre en cualquier navegador y se puede enviar por correo.
  • PDF: el informe trae hoja de estilo de impresión (evita cortar tablas y figuras a mitad de página). Usa el botón de imprimir y elige «Guardar como PDF» en el diálogo del navegador.
  • Paquete ZIP completo: el informe, todas las figuras en el formato y la resolución que elijas, y hasta 14 tablas de resultados en CSV, organizados en carpetas.
Las figuras van como las dejaste El informe no regenera las figuras con los valores por defecto: toma el estado actual de cada una, con los colores, títulos, paletas y opciones que hayas cambiado en el editor de cada bloque. Si quieres cambiar algo, vuelve al bloque correspondiente, ajústalo y regenera el informe.
Antes de enviarlo a una revista El borrador de métodos y resultados es un punto de partida, no un texto final: revísalo, ajusta la terminología a tu disciplina y comprueba que las afirmaciones se correspondan con lo que quieres sostener. Y recuerda las limitaciones del Bloque 5: el ACP describe, no contrasta hipótesis.

6.1 · Estado del análisis

Solo se incluirán en el informe los bloques que hayas ejecutado.

    6.2 · Configuración del informe

    Secciones a incluir

    Figuras

    A 8× o 12× el paquete puede pesar varios cientos de MB si hay muchas figuras.

    6.4 · Cómo citar PCAPro

    Si publicas resultados obtenidos con esta plataforma, cita el software. La misma referencia va en el informe generado y en el archivo CITATION.bib del paquete ZIP.

    Cómo citar PCAPro

    Si publicas resultados obtenidos con esta plataforma, cita el software.