A method-selection chapter for determining whether variables depart from independence. It compares classical contingency methods, exact inference, information-based dependence, kernel dependence, and distance-based dependence.
Un capítulo de selección de métodos para determinar si las variables se apartan de la independencia. Compara métodos clásicos de contingencia, inferencia exacta, dependencia basada en información, dependencia kernel y dependencia basada en distancias.
Module III principlePrincipio del Módulo IIIDependence is selected from the ESS question and variable architecture—not inferred from familiarity with one statistical test.La dependencia se selecciona desde la pregunta del ESS y la arquitectura de variables, no desde la familiaridad con una sola prueba estadística.
Module progress · Chapter 2 of 9Progreso del módulo · Capítulo 2 de 9
Black-box rule of the chapter
Regla de caja negra del capítulo
Assume that an ESS has declared dependence evidence as Required or eligible Conditional for an explicit X–Y, group–Y, or set-to-set relationship.Asumir que un ESS declaró evidencia de dependencia como Requerida o Condicional elegible para una relación explícita X–Y, grupo–Y o conjunto–conjunto.
The chapter does not yet know the domain or implementation. Its task is to select a method capable of evaluating whether the observed joint structure is compatible with independence, while respecting variable type, sample size, dimensionality, sparsity, nonlinear form, and inference requirements.
El capítulo todavía no conoce el dominio ni la implementación. Su tarea es seleccionar un método capaz de evaluar si la estructura conjunta observada es compatible con independencia, respetando tipo de variable, tamaño muestral, dimensionalidad, escasez, forma no lineal y requisitos inferenciales.
Boundary: dependence means that knowing one variable changes the probabilistic description of another. It does not establish direction, mechanism, prediction quality, or causality.Frontera: dependencia significa que conocer una variable cambia la descripción probabilística de otra. No establece dirección, mecanismo, calidad predictiva ni causalidad.
Chapter learning objectives
Objetivos de aprendizaje del capítulo
Define dependence evidenceDefinir evidencia de dependenciaSeparate independence testing from association-form measurement.Separar prueba de independencia de medición de una forma asociativa.
Recognize eligible structuresReconocer estructuras elegiblesDistinguish categorical, sparse, nonlinear, kernel, distance, and multivariate cases.Distinguir casos categóricos, escasos, no lineales, kernel, de distancia y multivariados.
Interpret evidence responsiblyInterpretar evidencia responsablementeSeparate test significance, dependence magnitude, uncertainty, and practical relevance.Separar significancia de prueba, magnitud de dependencia, incertidumbre y relevancia práctica.
Select conditionallySeleccionar condicionalmenteChoose the best method for the specific ESS structure rather than a universal winner.Elegir el mejor método para la estructura específica del ESS y no un ganador universal.
1. What does it mean to produce dependence evidence?
1. ¿Qué significa producir evidencia de dependencia?
Producing dependence evidence means evaluating whether the joint distribution of variables can be represented as the product of their marginal distributions, or whether knowledge of one changes the distributional uncertainty of the other.
Producir evidencia de dependencia significa evaluar si la distribución conjunta de las variables puede representarse como el producto de sus distribuciones marginales o si conocer una cambia la incertidumbre distributiva de la otra.
Independence questionPregunta de independenciaIs the observed joint structure compatible with independence?¿La estructura conjunta observada es compatible con independencia?
General formForma generalCan dependence be nonlinear, non-monotonic, or multivariate?¿La dependencia puede ser no lineal, no monótona o multivariada?
Conditional structureEstructura condicionalDoes dependence persist within relevant segments or conditions?¿La dependencia persiste dentro de segmentos o condiciones relevantes?
MagnitudeMagnitudHow far is the system from independence under the selected measure?¿Qué tan lejos está el sistema de la independencia bajo la medida seleccionada?
UncertaintyIncertidumbreCould the observed departure arise from finite-sample variation?¿La desviación observada podría surgir por variación muestral finita?
StabilityEstabilidadDoes the dependence survive resampling and reasonable preprocessing?¿La dependencia sobrevive remuestreo y preparación razonable?
2. Dependence versus association
2. Dependencia frente a asociación
DimensionDimensión
AssociationAsociación
DependenceDependencia
Primary questionPregunta primaria
What specified joint pattern exists?¿Qué patrón conjunto especificado existe?
Is independence violated?¿Se viola la independencia?
FormForma
Often linear, monotonic, binary, or nominal.A menudo lineal, monótona, binaria o nominal.
Potentially arbitrary nonlinear, non-monotonic, and multivariate.Potencialmente arbitraria, no lineal, no monótona y multivariada.
DirectionDirección
Some measures provide positive or negative direction.Algunas medidas proporcionan dirección positiva o negativa.
General dependence measures are frequently non-directional.Las medidas generales de dependencia suelen ser no direccionales.
Zero resultResultado cero
May mean absence of the specified form only.Puede significar ausencia solamente de la forma especificada.
For some measures, zero corresponds to independence at population level.Para algunas medidas, cero corresponde a independencia a nivel poblacional.
3. What does dependence evidence require?
3. ¿Qué requiere la evidencia de dependencia?
RequirementRequisito
Why it mattersPor qué importa
Explicit independence hypothesisHipótesis explícita de independencia
The method must test or measure a clearly defined joint structure.El método debe probar o medir una estructura conjunta claramente definida.
Variable-type architectureArquitectura de tipos de variables
Categorical tables, continuous spaces, mixed data, and vectors require different methods.Tablas categóricas, espacios continuos, datos mixtos y vectores requieren métodos distintos.
Sample and sparsity supportSoporte muestral y escasez
Expected cell counts and high-dimensional structures strongly affect validity.Conteos esperados y estructuras de alta dimensión afectan fuertemente la validez.
Distance or kernel definitionDefinición de distancia o kernel
General dependence methods inherit meaning from their representation of similarity.Métodos generales de dependencia heredan significado de su representación de similitud.
Permutation or exact inference planPlan de inferencia exacta o por permutación
Classical asymptotic approximations may be unreliable in sparse or complex settings.Aproximaciones asintóticas clásicas pueden ser poco fiables en escenarios escasos o complejos.
Magnitude measureMedida de magnitud
Rejecting independence does not quantify practical dependence strength by itself.Rechazar independencia no cuantifica por sí mismo la fuerza práctica de dependencia.
Multiple-testing controlControl de pruebas múltiples
Large dependence screens can produce false discoveries without correction.Exploraciones masivas pueden producir falsos descubrimientos sin corrección.
4. Method-selection map by dependence configuration
4. Mapa de selección por configuración de dependencia
Categorical × categorical; small or sparse tableCategórica × categórica; tabla pequeña o escasa
Fisher Exact
General uncertainty-sharing dependenceDependencia general por incertidumbre compartida
Mutual Dependence / information-based dependence
Complex nonlinear dependence with kernel representationDependencia no lineal compleja con representación kernel
HSIC
Continuous or vector-valued general dependenceDependencia general continua o vectorial
Distance Covariance
High-dimensional candidate screeningExploración de candidatos en alta dimensión
HSIC or Distance Covariance with permutation and correction
Terminology note: the Word pattern names “Mutual Dependence.” In this chapter it is treated as the information-based family that measures shared uncertainty; Module III must specify the exact estimator before implementation.Nota terminológica: el Word patrón denomina “Mutual Dependence”. En este capítulo se trata como la familia basada en información que mide incertidumbre compartida; el Módulo III debe especificar el estimador exacto antes de implementar.
5. Standard method card
5. Ficha estándar del método
Method Name
Scientific Purpose
Evidence Produced
Best Evidence Configuration
Data Requirements
Supported Variable Types
Strengths
Weaknesses
Assumptions
Limitations
Computational Cost
Interpretability
Robustness
Critical Parameters
Validation Metrics
Acceptance Interpretation
Failure Modes
Complementary Methods
Module III Selection Status
6. Chi-Square test of independence
6. Prueba Chi-Cuadrado de independencia
Scientific purposePropósito científico
Evaluate whether two categorical variables are compatible with independence in a contingency table.Evaluar si dos variables categóricas son compatibles con independencia en una tabla de contingencia.
Evidence producedEvidencia producida
A discrepancy statistic comparing observed and expected counts under independence.Un estadístico de discrepancia que compara conteos observados y esperados bajo independencia.
Best configurationMejor configuración
Nominal or ordinal categorical variables with adequate expected cell counts.Variables categóricas nominales u ordinales con conteos esperados adecuados.
StrengthsFortalezas
General contingency-table applicability, familiar inference, and transparent residual decomposition.Aplicabilidad general a tablas de contingencia, inferencia familiar y descomposición transparente por residuos.
WeaknessesDebilidades
Significance grows with sample size and does not itself provide dependence magnitude or direction.La significancia crece con el tamaño muestral y no proporciona por sí sola magnitud ni dirección.
AssumptionsSupuestos
Independent observational units, mutually exclusive categories, and adequate expected counts for the asymptotic approximation.Unidades independientes, categorías mutuamente excluyentes y conteos esperados adecuados para aproximación asintótica.
RobustnessRobustez
Moderate when cell support is adequate; low in sparse high-dimensional tables.Moderada con soporte adecuado de celdas; baja en tablas escasas de alta dimensión.
Acceptance interpretationInterpretación de aceptación
A small p-value challenges independence, but practical strength must be evaluated separately.Un valor p pequeño cuestiona independencia, pero la fuerza práctica debe evaluarse por separado.
Failure modesModos de fallo
Sparse cells, duplicated units, excessive categories, hidden pairing, and treating significance as importance.Celdas escasas, unidades duplicadas, categorías excesivas, pareamiento oculto y tratar significancia como importancia.
Evaluate categorical independence using an exact conditional distribution, especially in small or sparse tables.Evaluar independencia categórica mediante una distribución condicional exacta, especialmente en tablas pequeñas o escasas.
Evidence producedEvidencia producida
Exact tail probability for the observed table under the independence null and fixed margins.Probabilidad exacta de cola para la tabla observada bajo independencia y márgenes fijos.
Best configurationMejor configuración
2×2 tables and small or sparse contingency structures.Tablas 2×2 y estructuras de contingencia pequeñas o escasas.
StrengthsFortalezas
Avoids unreliable large-sample approximations and remains valid with low expected counts.Evita aproximaciones asintóticas poco fiables y permanece válida con conteos esperados bajos.
WeaknessesDebilidades
Can be computationally demanding for larger tables and may be conservative depending on formulation.Puede ser costosa para tablas mayores y conservadora según la formulación.
AssumptionsSupuestos
Independent units, meaningful contingency structure, and an exact-conditioning interpretation appropriate to the design.Unidades independientes, estructura de contingencia significativa e interpretación de condicionamiento exacto apropiada al diseño.
RobustnessRobustez
High for small categorical samples when the design matches its conditioning logic.Alta para muestras categóricas pequeñas cuando el diseño corresponde con su lógica de condicionamiento.
Critical outputsSalidas críticas
Exact p-value, table counts, odds-ratio companion when relevant, confidence interval.
Failure modesModos de fallo
Large table computation, unclear one-sided alternatives, matched data treated as independent, and reporting significance without effect size.Cómputo en tablas grandes, alternativas unilaterales poco claras, datos pareados tratados como independientes y reportar significancia sin tamaño de efecto.
8. Mutual Dependence — familia basada en información
Scientific purposePropósito científico
Quantify how much uncertainty about one variable is reduced by knowledge of another.Cuantificar cuánto se reduce la incertidumbre sobre una variable al conocer otra.
Evidence producedEvidencia producida
A nonnegative information-based measure of shared structure; zero corresponds to independence at population level for mutual-information formulations.Una medida informacional no negativa de estructura compartida; cero corresponde a independencia poblacional en formulaciones de información mutua.
Best configurationMejor configuración
Categorical, continuous, or mixed relationships where general nonlinear dependence is relevant and a suitable estimator exists.Relaciones categóricas, continuas o mixtas donde importa dependencia no lineal general y existe un estimador adecuado.
StrengthsFortalezas
Broad sensitivity to dependence and natural connection to uncertainty reduction.Amplia sensibilidad a dependencia y conexión natural con reducción de incertidumbre.
WeaknessesDebilidades
Estimator choice, scaling, discretization, and bias strongly affect finite-sample results.Elección del estimador, escala, discretización y sesgo afectan fuertemente resultados finitos.
AssumptionsSupuestos
A defensible probability or density representation and sufficient sample support for the chosen estimator.Una representación probabilística o de densidad defendible y soporte muestral suficiente para el estimador elegido.
Computational costCosto computacional
Low to high depending on discrete counts, binning, nearest-neighbor, kernel, or model-based estimation.Bajo a alto según estimación por conteos discretos, bins, vecinos, kernel o modelos.
RobustnessRobustez
Conditional on estimator stability; resampling and sensitivity to representation are mandatory.Condicionada a estabilidad del estimador; remuestreo y sensibilidad a representación son obligatorios.
Critical outputsSalidas críticas
Estimator definition, information units, bias correction, uncertainty, permutation baseline.
Failure modesModos de fallo
Small samples, arbitrary discretization, dimensionality, estimator mismatch, and comparing non-normalized values across incompatible settings.Muestras pequeñas, discretización arbitraria, dimensionalidad, estimador incompatible y comparar valores no normalizados entre escenarios incompatibles.
Complementary methodsMétodos complementarios
HSIC, Distance Covariance, form-specific association methods.
9. Hilbert-Schmidt Independence Criterion (HSIC)
9. Criterio de Independencia Hilbert-Schmidt (HSIC)
Scientific purposePropósito científico
Detect general dependence by comparing embedded joint structure with the product of embedded marginals in reproducing-kernel spaces.Detectar dependencia general comparando la estructura conjunta embebida con el producto de marginales embebidas en espacios kernel.
Evidence producedEvidencia producida
A nonnegative kernel-based dependence statistic, commonly evaluated by permutation or asymptotic inference.Un estadístico no negativo de dependencia basado en kernel, comúnmente evaluado por permutación o inferencia asintótica.
Best configurationMejor configuración
Complex nonlinear relationships, structured objects, and multivariate inputs with meaningful kernels.Relaciones no lineales complejas, objetos estructurados y entradas multivariadas con kernels significativos.
StrengthsFortalezas
Broad dependence sensitivity and flexibility through kernel choice.Amplia sensibilidad a dependencia y flexibilidad mediante elección de kernel.
WeaknessesDebilidades
Kernel and bandwidth choices affect power and interpretation; the statistic has limited direct substantive meaning.Elección de kernel y ancho afecta potencia e interpretación; el estadístico tiene significado sustantivo directo limitado.
AssumptionsSupuestos
Independent units, appropriate characteristic kernels, and defensible scaling or preprocessing.Unidades independientes, kernels característicos apropiados y escalamiento o preparación defendible.
Computational costCosto computacional
Potentially high because standard kernel matrices scale quadratically with sample size.Potencialmente alto porque matrices kernel estándar escalan cuadráticamente con tamaño muestral.
RobustnessRobustez
Moderate to high when kernel choice, bandwidth, outliers, and resampling stability are validated.Moderada a alta cuando se validan kernel, ancho, valores extremos y estabilidad por remuestreo.
Poor scaling, unsuitable kernels, bandwidth extremes, high computational burden, and multiple-testing inflation.Escalamiento deficiente, kernels inadecuados, anchos extremos, alta carga computacional e inflación por pruebas múltiples.
Measure general dependence between random vectors through centered pairwise distances.Medir dependencia general entre vectores aleatorios mediante distancias pareadas centradas.
Evidence producedEvidencia producida
A nonnegative distance-based quantity that is zero under independence at population level under standard conditions.Una cantidad no negativa basada en distancias que es cero bajo independencia poblacional en condiciones estándar.
Best configurationMejor configuración
Continuous scalar or vector-valued variables with potentially nonlinear dependence.Variables continuas escalares o vectoriales con dependencia potencialmente no lineal.
StrengthsFortalezas
General dependence detection, multivariate support, and direct connection to Distance Correlation.Detección general de dependencia, soporte multivariado y conexión directa con Correlación de Distancias.
WeaknessesDebilidades
No positive/negative direction, sensitivity to scaling and outliers, and higher computational cost.Sin dirección positiva/negativa, sensibilidad a escalamiento y valores extremos y mayor costo computacional.
AssumptionsSupuestos
Meaningful distance geometry, finite moment conditions for classical formulations, and independent observational units.Geometría de distancias significativa, condiciones de momentos finitos en formulaciones clásicas y unidades independientes.
Computational costCosto computacional
Moderate to high in standard pairwise-distance implementations.Moderado a alto en implementaciones estándar de distancias pareadas.
RobustnessRobustez
Moderate; requires scaling, outlier, dimensionality, and permutation diagnostics.Moderada; requiere diagnósticos de escala, valores extremos, dimensionalidad y permutación.
Incompatible units, extreme observations, noisy high dimensions, unsuitable distance, and interpreting non-directional dependence as signed association.Unidades incompatibles, observaciones extremas, alta dimensión ruidosa, distancia inadecuada e interpretar dependencia no direccional como asociación con signo.
11. Conditional ranking of the top dependence methods
11. Ranking condicional de los principales métodos de dependencia
Rank within configurationPosición dentro de la configuración
MethodMétodo
Best forMejor para
Main limitationLimitación principal
Robustness profilePerfil de robustez
1A
Chi-Square
Categorical tables with adequate supportTablas categóricas con soporte adecuado
Sparse cells and sample-size sensitivityCeldas escasas y sensibilidad al tamaño
★★★☆☆
1B
Fisher Exact
Small or sparse categorical tablesTablas categóricas pequeñas o escasas
Computation and conditional interpretationCómputo e interpretación condicional
★★★★☆
1C
Mutual Dependence
General shared uncertaintyIncertidumbre compartida general
Estimator sensitivitySensibilidad al estimador
★★★☆☆
1D
HSIC
Kernel-representable nonlinear dependenceDependencia no lineal representable por kernel
Kernel tuning and computational costAjuste de kernel y costo
★★★★☆
1E
Distance Covariance
General continuous or vector dependenceDependencia general continua o vectorial
Scaling, outliers, no directionEscala, extremos y sin dirección
★★★☆☆
Ranks 1A–1E identify the preferred method inside different dependence configurations. They do not define one universal hierarchy.Las posiciones 1A–1E identifican el método preferido dentro de configuraciones diferentes. No definen una jerarquía universal.
12. Validation metrics and acceptance interpretation
12. Métricas de validación e interpretación de aceptación
Validation dimensionDimensión de validación
Required evidenceEvidencia requerida
Independence challengeCuestionamiento de independencia
Exact, asymptotic, permutation, or bootstrap evidence appropriate to the selected method.Evidencia exacta, asintótica, por permutación o bootstrap apropiada al método.
Dependence magnitudeMagnitud de dependencia
A native or companion effect measure; a test statistic or p-value alone is insufficient.Una medida nativa o complementaria de efecto; estadístico o valor p solos son insuficientes.
Estimator stabilityEstabilidad del estimador
Sensitivity to kernels, distances, bandwidths, bins, scaling, and resampling.Sensibilidad a kernels, distancias, anchos, bins, escala y remuestreo.
Sample supportSoporte muestral
Expected counts, effective dimensionality, ties, rare states, and adequate permutation count.Conteos esperados, dimensionalidad efectiva, empates, estados raros y permutaciones suficientes.
ReplicationReplicación
Comparable evidence across resamples, segments, time periods, or independent sources.Evidencia comparable entre remuestras, segmentos, periodos o fuentes independientes.
No binary truth from one p-value: dependence validity requires compatible assumptions, stable magnitude, uncertainty, and practical relevance—not merely rejection of independence.No existe verdad binaria desde un solo valor p: la validez de dependencia requiere supuestos compatibles, magnitud estable, incertidumbre y relevancia práctica, no solamente rechazo de independencia.
13. Method selection protocol for dependence evidence
13. Protocolo de selección para evidencia de dependencia
Read the ESS relationship and independence question.
Leer la relación y pregunta de independencia del ESS.
Classify variables as categorical, continuous, mixed, scalar, or vector-valued.
Clasificar variables como categóricas, continuas, mixtas, escalares o vectoriales.
Evaluate sample size, sparsity, expected counts, dimensionality, and repeated-unit structure.
Evaluar tamaño, escasez, conteos esperados, dimensionalidad y estructura de unidades repetidas.
Determine whether the representation requires a contingency table, information estimator, kernel, or distance.
Determinar si la representación requiere tabla de contingencia, estimador informacional, kernel o distancia.
Comparar supuestos, potencia, salida de magnitud, robustez, interpretabilidad y costo computacional.
Select exact or permutation inference whenever asymptotic support is fragile.
Seleccionar inferencia exacta o por permutación cuando el soporte asintótico sea frágil.
Record primary method, companion effect measure, diagnostics, and limits in the MSS.
Registrar método principal, medida complementaria de efecto, diagnósticos y límites en el MSS.
14. Chapter workshop
14. Taller del capítulo
Case A: two categorical variables form a well-populated 4×3 tableCaso A: dos variables categóricas forman una tabla 4×3 bien poblada
Primary candidate: Chi-Square, with expected-count diagnostics, residuals, and a companion magnitude measure.Candidato principal: Chi-Cuadrado, con diagnósticos de conteos esperados, residuos y medida complementaria de magnitud.
Case B: a 2×2 table has several low countsCaso B: una tabla 2×2 tiene varios conteos bajos
Primary candidate: Fisher Exact, accompanied by an odds ratio or Phi when meaningful.Candidato principal: Fisher Exacta, acompañada por odds ratio o Phi cuando sea significativo.
Case C: two continuous vectors may have a complex nonlinear relationshipCaso C: dos vectores continuos pueden tener una relación no lineal compleja
Primary candidates: Distance Covariance or HSIC, selected according to the defensibility of distance versus kernel representation.Candidatos principales: Covarianza de Distancias o HSIC, según sea más defendible representar mediante distancia o kernel.
Case D: a general shared-uncertainty relationship is needed across mixed variablesCaso D: se necesita una relación general de incertidumbre compartida entre variables mixtas
Select the Mutual Dependence information family, but Module III must name and validate the exact estimator before implementation.Seleccionar la familia informacional Mutual Dependence, pero el Módulo III debe nombrar y validar el estimador exacto antes de implementar.
Dependence-method selection begins with the independence question and the representation of the variables. Chi-Square and Fisher Exact address categorical contingency structures. Mutual Dependence captures shared uncertainty through an explicitly selected information estimator. HSIC represents dependence through kernels. Distance Covariance represents dependence through distances. None is universally best. The selected method must match the ESS, sample support, representation, inference architecture, magnitude requirement, and interpretation boundary.
La selección de métodos de dependencia comienza con la pregunta de independencia y la representación de las variables. Chi-Cuadrado y Fisher Exacta abordan estructuras categóricas de contingencia. Mutual Dependence captura incertidumbre compartida mediante un estimador informacional explícitamente seleccionado. HSIC representa dependencia mediante kernels. Covarianza de Distancias representa dependencia mediante distancias. Ninguno es universalmente superior. El método debe corresponder con ESS, soporte muestral, representación, arquitectura inferencial, requisito de magnitud y frontera interpretativa.
Next: Chapter 3 — Methods for Measuring Information →Siguiente: Capítulo 3 — Métodos para Medir Información →