Module III · Chapter 6 Módulo III · Capítulo 6

Methods for Measuring Prediction

Métodos para Medir Predicción

A method-selection chapter for estimating unseen outcomes, comparing predictive architectures, validating generalization, and choosing methods according to target type, data structure, interpretability, robustness, and operational constraints.

Un capítulo de selección de métodos para estimar resultados no observados, comparar arquitecturas predictivas, validar generalización y elegir métodos según tipo de objetivo, estructura de datos, interpretabilidad, robustez y restricciones operativas.

Module III principle Principio del Módulo III Prediction methods are selected from the ESS target architecture and validation requirement—not from the popularity or complexity of a model. Los métodos predictivos se seleccionan desde la arquitectura del objetivo y el requisito de validación del ESS, no desde la popularidad o complejidad de un modelo.
Module progress · Chapter 6 of 9 Progreso del módulo · Capítulo 6 de 9

Black-box rule of the chapter

Regla de caja negra del capítulo

Assume that an ESS has declared prediction evidence as Required or eligible Conditional for an explicit target Y, predictor set X, validation architecture, operational horizon, and decision context. Asumir que un ESS declaró evidencia predictiva como Requerida o Condicional elegible para un objetivo Y, conjunto predictor X, arquitectura de validación, horizonte operativo y contexto de decisión explícitos.

The chapter does not yet know the implementation. Its responsibility is to determine which predictive method best matches the target type, sample structure, predictor architecture, nonlinear complexity, class balance, data volume, interpretability need, computation, and validation constraints.

El capítulo todavía no conoce la implementación. Su responsabilidad es determinar qué método predictivo corresponde mejor con el tipo de objetivo, estructura muestral, arquitectura predictora, complejidad no lineal, balance de clases, volumen de datos, necesidad de interpretación, cómputo y restricciones de validación.

Boundary: predictive accuracy does not establish association mechanism, explanation of the real phenomenon, intervention effect, or causality. Frontera: la precisión predictiva no establece mecanismo asociativo, explicación del fenómeno real, efecto de intervención ni causalidad.

Chapter learning objectives

Objetivos de aprendizaje del capítulo

Define prediction evidence Definir evidencia predictiva Separate fitting, forecasting, ranking, classification, probability estimation, and generalization. Separar ajuste, pronóstico, ranking, clasificación, estimación probabilística y generalización.
Validate target architecture Validar arquitectura del objetivo Confirm continuous, binary, multiclass, ordinal, multi-output, and time-dependent targets. Confirmar objetivos continuos, binarios, multiclase, ordinales, multisalida y dependientes del tiempo.
Match method to evidence need Alinear método con necesidad evidencial Distinguish linear transparency, nonlinear tabular performance, margin-based learning, and deep representation learning. Distinguir transparencia lineal, rendimiento no lineal tabular, aprendizaje por margen y representación profunda.
Select conditionally Seleccionar condicionalmente Choose the method that generalizes best under the ESS validation and operational constraints. Elegir el método que mejor generaliza bajo las restricciones operativas y de validación del ESS.

1. What does it mean to produce prediction evidence?

1. ¿Qué significa producir evidencia predictiva?

Producing prediction evidence means demonstrating that a method can estimate unknown or future outcomes from validated inputs and preserve useful performance on data not used to fit or tune the model.

Producir evidencia predictiva significa demostrar que un método puede estimar resultados desconocidos o futuros desde entradas validadas y conservar rendimiento útil en datos no utilizados para ajustar o afinar el modelo.

GeneralizationGeneralizaciónDoes performance persist on unseen data?¿El rendimiento persiste en datos no vistos?
DiscriminationDiscriminaciónCan the model separate classes or rank outcomes?¿El modelo separa clases u ordena resultados?
CalibrationCalibraciónDo predicted probabilities match observed frequencies?¿Las probabilidades predichas corresponden con frecuencias observadas?
Error magnitudeMagnitud del errorHow far are predictions from actual outcomes?¿Qué tan lejos están las predicciones de los resultados?
RobustnessRobustezDoes performance survive shifts, imbalance, noise, and perturbation?¿El rendimiento sobrevive drift, desbalance, ruido y perturbación?
Operational utilityUtilidad operativaDoes the prediction improve the intended decision?¿La predicción mejora la decisión prevista?

2. What does prediction evidence require?

2. ¿Qué requiere la evidencia predictiva?

RequirementRequisitoWhy it mattersPor qué importa
Explicit target YObjetivo Y explícitoRegression, binary classification, multiclass classification, ordinal prediction, and multi-output learning require different architectures.Regresión, clasificación binaria, multiclase, ordinal y multisalida requieren arquitecturas distintas.
Validated predictor set XConjunto predictor X validadoModule III must not silently add variables rejected by Modules I or II.El Módulo III no puede añadir silenciosamente variables rechazadas por los Módulos I o II.
Leakage-safe splitPartición sin fugaValidation is invalid if future, target-derived, duplicated, or post-outcome information enters training.La validación es inválida si información futura, derivada del objetivo, duplicada o posterior entra al entrenamiento.
Baseline modelModelo de referenciaA method must outperform a defensible naïve or simple benchmark.Un método debe superar una línea base simple y defendible.
Metric aligned to decisionMétrica alineada con la decisiónAccuracy, AUC, F1, log loss, MAE, RMSE, and calibration answer different questions.Accuracy, AUC, F1, log loss, MAE, RMSE y calibración responden preguntas distintas.
Class or outcome supportSoporte de clases o resultadosRare classes, extreme values, censoring, and imbalance affect learnability and evaluation.Clases raras, valores extremos, censura y desbalance afectan aprendizaje y evaluación.
Hyperparameter controlControl de hiperparámetrosTuning must remain inside the training process and separate from final evaluation.El ajuste debe permanecer dentro del entrenamiento y separado de la evaluación final.
Deployment constraintsRestricciones de despliegueLatency, memory, interpretability, update frequency, fairness, and monitoring can determine method eligibility.Latencia, memoria, interpretabilidad, frecuencia de actualización, equidad y monitoreo pueden determinar elegibilidad.

3. Method-selection map by prediction configuration

3. Mapa de selección por configuración predictiva

Evidence configurationConfiguración evidencialPrimary candidatesCandidatos principales
Continuous target; approximately linear relationship; high interpretabilityObjetivo continuo; relación aproximadamente lineal; alta interpretabilidadLinear Regression
Binary or multinomial target; probability estimation and interpretabilityObjetivo binario o multinomial; probabilidad e interpretabilidadLogistic Regression
Mixed tabular predictors; nonlinear interactions; robust baselinePredictores tabulares mixtos; interacciones no lineales; línea base robustaRandom Forest
Structured tabular prediction with staged error correctionPredicción tabular estructurada con corrección secuencial de erroresGradient Boosting
High-performance sparse or dense tabular dataDatos tabulares densos o dispersos de alto rendimientoXGBoost
Large-scale tabular learning with speed and memory constraintsAprendizaje tabular a gran escala con restricciones de velocidad y memoriaLightGBM
High-dimensional margin separation with moderate sample sizeSeparación por margen en alta dimensión con muestra moderadaSVM
Large complex data, representation learning, nonlinear multi-output patternsDatos grandes y complejos, aprendizaje de representación y patrones multisalida no linealesNeural Networks
No universal best model: prediction rankings depend on target type, validation design, data volume, complexity, metric, interpretability, and deployment constraints. No existe mejor modelo universal: el ranking depende de tipo de objetivo, validación, volumen, complejidad, métrica, interpretabilidad y despliegue.

4. Standard method card

4. Ficha estándar del método

Method Name
Scientific Purpose
Evidence Produced
Best Prediction Configuration
Target Types
Predictor Requirements
Strengths
Weaknesses
Assumptions
Limitations
Computational Cost
Interpretability
Robustness
Critical Hyperparameters
Validation Metrics
Acceptance Interpretation
Failure Modes
Complementary Methods
Module III Selection Status

5. Linear Regression

5. Regresión Lineal

Scientific purposePropósito científicoPredict a continuous target through an additive linear combination of predictors.Predecir un objetivo continuo mediante combinación lineal aditiva de predictores.
Evidence producedEvidencia producidaContinuous predictions, residual structure, coefficient estimates, and uncertainty under a specified linear model.Predicciones continuas, estructura residual, coeficientes e incertidumbre bajo un modelo lineal.
Best configurationMejor configuraciónContinuous target, approximately linear additive structure, and strong interpretability requirement.Objetivo continuo, estructura aditiva aproximadamente lineal y necesidad alta de interpretación.
StrengthsFortalezasTransparent, fast, strong baseline, coefficient-level interpretation, and low computational cost.Transparente, rápida, buena línea base, interpretación por coeficientes y bajo costo.
WeaknessesDebilidadesMisses nonlinearities and interactions unless explicitly engineered; sensitive to outliers and multicollinearity.Omite no linealidad e interacciones si no se construyen; sensible a extremos y multicolinealidad.
AssumptionsSupuestosAppropriate linear form, independent errors for classical inference, stable variance or adjusted inference, and defensible predictor coding.Forma lineal apropiada, errores independientes para inferencia clásica, varianza estable o inferencia ajustada y codificación defendible.
Critical parametersParámetros críticosFeature specification, regularization if used, transformations, interaction terms.
Validation metricsMétricas de validaciónMAE, RMSE, R² on holdout, residual diagnostics, calibration slope for continuous prediction.
Failure modesModos de falloNonlinearity, outliers, leakage, extrapolation, multicollinearity, and interpreting in-sample R² as generalization.No linealidad, extremos, fuga, extrapolación, multicolinealidad e interpretar R² interno como generalización.
Complementary methodsMétodos complementariosRegularized regression, Gradient Boosting, Random Forest.

6. Logistic Regression

6. Regresión Logística

Scientific purposePropósito científicoEstimate class probabilities through a linear decision structure on the log-odds scale.Estimar probabilidades de clase mediante una estructura lineal en escala log-odds.
Evidence producedEvidencia producidaPredicted probabilities, class decisions, coefficients, odds-scale effects, and calibration evidence.Probabilidades predichas, decisiones de clase, coeficientes, efectos en odds y evidencia de calibración.
Best configurationMejor configuraciónBinary or multinomial targets with interpretability and probability calibration needs.Objetivos binarios o multinomiales con necesidad de interpretación y calibración.
StrengthsFortalezasTransparent, efficient, probabilistic, strong baseline, and compatible with regularization.Transparente, eficiente, probabilística, buena línea base y compatible con regularización.
WeaknessesDebilidadesLinear decision surface unless features are transformed; sensitive to separation, imbalance, and multicollinearity.Superficie lineal salvo transformación; sensible a separación, desbalance y multicolinealidad.
AssumptionsSupuestosCorrect link and feature form, independent units, adequate events per parameter, and valid class coding.Enlace y forma correctos, unidades independientes, eventos suficientes por parámetro y codificación válida.
Critical parametersParámetros críticosRegularization strength, penalty type, class weights, threshold, interaction terms.
Validation metricsMétricas de validaciónROC-AUC, PR-AUC, log loss, Brier score, calibration slope/intercept, sensitivity, specificity, F1.
Failure modesModos de falloPerfect separation, severe imbalance, threshold misuse, poor calibration, leakage, and equating odds ratios with causality.Separación perfecta, desbalance severo, mal uso del umbral, mala calibración, fuga y confundir odds ratios con causalidad.
Complementary methodsMétodos complementariosRandom Forest, Gradient Boosting, calibration models.

7. Random Forest

7. Random Forest

Scientific purposePropósito científicoPredict outcomes by aggregating many randomized decision trees.Predecir resultados agregando múltiples árboles de decisión aleatorizados.
Evidence producedEvidencia producidaNonlinear predictions, class probabilities or continuous estimates, out-of-bag evidence, and variable-importance summaries.Predicciones no lineales, probabilidades o estimaciones continuas, evidencia out-of-bag y resúmenes de importancia.
Best configurationMejor configuraciónMixed tabular predictors, nonlinear interactions, moderate-to-large samples, and a robust benchmark need.Predictores tabulares mixtos, interacciones no lineales, muestras moderadas o grandes y necesidad de benchmark robusto.
StrengthsFortalezasHandles nonlinearities and interactions automatically, robust to scaling, and generally stable.Maneja no linealidad e interacciones automáticamente, robusto a escala y generalmente estable.
WeaknessesDebilidadesLess transparent, can be memory-intensive, may produce poorly calibrated probabilities, and cannot extrapolate smoothly.Menos transparente, intensivo en memoria, puede calibrar mal probabilidades y no extrapola suavemente.
AssumptionsSupuestosRepresentative training data, independent or grouped validation units, stable feature meaning, and enough observations for tree diversity.Entrenamiento representativo, unidades independientes o agrupadas, significado estable de variables y observaciones suficientes.
Critical parametersParámetros críticosNumber of trees, max depth, features per split, minimum leaf size, class weights.
Validation metricsMétricas de validaciónHoldout metrics, out-of-bag error, calibration, permutation importance stability, subgroup performance.
Failure modesModos de falloLeakage, correlated importance bias, rare-class neglect, overly deep trees, unstable extrapolation, and overinterpreting feature importance.Fuga, sesgo de importancia correlacionada, descuido de clases raras, árboles profundos, extrapolación inestable y sobreinterpretar importancia.
Complementary methodsMétodos complementariosLogistic/Linear Regression, Gradient Boosting, calibration methods.

8. Gradient Boosting

8. Gradient Boosting

Scientific purposePropósito científicoBuild an additive predictive model by sequentially correcting prior errors.Construir un modelo predictivo aditivo corrigiendo secuencialmente errores previos.
Evidence producedEvidencia producidaHigh-capacity nonlinear predictions and staged improvement under a chosen loss function.Predicciones no lineales de alta capacidad y mejora secuencial bajo una función de pérdida.
Best configurationMejor configuraciónStructured tabular data where nonlinear interactions and predictive accuracy are priorities.Datos tabulares estructurados donde importan interacciones no lineales y precisión.
StrengthsFortalezasStrong predictive performance, flexible loss functions, and effective nonlinear interaction learning.Rendimiento fuerte, funciones de pérdida flexibles y aprendizaje efectivo de interacciones.
WeaknessesDebilidadesSensitive to tuning, noise, overfitting, and training order; less transparent than linear models.Sensible a ajuste, ruido, sobreajuste y orden de entrenamiento; menos transparente que modelos lineales.
AssumptionsSupuestosRepresentative data, valid loss function, leakage-safe tuning, and stable predictor distributions.Datos representativos, pérdida válida, ajuste sin fuga y distribuciones estables.
Critical parametersParámetros críticosLearning rate, number of estimators, tree depth, subsampling, regularization.
Validation metricsMétricas de validaciónCross-validated or holdout error, early-stopping curve, calibration, subgroup performance.
Failure modesModos de falloOverfitting, target leakage, unstable tuning, imbalance neglect, and selecting by one metric only.Sobreajuste, fuga del objetivo, ajuste inestable, descuido del desbalance y seleccionar por una sola métrica.
Complementary methodsMétodos complementariosRandom Forest, XGBoost, LightGBM, simple baseline models.

9. XGBoost

9. XGBoost

Scientific purposePropósito científicoProvide regularized gradient-boosted tree prediction optimized for speed, sparsity, and high tabular performance.Proporcionar predicción con árboles boosting regularizados, optimizada para velocidad, dispersión y alto rendimiento tabular.
Evidence producedEvidencia producidaHigh-performance predictions, staged loss reduction, regularized tree ensemble, and model-specific importance measures.Predicciones de alto rendimiento, reducción secuencial de pérdida, ensamble regularizado y medidas de importancia.
Best configurationMejor configuraciónDense or sparse tabular data with nonlinear interactions and strong accuracy requirements.Datos tabulares densos o dispersos con interacciones no lineales y alta exigencia de precisión.
StrengthsFortalezasStrong performance, regularization, missing-value handling, sparse optimization, and mature ecosystem.Rendimiento fuerte, regularización, manejo de faltantes, optimización dispersa y ecosistema maduro.
WeaknessesDebilidadesMany hyperparameters, risk of overfitting, reduced transparency, and computational tuning cost.Muchos hiperparámetros, riesgo de sobreajuste, menor transparencia y costo de ajuste.
AssumptionsSupuestosRepresentative tabular data, valid target coding, leakage-safe validation, and defensible objective function.Datos tabulares representativos, objetivo válido, validación sin fuga y función objetivo defendible.
Critical parametersParámetros críticosLearning rate, max depth, min child weight, subsample, colsample, regularization, estimators.
Validation metricsMétricas de validaciónOut-of-sample target metrics, calibration, early stopping, stability across seeds, subgroup performance.
Failure modesModos de falloHyperparameter oversearch, leakage, unstable probabilities, correlated-feature importance, and weak reproducibility.Sobrebúsqueda de hiperparámetros, fuga, probabilidades inestables, importancia sesgada y baja reproducibilidad.
Complementary methodsMétodos complementariosLightGBM, Random Forest, Logistic/Linear baseline, calibration methods.

10. LightGBM

10. LightGBM

Scientific purposePropósito científicoDeliver scalable gradient-boosted tree prediction with efficient histogram-based learning and leaf-wise growth.Proporcionar boosting escalable con aprendizaje por histogramas y crecimiento por hojas.
Evidence producedEvidencia producidaHigh-speed nonlinear prediction for large tabular datasets with memory-efficient training.Predicción no lineal rápida para grandes datasets tabulares con entrenamiento eficiente en memoria.
Best configurationMejor configuraciónLarge samples, many features, categorical handling needs, and speed or memory constraints.Muestras grandes, muchas variables, necesidad de categóricas y restricciones de velocidad o memoria.
StrengthsFortalezasFast, memory efficient, strong tabular performance, and scalable to large data.Rápido, eficiente en memoria, fuerte en datos tabulares y escalable.
WeaknessesDebilidadesLeaf-wise growth may overfit small samples; many tuning choices and lower transparency.Crecimiento por hojas puede sobreajustar muestras pequeñas; muchos ajustes y menor transparencia.
AssumptionsSupuestosSufficient sample size for leaf-wise complexity, representative data, and leakage-safe validation.Muestra suficiente para complejidad por hojas, datos representativos y validación sin fuga.
Critical parametersParámetros críticosnum_leaves, max_depth, min_data_in_leaf, learning rate, feature/bagging fractions.
Validation metricsMétricas de validaciónOut-of-sample metrics, calibration, early stopping, memory/time profile, stability across folds.
Failure modesModos de falloSmall-sample overfitting, unstable leaf complexity, leakage, biased importance, and tuning for speed over validity.Sobreajuste en muestras pequeñas, complejidad inestable, fuga, importancia sesgada y priorizar velocidad sobre validez.
Complementary methodsMétodos complementariosXGBoost, Random Forest, simpler interpretable baseline.

11. Support Vector Machines (SVM)

11. Máquinas de Vectores de Soporte (SVM)

Scientific purposePropósito científicoLearn a maximum-margin decision boundary, optionally in a nonlinear kernel space.Aprender una frontera de decisión de margen máximo, opcionalmente en un espacio kernel no lineal.
Evidence producedEvidencia producidaClass decisions or continuous predictions based on margin geometry and support vectors.Decisiones de clase o predicciones continuas basadas en geometría de margen y vectores de soporte.
Best configurationMejor configuraciónModerate sample size, high-dimensional features, clear margin structure, and careful scaling.Muestra moderada, alta dimensión, estructura de margen clara y escalamiento cuidadoso.
StrengthsFortalezasEffective in high dimensions, flexible kernels, and strong margin-based generalization.Efectivo en alta dimensión, kernels flexibles y buena generalización por margen.
WeaknessesDebilidadesSensitive to scaling and hyperparameters, expensive on large samples, and probabilities require extra calibration.Sensible a escala e hiperparámetros, costoso en muestras grandes y probabilidades requieren calibración.
AssumptionsSupuestosA meaningful feature space, representative training data, and kernel structure aligned with the decision boundary.Espacio de variables significativo, entrenamiento representativo y kernel alineado con la frontera.
Critical parametersParámetros críticosC, kernel, gamma, epsilon for regression, class weights.
Validation metricsMétricas de validaciónHoldout discrimination/error, calibration after probability fitting, support-vector count, stability.
Failure modesModos de falloPoor scaling, wrong kernel, large-sample cost, imbalance, unstable probability calibration, and opaque decision structure.Escalamiento deficiente, kernel incorrecto, costo en grandes muestras, desbalance, calibración inestable y opacidad.
Complementary methodsMétodos complementariosLogistic Regression, tree ensembles, calibration models.

12. Neural Networks

12. Redes Neuronales

Scientific purposePropósito científicoLearn complex nonlinear representations and predictive mappings through layered parameterized transformations.Aprender representaciones no lineales complejas y mapeos predictivos mediante transformaciones parametrizadas en capas.
Evidence producedEvidencia producidaFlexible predictions for classification, regression, multi-output, images, text, sequences, and other complex inputs.Predicciones flexibles para clasificación, regresión, multisalida, imágenes, texto, secuencias y entradas complejas.
Best configurationMejor configuraciónLarge datasets, complex nonlinear structure, unstructured data, representation learning, or multi-task prediction.Datasets grandes, estructura no lineal compleja, datos no estructurados, representación o predicción multitarea.
StrengthsFortalezasVery flexible, scalable, capable of representation learning and complex multi-output architectures.Muy flexibles, escalables y capaces de aprender representaciones y arquitecturas multisalida complejas.
WeaknessesDebilidadesData hungry, computationally expensive, less interpretable, tuning intensive, and sensitive to optimization and drift.Exigentes en datos y cómputo, menos interpretables, intensivas en ajuste y sensibles a optimización y drift.
AssumptionsSupuestosSufficient representative data, stable preprocessing, adequate optimization, regularization, and validation architecture.Datos suficientes y representativos, preparación estable, optimización, regularización y validación adecuadas.
Critical parametersParámetros críticosArchitecture, depth, width, activation, optimizer, learning rate, batch size, regularization.
Validation metricsMétricas de validaciónTask-specific out-of-sample metrics, calibration, learning curves, seed stability, subgroup and shift performance.
Failure modesModos de falloOverfitting, unstable training, shortcut learning, leakage, poor calibration, distribution shift, and unjustified complexity.Sobreajuste, entrenamiento inestable, aprendizaje de atajos, fuga, mala calibración, drift y complejidad injustificada.
Complementary methodsMétodos complementariosLinear/logistic baselines, tree ensembles, calibration, explanation methods.

13. Conditional ranking of the top prediction methods

13. Ranking condicional de los principales métodos predictivos

Rank within configurationPosición dentro de la configuraciónMethodMétodoBest forMejor paraMain limitationLimitación principalRobustness profilePerfil de robustez
1ALinear RegressionTransparent continuous predictionPredicción continua transparenteLinear formForma lineal★★★★☆
1BLogistic RegressionInterpretable probability predictionPredicción probabilística interpretableLinear decision surfaceSuperficie lineal★★★★☆
1CRandom ForestRobust nonlinear tabular baselineLínea base tabular no lineal robustaCalibration and transparencyCalibración y transparencia★★★★☆
1DGradient BoostingHigh-accuracy structured tabular dataDatos tabulares estructurados de alta precisiónTuning sensitivitySensibilidad al ajuste★★★☆☆
1EXGBoostHigh-performance sparse/dense tabular predictionPredicción tabular densa/dispersa de alto rendimientoComplex tuningAjuste complejo★★★★☆
1FLightGBMLarge-scale efficient tabular learningAprendizaje tabular eficiente a gran escalaSmall-sample overfittingSobreajuste en muestras pequeñas★★★☆☆
1GSVMHigh-dimensional moderate-size dataAlta dimensión y muestra moderadaScaling, cost, calibrationEscala, costo y calibración★★★☆☆
1HNeural NetworksComplex large or unstructured dataDatos grandes, complejos o no estructuradosData, cost, interpretabilityDatos, costo e interpretabilidad★★★☆☆
Ranks 1A–1H identify the preferred method inside different prediction configurations. They do not define a universal leaderboard. Las posiciones 1A–1H identifican el método preferido dentro de configuraciones predictivas diferentes. No definen una tabla universal.

14. Validation metrics and acceptance interpretation

14. Métricas de validación e interpretación de aceptación

Validation dimensionDimensión de validaciónRequired evidenceEvidencia requerida
GeneralizationGeneralizaciónPerformance measured on untouched, out-of-time, grouped, or spatially separated data as required.Rendimiento medido en datos intactos, fuera del tiempo, agrupados o separados espacialmente según corresponda.
Baseline improvementMejora frente a línea baseThe method must outperform a defensible simple predictor.El método debe superar un predictor simple y defendible.
Target-aligned metricMétrica alineada con objetivoRegression, class ranking, probability quality, rare-class detection, and operational cost require different metrics.Regresión, ranking, calidad probabilística, detección rara y costo requieren métricas distintas.
CalibrationCalibraciónPredicted probabilities or intervals must correspond to observed outcomes.Probabilidades o intervalos deben corresponder con resultados observados.
StabilityEstabilidadPerformance remains defensible across folds, seeds, resamples, time periods, and subgroups.Rendimiento defendible entre folds, seeds, remuestras, periodos y subgrupos.
Fairness and subgroup performanceEquidad y rendimiento por subgrupoAggregate performance must not hide unacceptable subgroup failures.El rendimiento agregado no debe ocultar fallos inaceptables por subgrupo.
Operational utilityUtilidad operativaThresholds and errors are evaluated against real decision costs and intervention capacity.Umbrales y errores se evalúan contra costos reales y capacidad operativa.
No universal “excellent” metric range: acceptable prediction depends on baseline, target prevalence, cost asymmetry, horizon, calibration, subgroup performance, and decision consequence. No existe rango universal “excelente”: la predicción aceptable depende de línea base, prevalencia, asimetría de costo, horizonte, calibración, subgrupos y consecuencia.

15. Method selection protocol for prediction evidence

15. Protocolo de selección para evidencia predictiva

  1. Read the ESS target Y, explicit predictor set X, objective type, horizon, and operational use.
  2. Leer objetivo Y, conjunto X, tipo de objetivo, horizonte y uso operativo del ESS.
  3. Validate target coding, leakage risk, duplicate/group structure, time order, class balance, and missingness.
  4. Validar codificación, fuga, duplicados/grupos, orden temporal, balance y faltantes.
  5. Classify the need as continuous prediction, probability prediction, multiclass, ordinal, multi-output, or complex representation learning.
  6. Clasificar la necesidad como predicción continua, probabilística, multiclase, ordinal, multisalida o representación compleja.
  7. Define a baseline and a leakage-safe validation architecture before method tuning.
  8. Definir línea base y arquitectura sin fuga antes del ajuste.
  9. Generate eligible candidate methods based on sample size, dimensionality, nonlinearity, interpretability, latency, and memory.
  10. Generar candidatos según tamaño, dimensionalidad, no linealidad, interpretabilidad, latencia y memoria.
  11. Tune candidates only inside the training process and retain an untouched final evaluation set.
  12. Ajustar candidatos solo dentro del entrenamiento y conservar evaluación final intacta.
  13. Compare generalization, calibration, subgroup performance, robustness, computation, and operational utility.
  14. Comparar generalización, calibración, subgrupos, robustez, cómputo y utilidad.
  15. Record primary method, alternatives, metrics, thresholds, and implementation constraints in the MSS.
  16. Registrar método principal, alternativas, métricas, umbrales y restricciones en el MSS.

16. Chapter workshop

16. Taller del capítulo

Case A: predict a continuous target with a transparent linear baseline Caso A: predecir un objetivo continuo con línea base lineal transparente
Primary candidate: Linear Regression, with holdout MAE/RMSE, residual diagnostics, and comparison against a naïve mean predictor.Candidato principal: Regresión Lineal, con MAE/RMSE en holdout, residuos y comparación con media naïve.
Case B: estimate interpretable probabilities for a rare binary outcome Caso B: estimar probabilidades interpretables para un resultado binario raro
Primary candidate: Logistic Regression, with class-sensitive validation, PR-AUC, calibration, threshold analysis, and regularization.Candidato principal: Regresión Logística, con validación sensible a clases, PR-AUC, calibración, umbral y regularización.
Case C: mixed tabular data contain complex nonlinear interactions Caso C: datos tabulares mixtos contienen interacciones no lineales complejas
Primary candidates: Random Forest, Gradient Boosting, XGBoost, or LightGBM, ranked by validation, calibration, cost, and interpretability.Candidatos: Random Forest, Gradient Boosting, XGBoost o LightGBM, ordenados por validación, calibración, costo e interpretación.
Case D: large unstructured inputs require learned representations Caso D: entradas grandes no estructuradas requieren representaciones aprendidas
Primary candidate: Neural Networks, conditional on sufficient data, compute, robust validation, calibration, and a simpler baseline comparison.Candidato principal: Redes Neuronales, condicionado a datos, cómputo, validación robusta, calibración y línea base simple.

17. Chapter 6 MSS handoff template

17. Plantilla de entrega MSS del Capítulo 6

METHOD SELECTION SUMMARY — PREDICTION

ESS Prediction Target ID:
Explicit Target Y:
Target Type:
Explicit Predictor Set X:
Operational Horizon:
Decision Use:
Class / Outcome Distribution:
Leakage and Grouping Constraints:
Deployment Constraints:

Primary Selected Method:
Exact Variant:
Selection Status:
Scientific Justification:

Baseline Method:
Alternative Method 1:
Alternative Method 2:

Validation Architecture:
Primary Metric:
Secondary Metrics:
Calibration Requirement:
Threshold / Decision Rule:
Subgroup Validation:
Robustness Tests:
Critical Hyperparameters:
Critical Assumptions:
Critical Failure Modes:
Interpretation Boundary:

Module IV Implementation Readiness:
[READY / CONDITIONAL / RETURN TO MODULE II]

Chapter closing

Cierre del capítulo

Prediction-method selection begins with the explicit target, predictor set, validation architecture, and operational use declared by the ESS. Linear and Logistic Regression provide transparent baselines and probabilistic structure. Random Forest offers robust nonlinear tabular prediction. Gradient Boosting, XGBoost, and LightGBM provide high-performance staged tree learning under different scale and tuning conditions. SVM learns margin-based boundaries in high-dimensional settings. Neural Networks learn complex representations for large and unstructured data. None is universally best. The correct method is the one that generalizes, calibrates, remains stable, respects constraints, and improves the intended decision.

La selección de métodos predictivos comienza con objetivo, predictores, validación y uso operativo declarados por el ESS. Regresión Lineal y Logística proporcionan líneas base transparentes y estructura probabilística. Random Forest ofrece predicción tabular no lineal robusta. Gradient Boosting, XGBoost y LightGBM ofrecen aprendizaje secuencial de alto rendimiento bajo distintas condiciones de escala y ajuste. SVM aprende fronteras por margen en alta dimensión. Redes Neuronales aprenden representaciones complejas para datos grandes y no estructurados. Ninguno es universalmente superior. El método correcto es aquel que generaliza, calibra, permanece estable, respeta restricciones y mejora la decisión prevista.