1 of 8

CORPORACIÓN UNIVERSITARIA�MINUTO DE DIOS

GRUPO 10:�- Alexander Oviedo Fadul� (Ponente)�- Maria Fernanda Ruiz Paipilla�- Neheman Samir Jaller Cerchiaro�- William David Obando Lopez�

Machine Learning Avanzado�NRC-8772

AUTOMATIZACIÓN DE PROCESOS EN EL FLUJO DE TRABAJO DE MACHINE LEARNING

Predicción de Supervivencia en el Titanic aplicando Pipelines, GridSearch y Validación Cruzada

Profesor: Leonardo Valderrama García�Fecha: 21 de junio de 2026

https://colab.research.google.com/drive/1UI3mmIOlSzQ8G8PTwDHKnatIRqeD8e32

2 of 8

Introducción: Contexto de MLOps y el Dataset

📍 El Desafío de MLOps: La transición de modelos de ML desde scripts experimentales aislados a entornos productivos requiere estricta reproducibilidad, consistencia y trazabilidad. Automatizar los flujos es clave (Janiesch et al., 2021).

📍 Fuga de Datos (Data Leakage): Uno de los errores más comunes consiste en aplicar transformaciones a todo el dataset antes de la validación. Esto permite que información del conjunto de test se filtre al entrenamiento, inflando artificialmente el rendimiento.

📍 El Dataset del Titanic: Utilizamos los datos históricos del Titanic para demostrar la viabilidad y robustez de un flujo de trabajo limpio y estructurado mediante Pipelines y ColumnTransformers de scikit-learn.

3 of 8

Arquitectura del Pipeline de Modelado

📍 ColumnTransformer (Preprocesamiento Diferenciado): Permite aplicar transformaciones por tipo de datos simultáneamente:� • Variables Numéricas: Imputación por mediana y normalización estándar (StandardScaler).� • Variables Categóricas: Imputación por la moda (most_frequent) y codificación One-Hot.

📍 Encapsulamiento en un Pipeline Unificado: El ColumnTransformer y el clasificador final se acoplan en un solo pipeline de scikit-learn. El preprocesamiento se ejecuta de forma aislada e independiente en cada pliegue de entrenamiento.

📍 Optimización de Hiperparámetros y CV: El ajuste fino de parámetros con GridSearchCV se realiza directamente sobre el objeto Pipeline. Se implementa una Validación Cruzada de 5 pliegues (5-Fold CV) para medir el rendimiento de manera realista.

4 of 8

Ingeniería de Características Personalizada

📍 Extracción de Títulos (Title): Se procesan los nombres para extraer títulos como 'Mr.', 'Mrs.', 'Miss.', 'Master.', etc. Los títulos raros o de la nobleza se agrupan en categorías genéricas o en 'Rare'. Representa un proxy del estatus social y la edad.

📍 Tamaño de la Familia (Family Size): Se crea la característica 'family_size' combinando el número de hermanos/cónyuges (SibSp) y padres/hijos (Parch) a bordo, sumando 1 (el propio pasajero). Ayuda a modelar dinámicas familiares.

📍 Pasajero Solitario (Is Alone): Variable binaria calculada directamente de la familia. Toma el valor de 1 si 'family_size' es igual a 1, y 0 en caso contrario. Aísla estadísticamente a quienes viajaban de manera independiente.

5 of 8

Resultados: Random Forest Classifier

📍 Espacio de Búsqueda de Hiperparámetros: Se optimizaron mediante GridSearchCV:� • n_estimators: [100, 200, 300]� • max_depth: [5, 10, None]� • min_samples_split: [2, 5, 10]

📍 Desempeño en Validación Cruzada (CV): • Accuracy Promedio: 81.46%�• F1-score Promedio: 75.92%�• Precision Promedio: 77.84% | Recall Promedio: 74.20%

📍 Ventajas Observadas: Alta robustez frente a sobreajuste gracias al ensamble y un buen comportamiento de precisión, reduciendo falsos positivos.

6 of 8

Resultados: Support Vector Machine (SVM)

📍 Configuración del Modelo SVM: • Kernel: RBF (Función de Base Radial)�• Hiperparámetros optimizados en cuadrícula: C (parámetro de penalización) y gamma (coeficiente del kernel).

📍 Desempeño en Validación Cruzada (CV): • Accuracy Promedio: 81.60%�• F1-score Promedio: 76.15%�• Precision Promedio: 76.32% | Recall Promedio: 76.01%

📍 Comparativa vs Random Forest: SVM logra un F1-score ligeramente superior (76.15% vs 75.92%) debido a un mejor balance de Recall, lo que significa que es más sensible para capturar supervivientes reales.

7 of 8

Gobernanza Algorítmica y Sesgo en IA

📍 Sesgo Histórico (Historical Bias): La supervivencia del Titanic estuvo fuertemente ligada a factores sociales de 1912: la regla implícita de 'mujeres y niños primero' y el acceso privilegiado de la primera clase frente a la clase trabajadora.

📍 Perpetuación de Desigualdades: Si un algoritmo moderno de salvamento marítimo se entrena directamente con estos datos históricos sin auditoría, aprenderá que salvar a los hombres y a las clases trabajadoras es una prioridad estadística menor, discriminándolos activamente.

📍 Necesidad de Ética de Datos: La toma de decisiones automatizada no es neutra (Béranger, 2018; Carsten, 2020). Los científicos de datos deben auditar e intervenir los datasets para mitigar la discriminación algorítmica y asegurar la equidad (fairness).

8 of 8

Conclusiones y Lecciones Aprendidas

📍 1. Robustez Técnica del Pipeline: El uso de ColumnTransformer y Pipeline de scikit-learn garantizó una estructura limpia y escalable. Prevenir la fuga de datos es indispensable para obtener métricas realistas y listas para producción.

📍 2. Resultados Competitivos y Complementarios: Random Forest demostró mayor precisión (menos falsos positivos), mientras que SVM demostró mayor sensibilidad (Recall). Ambos modelos mantuvieron un accuracy sólido del 81%.

📍 3. El Rol de la Ética en Machine Learning: Los algoritmos de IA no solo procesan números, reproducen contextos sociales. La automatización sin principios de equidad puede dar lugar a la institucionalización tecnológica de sesgos discriminatorios.