CORPORACIÓN UNIVERSITARIA�MINUTO DE DIOS
GRUPO 10:�- Alexander Oviedo Fadul� (Ponente)�- Maria Fernanda Ruiz Paipilla�- Neheman Samir Jaller Cerchiaro�- William David Obando Lopez�
Machine Learning Avanzado�NRC-8772
AUTOMATIZACIÓN DE PROCESOS EN EL FLUJO DE TRABAJO DE MACHINE LEARNING
Predicción de Supervivencia en el Titanic aplicando Pipelines, GridSearch y Validación Cruzada
Profesor: Leonardo Valderrama García�Fecha: 21 de junio de 2026
https://colab.research.google.com/drive/1UI3mmIOlSzQ8G8PTwDHKnatIRqeD8e32
Introducción: Contexto de MLOps y el Dataset
📍 El Desafío de MLOps: La transición de modelos de ML desde scripts experimentales aislados a entornos productivos requiere estricta reproducibilidad, consistencia y trazabilidad. Automatizar los flujos es clave (Janiesch et al., 2021).
📍 Fuga de Datos (Data Leakage): Uno de los errores más comunes consiste en aplicar transformaciones a todo el dataset antes de la validación. Esto permite que información del conjunto de test se filtre al entrenamiento, inflando artificialmente el rendimiento.
📍 El Dataset del Titanic: Utilizamos los datos históricos del Titanic para demostrar la viabilidad y robustez de un flujo de trabajo limpio y estructurado mediante Pipelines y ColumnTransformers de scikit-learn.
Arquitectura del Pipeline de Modelado
📍 ColumnTransformer (Preprocesamiento Diferenciado): Permite aplicar transformaciones por tipo de datos simultáneamente:� • Variables Numéricas: Imputación por mediana y normalización estándar (StandardScaler).� • Variables Categóricas: Imputación por la moda (most_frequent) y codificación One-Hot.
📍 Encapsulamiento en un Pipeline Unificado: El ColumnTransformer y el clasificador final se acoplan en un solo pipeline de scikit-learn. El preprocesamiento se ejecuta de forma aislada e independiente en cada pliegue de entrenamiento.
📍 Optimización de Hiperparámetros y CV: El ajuste fino de parámetros con GridSearchCV se realiza directamente sobre el objeto Pipeline. Se implementa una Validación Cruzada de 5 pliegues (5-Fold CV) para medir el rendimiento de manera realista.
Ingeniería de Características Personalizada
📍 Extracción de Títulos (Title): Se procesan los nombres para extraer títulos como 'Mr.', 'Mrs.', 'Miss.', 'Master.', etc. Los títulos raros o de la nobleza se agrupan en categorías genéricas o en 'Rare'. Representa un proxy del estatus social y la edad.
📍 Tamaño de la Familia (Family Size): Se crea la característica 'family_size' combinando el número de hermanos/cónyuges (SibSp) y padres/hijos (Parch) a bordo, sumando 1 (el propio pasajero). Ayuda a modelar dinámicas familiares.
📍 Pasajero Solitario (Is Alone): Variable binaria calculada directamente de la familia. Toma el valor de 1 si 'family_size' es igual a 1, y 0 en caso contrario. Aísla estadísticamente a quienes viajaban de manera independiente.
Resultados: Random Forest Classifier
📍 Espacio de Búsqueda de Hiperparámetros: Se optimizaron mediante GridSearchCV:� • n_estimators: [100, 200, 300]� • max_depth: [5, 10, None]� • min_samples_split: [2, 5, 10]
📍 Desempeño en Validación Cruzada (CV): • Accuracy Promedio: 81.46%�• F1-score Promedio: 75.92%�• Precision Promedio: 77.84% | Recall Promedio: 74.20%
📍 Ventajas Observadas: Alta robustez frente a sobreajuste gracias al ensamble y un buen comportamiento de precisión, reduciendo falsos positivos.
Resultados: Support Vector Machine (SVM)
📍 Configuración del Modelo SVM: • Kernel: RBF (Función de Base Radial)�• Hiperparámetros optimizados en cuadrícula: C (parámetro de penalización) y gamma (coeficiente del kernel).
📍 Desempeño en Validación Cruzada (CV): • Accuracy Promedio: 81.60%�• F1-score Promedio: 76.15%�• Precision Promedio: 76.32% | Recall Promedio: 76.01%
📍 Comparativa vs Random Forest: SVM logra un F1-score ligeramente superior (76.15% vs 75.92%) debido a un mejor balance de Recall, lo que significa que es más sensible para capturar supervivientes reales.
Gobernanza Algorítmica y Sesgo en IA
📍 Sesgo Histórico (Historical Bias): La supervivencia del Titanic estuvo fuertemente ligada a factores sociales de 1912: la regla implícita de 'mujeres y niños primero' y el acceso privilegiado de la primera clase frente a la clase trabajadora.
📍 Perpetuación de Desigualdades: Si un algoritmo moderno de salvamento marítimo se entrena directamente con estos datos históricos sin auditoría, aprenderá que salvar a los hombres y a las clases trabajadoras es una prioridad estadística menor, discriminándolos activamente.
📍 Necesidad de Ética de Datos: La toma de decisiones automatizada no es neutra (Béranger, 2018; Carsten, 2020). Los científicos de datos deben auditar e intervenir los datasets para mitigar la discriminación algorítmica y asegurar la equidad (fairness).
Conclusiones y Lecciones Aprendidas
📍 1. Robustez Técnica del Pipeline: El uso de ColumnTransformer y Pipeline de scikit-learn garantizó una estructura limpia y escalable. Prevenir la fuga de datos es indispensable para obtener métricas realistas y listas para producción.
📍 2. Resultados Competitivos y Complementarios: Random Forest demostró mayor precisión (menos falsos positivos), mientras que SVM demostró mayor sensibilidad (Recall). Ambos modelos mantuvieron un accuracy sólido del 81%.
📍 3. El Rol de la Ética en Machine Learning: Los algoritmos de IA no solo procesan números, reproducen contextos sociales. La automatización sin principios de equidad puede dar lugar a la institucionalización tecnológica de sesgos discriminatorios.