1 of 22

Análisis Geoespacial de incidencia delictiva para predicción de situaciones de emergencia

Integrantes:

Alberto Gutiérrez Torres

Emili Hernandez

Manuel Eduardo Avalos Mellado

Valeria Rojas Lhoman

Mario Holguin

Erick Rodriguez

Team 13

2 of 22

Introducción

Las corporaciones de Seguridad Pública y Despacho de emergencias policiales, médicas y de rescate, concentran las comunicaciones y el despliegue de sus recursos en Centrales de emergencia (911); una persona, al tener un incidente, marca a la línea de emergencia, en donde un operador telefónico le realiza una breve entrevista, esto para recabar, primeramente, la información mínima necesaria para poner al tanto a la corporación a la que le corresponda el asunto (basándose en ese sondeo), primero, obtienes la ubicación de la persona en peligro, después información del suceso, con lo cual se clasificará en base a un catálogo estandarizado de incidentes, y con esto se canalizará a un despachador de la corporación a la que le competa: Policías municipales, estatales, Federales, Cruz Roja, Bomberos,grupos de Rescate, entre otros.

3 of 22

Introducción

La información recabada durante estas llamadas, se almacena, junto con un registro de eventos que comienza con el flujo de el incidente, y termina con el cierre del mismo, esto es, el despliegue de una unidad de la corporación correspondiente y la atención al ciudadano; es importante tener una estrategia eficiente en cuanto al estado de fuerza (el recurso humano desplegado), mismo que es limitado; asimismo, es importante patrullar las zonas identificadas como de alto impacto con mayor eficiencia, ya que al no haber una unidad cercana al momento de que ocurra una emergencia, dependiendo de la naturaleza de la misma, puede haber consecuencias, en el peor de los casos, fatales.

4 of 22

  • Optimización del Despliegue de Unidades: Mejorar la eficiencia en el despliegue de unidades de emergencia mediante el análisis de patrones históricos de incidentes, lo que permitirá una respuesta más rápida y precisa.

  • Predicción de Incidentes: Desarrollar un modelo de inteligencia artificial que prediga el tipo de incidente con mayor probabilidad de ocurrir en un periodo específico, utilizando los datos históricos del Sistema de Despacho de emergencias 911.

Objetivos

5 of 22

Descripción del problema

Se requiere hacer un análisis de los datos recabados por el Sistema de Despacho de emergencias 911, esto para ayudar en labores de inteligencia y despliegue de unidades de forma oportuna; asimismo, se desea tener un modelo que prediga el tipo de incidente relevante con mayor tendencia a ocurrir, basándonos en información histórica recabada por la dependencia.

6 of 22

  • Falta de estandarización en la recopilación y categorización de estos datos a nivel local y regional dificulta su integración y análisis a gran escala.

  • Capacidad limitada para identificar patrones complejos y dinámicos en los datos geoespaciales.

Áreas de Ineficiencia

7 of 22

  • La implementación de IA y Machine Learning puede mejorar significativamente estas áreas de ineficiencia.

  • Los modelos de aprendizaje automático pueden procesar grandes volúmenes de datos de múltiples fuentes, identificando patrones ocultos y relaciones no lineales que los métodos convencionales podrían pasar por alto.

  • Permite la actualización en tiempo real de los modelos predictivos, adaptándose a cambios en los datos y proporcionando alertas más precisas y oportunas sobre posibles incidentes delictivos.

Identificación de Soluciones

8 of 22

Definición de los datos

Columnas y Tipos de Datos

Basado en la descripción y en los datos provistos, podríamos esperar las siguientes columnas en el dataset teórico:

  1. lat (Latitud): Coordenada geográfica en formato decimal. Tipo: float.
  2. lng (Longitud): Coordenada geográfica en formato decimal. Tipo: float.
  3. desc (Descripción del Incidente): Texto que describe el incidente de emergencia. Tipo: string.
  4. zip (Código Postal): Código postal donde ocurrió el incidente. Tipo: int o string.
  5. title (Título del Incidente): Clasificación y subclasificación del incidente. Puede incluir tipo de emergencia y una categoría más específica. Tipo: string.
  6. timeStamp (Fecha y Hora): Marca temporal indicando cuándo ocurrió o se reportó el incidente. Tipo: datetime.
  7. twp (Municipio): Nombre del municipio o localidad donde ocurrió el incidente. Tipo: string.
  8. addr (Dirección): Dirección específica del incidente. Tipo: string.
  9. e (EID, Número de Identificación del Incidente): Un identificador único para cada incidente. Tipo: int.

Descripción del Dataset Teórico

Este dataset está diseñado para almacenar y procesar información relacionada con incidentes de emergencia registrados por un servicio de emergencia. El dataset contiene datos geoespaciales y descripciones categorizadas de cada incidente, permitiendo su análisis y visualización en mapas, así como su clasificación en diferentes tipos de emergencias.

9 of 22

Cantidad de Datos Necesaria

La cantidad de datos necesaria para un análisis efectivo puede variar dependiendo del tipo de análisis y modelo que se desee entrenar. Sin embargo, para modelos de aprendizaje automático y visualización geoespacial, se recomendaría contar con un dataset que contenga al menos:

  • Entrenamiento: Entre 10,000 y 100,000 registros para permitir una buena generalización del modelo.
  • Validación: Alrededor de 10% a 20% del dataset de entrenamiento para ajustar los hiperparámetros.
  • Pruebas: Un conjunto de pruebas independiente de al menos 10,000 registros para evaluar el desempeño del modelo.

10 of 22

Visualización del DB

11 of 22

Análisis de sesgos en los datos

1. Sesgos Geoespaciales:

  • Coordenadas Inválidas:
    • Posible Sesgo: Las coordenadas (latitud y longitud) pueden ser técnicamente válidas en cuanto a formato, pero podrían no corresponder a ubicaciones reales o relevantes para el análisis (e.g., puntos en medio del océano, coordenadas que no pertenecen a la región de interés).
    • Impacto: Estos puntos inválidos pueden distorsionar la visualización en mapas y afectar cualquier análisis geoespacial o modelado basado en la ubicación.
    • Mitigación: Realizar una validación de coordenadas, cruzando los puntos con una base de datos de ubicaciones válidas o utilizando técnicas de clustering para identificar y eliminar puntos que no correspondan a ubicaciones esperadas.

2. Campos Vacíos o Faltantes:

  • Posible Sesgo:
    • Campos como la descripción del incidente, el código postal, la dirección, o la clasificación del incidente podrían estar vacíos o incompletos.
    • Impacto: La falta de información puede conducir a errores en la clasificación de incidentes o a una mala interpretación del contexto geoespacial. Esto también podría afectar modelos de predicción, que dependen de datos completos y precisos.
    • Mitigación: Implementar técnicas de imputación de datos faltantes donde sea posible, o bien, excluir registros con demasiados datos faltantes del análisis.

12 of 22

Análisis de sesgos en los datos

3. Sesgos de Clasificación:

  • Posible Sesgo:
    • Si los incidentes están categorizados de manera inconsistente (e.g., un mismo tipo de incidente clasificado bajo diferentes nombres o categorías), esto puede introducir un sesgo en la forma en que los modelos interpretan los datos.
    • Impacto: Podría afectar la precisión de cualquier modelo de clasificación entrenado con estos datos, llevando a predicciones incorrectas.
    • Mitigación: Revisar y normalizar las categorías de incidentes para asegurar una clasificación coherente en todo el dataset.

4. Sesgos Temporales:

  • Posible Sesgo:
    • Si hay una sobre-representación de incidentes en ciertos periodos de tiempo (e.g., ciertos meses del año o ciertas horas del día), esto puede sesgar los análisis temporales y los modelos de predicción.
    • Impacto: El modelo podría estar sobreajustado a patrones temporales específicos y fallar en generalizar a otros periodos.
    • Mitigación: Balancear el dataset temporalmente o utilizar técnicas de muestreo para asegurar una representación adecuada de todos los periodos.

13 of 22

Análisis de sesgos en los datos

5. Sesgos Demográficos o Regionales:

  • Posible Sesgo:
    • Los datos pueden estar sesgados hacia ciertas regiones, municipios, o códigos postales, lo que puede no reflejar con precisión la distribución de los incidentes a nivel nacional o regional.
    • Impacto: Los análisis podrían dar una visión distorsionada de la situación general, o los modelos podrían no generalizar bien a regiones sub-representadas.
    • Mitigación: Asegurarse de que el dataset sea representativo de todas las regiones relevantes o aplicar técnicas de ponderación para balancear la representación.

14 of 22

Mitigación de sesgos en Knime

A nivel del prototipo en la plataforma utilizada para este proyecto (knime) se cuentan con diversos nodos para tratamiento, limpieza y normalización de datos.

En el caso del dataset de prueba, se observa que hay columnas que contienen datos de tipo string que a su vez, manejan separadores, conteniendo más de un campo en una sola columna, por lo que se identifica como área de oportunidad, el realizar un “split” de los mismos, además de celdas con datos vacíos.

15 of 22

Descripción de las Soluciones de IA:

Se utilizarán modelos de machine learning supervisado, como algoritmos de regresión, para predecir la probabilidad de incidentes. Esto, se integrará en el proceso de seguimiento a incidencias existentes, donde se evaluará automáticamente el riesgo.

Selección del tipo de aprendizaje: Regresión�se utilizó este tipo de aprendizaje principalmente porque:

  • La naturaleza continua y relacional de los datos, la regresión es particularmente efectiva cuando se trata de predecir una variable dependiente continua en función de una o más variables independientes.

En el contexto del Sistema de Despacho de emergencias 911, se puede utilizar la regresión para modelar la relación entre factores históricos (como la hora del día, ubicación, clima, etc.) y la frecuencia o probabilidad de tipos de incidentes específicos.

  • Interpretabilidad, permite entender cómo cada variable independiente afecta el resultado predicho, lo que es crucial para mejorar la toma de decisiones en un sistema tan sensible como el despacho de emergencias.

Los coeficientes generados por el modelo pueden ser analizados para comprender la influencia de factores como la densidad poblacional, condiciones climáticas o eventos especiales en la probabilidad de que ocurra un determinado tipo de incidente.

16 of 22

Estrategias para Superar Obstáculos

  • Capacitación del personal: Se proporcionará formación sobre el uso de la nueva tecnología de probabilidad de incidentes para que se puedan tomar todas las medidas preventivas necesarias.
  • Gestión del cambio: Se establecerán comunicaciones claras y periódicas para explicar los beneficios y objetivos de la implementación de IA.
  • Monitoreo y Evaluación Continua: Se implementarán procesos de seguimiento y evaluación para identificar cualquier problema o desafío, así como, invitar al equipo a participar en solicitudes de ajustes y mejoras continuas.

17 of 22

Plan de Recursos Necesarios

  • Presupuesto: se cuenta con un presupuesto para el desarrollo, implementación y mantenimiento de las soluciones de IA, que permitirá poner en marcha el proyecto y capacitar al personal.
  • Personal: Se requerirá un equipo multidisciplinario que incluya científicos de datos, ingenieros de software, analistas de seguridad cibernética para desarrollar, implementar y mantener las soluciones de IA
  • Tecnología: Se necesitará infraestructura de TI robusta y escalable, incluyendo servidores de alto rendimiento, bases de datos seguras y software de análisis de datos

18 of 22

  • Fase 1 (Meses 1-3): Desarrollo y entrenamiento inicial de modelos de IA.
  • Fase 2 (Meses 4-6): Integración de modelos en el proceso de registro de incidentes y pruebas piloto
  • Fase 3 (Meses 7-12): Implementación completa en producción y monitoreo inicial de resultados
  • Fase 4 (Meses 13-24): Optimización continua de modelos y procesos, evaluación de resultados y ajustes según sea necesario

Cronograma de Implementación

19 of 22

Anexos Knime

20 of 22

Anexos Knime

21 of 22

Conclusión

La inteligencia Artificial, como herramienta en el establecimiento de la “policía 2.0”, de la mano de otras herramientas tecnológicas en temas como el equipamiento táctico, ciberseguridad, comunicaciones, tienen un impacto positivo en el combate frontal a la delincuencia, sino también fortalecer la relación con la comunidad y a aumentar la transparencia y la confianza pública, por lo que es importante realizar esfuerzos por integrar estas tecnologías en las estrategias de lucha y prevención contra el crimen.

22 of 22