Ética Práctica
para Ciencia de Datos
Soy investigadora en CONICET y profesora en FAMAF, donde investigo sobre evaluación de errores y sesgos sociales de modelos generativos multimodales.
También soy directiva de Khipu (Latinoamericanos en IA)
2
Foto tomada en la Cumbre de AI Safety, Inglaterra, Nov 2023
DiploDatos
Ética Práctica
Protección de Datos Personales: Ley 25.326
La Ley 25.326, sancionada el 4 de octubre de 2000, establece un marco legal para la protección de los datos personales en Argentina. Esta ley define los conceptos clave relacionados con la información personal, incluyendo los datos sensibles, y establece los derechos de los titulares de los datos, así como las obligaciones de quienes los tratan.
Definiciones Clave
Datos Personales
Información sobre personas físicas o jurídica, ya sean almacenados o inferibles.
Datos Sensibles
Datos personales que revelan información delicada que puede causar discriminación o riesgos graves, como el origen racial, opiniones políticas o la salud. (lo vemos en otro slide)
Titular de los Datos
Persona cuyos datos son objeto del tratamiento al que se refiere la ley.
Disociación de Datos
Tratamiento de datos personales de manera que la información obtenida no pueda asociarse a una persona determinada.
Principios del Tratamiento de Datos
La ley establece principios fundamentales para el tratamiento de datos personales, asegurando que la información se maneje de manera responsable y ética. Estos principios incluyen la certeza, la pertinencia, la no excesividad y la actualización de los datos.
1
Certeza
Los datos recolectados deben ser ciertos y veraces.
2
Adecuación y Pertinencia
Los datos deben ser adecuados y pertinentes al ámbito y finalidad para los que se obtuvieron.
3
No Excesividad - Minimización
Los datos no deben ser excesivos en relación con el ámbito y finalidad para los que se obtuvieron.
4
Actualización
Los datos deben ser exactos y actualizarse cuando sea necesario.
Finalidades del Tratamiento
La ley prohíbe el uso de datos personales para finalidades distintas o incompatibles con aquellas que motivaron su obtención. Esto significa que la información solo puede utilizarse para los propósitos para los que fue recopilada inicialmente.
Obtención
Los datos se recopilan para un propósito específico comunicado en el consentimiento informado.
Tratamiento
Los datos se procesan y almacenan de acuerdo con la finalidad inicial.
Uso
Los datos se utilizan únicamente para la finalidad para la que fueron recolectados. A menos que estén en el dominio público por licencia.
Consentimiento Informado
El tratamiento de datos personales es ilícito si el titular no ha dado su consentimiento libre, expreso e informado. Este consentimiento debe constar por escrito o por otro medio que permita su equiparación.
Consentimiento
El titular de los datos debe dar su consentimiento libre, expreso e informado.
Excepciones
No se requiere consentimiento en casos como la obtención de datos de fuentes públicas como la web (pero hay que ver licencias https://www.dataprovenance.org/data-provenance-explorer/web-data-explorer) .
Información
Se debe informar al titular sobre la finalidad del tratamiento, los destinatarios de los datos y sus derechos.
El uso ilegítimo de fuentes abiertas (web scraping indiscriminado) viola el principio de finalidad y expone a las organizaciones a litigios.
Categoría de Datos Sensibles
La ley establece que ninguna persona puede ser obligada a proporcionar datos sensibles, como aquellos que revelan origen racial, opiniones políticas o información sobre la salud.
Datos Sensibles
Ejemplos
Origen racial y étnico
Raza, origen étnico
Opiniones políticas
Afiliación política, creencias políticas
Convicciones religiosas
Religión, creencias religiosas
Información sobre la salud
Condiciones médicas, historial médico
Vida sexual
Orientación sexual, prácticas sexuales
Seguridad y Confidencialidad
El responsable del archivo de datos debe adoptar medidas técnicas y organizativas para garantizar la seguridad y confidencialidad de los datos personales. Esto incluye evitar la adulteración, pérdida, consulta o tratamiento no autorizado de la información.
Seguridad
Medidas técnicas y organizativas para proteger los datos de accesos no autorizados.
Confidencialidad
Mantener la información privada y evitar su divulgación no autorizada.
Integridad
Garantizar la exactitud y la integridad de los datos.
Disponibilidad
Asegurar el acceso a los datos cuando sea necesario.
Deber de Confidencialidad
El responsable y las personas que intervengan en el tratamiento de datos personales están obligados al secreto profesional respecto de los mismos. Esta obligación subsiste incluso después de finalizada su relación con el titular del archivo de datos.
1
Tratamiento
Durante el proceso de tratamiento de datos personales.
2
Finalización
Incluso después de que la relación con el titular del archivo de datos haya terminado.
3
Excepciones
Se puede liberar del deber de secreto por resolución judicial o por razones de seguridad pública, defensa nacional o salud pública.
Derecho de Acceso, Rectificación y Supresión
El titular de los datos tiene derecho a solicitar y obtener información sobre sus datos personales incluidos en bancos de datos públicos o privados. También tiene derecho a que sean rectificados, actualizados y, cuando corresponda, suprimidos o sometidos a confidencialidad los datos personales de los que sea titular.
Derecho de Acceso
Solicitar y obtener información sobre sus datos personales.
Derecho de Rectificación
Solicitar la corrección de datos inexactos o incompletos.
Derecho de Supresión
Solicitar la eliminación de datos personales cuando corresponda.
Ley desactualizada?
$100k
ARS (Multa Máxima Ley 25.326)
Sanciones Desactualizadas
Sancionada en el año 2000, la Ley 25.326 fijó topes punitivos que quedaron totalmente desfasados frente a la inflación y al volumen del mercado digital actual.
Esta falta de disuasión económica motivó el debate de proyectos de reforma inspirados en estándares internacionales para prevenir el mal uso masivo de datos.
Ley desactualizada? Montos desactualizados
Pequeño Análisis Regional
Argentina (Ley 25.326) vs Brasil (LGPD - Ley 13.709/2018)
Criterio | Argentina (Ley 25.326) | Brasil (LGPD - Ley 13.709) |
Sanciones Económicas | Tope máximo de $100.000 ARS (Simbólico). | Hasta el 2% de la facturación (máx. 50M BRL por infracción). |
Alcance Extraterritorial | No previsto explícitamente en el texto original. | Aplica si procesa datos de personas ubicadas en Brasil. |
Oficial de Protección (DPO) | No es obligatorio por ley. | Obligatorio (Encarregado de Proteção de Dados). |
Bases Legales de Tratamiento | Limitadas (Consentimiento, Ley, Contrato). | 10 bases legales (incluye Interés Legítimo explícito). |
Notificación de Brechas | Sin plazo legal estricto en el texto base. | Obligatoria a la ANPD y al titular en tiempo razonable. |
Cuadro Comparativo: Argentina vs Brasil
Enforcement en Brasil (LGPD)
Airbnb tuvo que adaptar rigurosamente su Política de Privacidad con adendas locales para Brasil, regulando el uso de datos biométricos (reconocimiento facial para verificación) y garantizando el ejercicio de derechos ante la ANPD bajo amenaza de multas millonarias.
Realidad en Argentina
A pesar de operar localmente, el bajo nivel de multas administrativas de la AAIP limita el impacto disuasivo. La protección efectiva de usuarios argentinos suele depender más de estándares fijados por los clientes que del enforcement local.
Caso Práctico: Airbnb en la Región
2000
Ley 25.326 en Argentina (Pionera en adecuación con la UE).
2018
Entra en vigor el GDPR (UE) y se sanciona la LGPD en Brasil.
Presente
Proyectos de actualización de la Ley 25.326 hacia el modelo GDPR.
Futuro
Regulación integrada de Inteligencia Artificial y Modelos LLM.
Evolución Regulatoria de Datos
LEGAL ≠ ÉTICO
Luciana Benotti
Luciana Benotti
Luciana Benotti
Watermarking en IA Generativa
Regulación Europea (EU AI Act),
de la “autoregulación”
a la ley
el caso Anthropic y la detección de datasets sintéticos.
Luciana Benotti
Obligación de Transparencia (Art. 50.2)
Los proveedores de sistemas de IA generativa (texto, audio, imagen y vídeo) deben garantizar que las salidas estén marcadas en un formato legible por máquina y detectable como contenido generado sintéticamente.
La normativa exige interoperabilidad, robustez tecnológica e imposibilidad de manipulación directa por parte de los usuarios finales.
Despliegue Global Unificado
Grandes empresas tecnológicas (Anthropic, Google) están aplicando estas marcas a nivel global quizás debido a la inviabilidad técnica de fragmentar los modelos por región.
El estándar técnico se alinea con iniciativas de procedencia como C2PA y marcas de agua estadísticas en logits.
EU AI Act: Artículo 50
Luciana Benotti
Sin alteración visible: No introduce caracteres invisibles ni modifica el formato del texto plano resultante.
Sesgo de Logits: Al generar token por token, el modelo selecciona palabras basándose en una clave pseudo-aleatoria predefinida.
Calidad: Promete mantener la fluidez, coherencia y sentido del texto sin afectar la experiencia del usuario.
Verificación matemática: Con la clave del proveedor se calcula la probabilidad estadística de que el texto haya sido generado por el modelo con un test de hipótesis.
•
•
•
•
Watermarking Estadístico en LLMs
Source: Watermarking for Large Language Models: A Survey. Mathematics, 13(9), 1420. 2025. https://doi.org/10.3390/math13091420
Luciana Benotti
Tecnología | Resistencia a Edición | Caso de Uso Principal |
Watermarking Logit (Claude/Anthropic) | Media - Alta (Soporta Copy/Paste) | Texto LLM / Auditoría de datasets de texto |
Metadatos Cryptográficos (C2PA) | Baja (Se pierde al re-grabar/exportar) | Verificación de origen en imágenes y audio |
Watermarking Visual/Pixel (SynthID) | Alta (Resiste recortes/filtros) | Imágenes sintéticas y vídeos deepfake |
Clasificadores Heurísticos / PPL | Baja (Susceptible a paráfrasis) | Detección sin clave propietaria del modelo |
Comparativa de Metodologías de watermarking
Luciana Benotti
Implementación Global de Claude
Anthropic anunció la incorporación de marcas de agua estadísticas en las salidas de sus modelos Claude (API, Claude Code, Cowork) para cumplir con el EU AI Act.
La marca se conserva tras operaciones de copiar y pegar, permitiendo identificar la autoría algorítmica.
Debate sobre "Sobre-cumplimiento"
Crítica de la industria: La marca persiste incluso cuando Claude se usa solo para revisión gramatical o edición ligera de texto humano previo.
Surgen preocupaciones sobre privacidad, propiedad intelectual y la proliferación de herramientas para remover marcas ("unwatermarking").
Caso Anthropic: Debate e Impacto
Luciana Benotti
El Caso Anthropic y Claude
Análisis de la primera implementación masiva de watermarking estadístico en texto
Luciana Benotti
100%
Trazabilidad Requerida
Nuevo Estándar en la Industria?
El movimiento de Anthropic establece un precedente para el resto de los proveedores de IA. Los watermarks podrían dejar de ser una función opcional para quizás convertirse en un requisito de auditoría y compliance en contratos empresariales.
Esto puede redefinir las reglas de juego para la generación y venta de datos y la generación de código y texto.
En las conferencias más prestigiosas del mundo hay un aumento muy grande de cantidad de papers enviados y de sospecha de que son generados con LLMs, y no sólo los artículos, también las evaluaciones y los conjuntos de datos (crowdworkers -> LLMS).
Impacto del Watermark
Luciana Benotti
Detección de Datasets Sintéticos
Cómo utilizar el watermarking para auditar la calidad de datos
Luciana Benotti
Detección de Datasets Sintéticos
Cómo utilizar el watermarking para auditar la calidad de datos
Luciana Benotti
Datos Sintéticos Fraudulentos vs Uso Controlado
Característica | Fraude por Respuestas Maliciosas de LLM | Investigación Sintética Controlada |
Intención | Robar, falsificar participación | Simular tendencias, probar conceptos |
Calidad de los datos | Genérica, con alucinaciones, engañosa | Estructurada, calibrada |
Impacto en la fuente | Destruye la credibilidad del conjunto de datos | Cero impacto en los grupos de encuestados reales |
Impacto en los costos | Alto desperdicio financiero en pagos no válidos | Reduce los costos de investigación en etapas iniciales |
Luciana Benotti
Paso 1: Muestreo
Extracción de muestras estadísticas del dataset recibido antes del pago o ingesta.
Paso 2: Verificación
Ejecución de algoritmos de detección de marcas de agua (Anthropic, SynthID, C2PA).
Paso 3: Análisis
Evaluación de la distribución de tokens y desviaciones estadísticas no humanas.
Paso 4: Certificación
Aceptación del lote, penalización por incumplimiento de SLA o rechazo total.
Protocolo de Auditoría de Datos
Luciana Benotti
Watermarking en IA Generativa
Regulación Europea (EU AI Act), de la ética a la ley
el caso Anthropic y la detección de datasets sintéticos.
Luciana Benotti
Preguntas éticas
Definiciones y terminología
DiploDatos
Ética Práctica
El dilema del pollito
36
gallina
pollo
El dilema del pollito
37
gallina
pollo
Ético?
Quién sufre daño?
El dilema del pollito
38
El dilema del IQ
39
El dilema del IQ
Podemos intentar entrenar un clasificador para predecir el CI a partir de fotos y textos. Preguntas para analizar si es ético construir esa tecnología y cuáles son los riesgos..
Estas preguntas nos ayudan a ser conscientes del impacto de nuestro trabajo sobre la gente
40
“AI Gaydar”, 2017
41
“AI Gaydar”
42
El dilema del AI Gaydar
Preguntas para analizar si es ético construir esa tecnología y cuáles son los riesgos.
Estas preguntas nos ayudan a ser conscientes del impacto de nuestro trabajo sobre la gente
43
44
44
Luciana Benotti
Cuánta conciencia de preguntas fundamentales de ética hay en un área de Ciencia de Datos (NLP)?
Surgen para las ciencias de la salud, pero se extendieron a muchas otras ciencias, operacionalizan declaración de derechos humanos (ONU, 1948)
Principios de las ciencias de la salud (Declaración Helsinki 1964)
Ética en tiempos de IA y LLMs
Recipe of a generative AI model
53
Luciana Benotti
54
Luciana Benotti
55
Luciana Benotti
2. Pretraining
56
Source: Solaiman (2023)
But also:
Luciana Benotti
2. Pretraining
57
Sources: HPE (2021), Luccioni et al., 2022, 2023
Luciana Benotti
3. Human Interaction
58
Source: TIME Magazine
Luciana Benotti
What can be done?
(or rather, what is being done?)
Luciana Benotti
Data
Luciana Benotti
Data and Consent
61
Luciana Benotti
Understanding and Exploring Data
62
Luciana Benotti
Es tu turno: Data statements
63
Luciana Benotti
Acceso a frameworks
Luciana Benotti
¿Qué tipos de análisis podemos realizar?
Fairness
Utilizar indicadores de fairness para detectar posibles inequidades en datos y modelos.
Explicabilidad
Dado un modelo nos ayuda a comprender mejor su comportamiento.
Luciana Benotti
¿Cómo se relacionan estos conceptos?
La gran mayoría de las técnicas de fairness se basan en la existencia de variables protegidas explícitas, que suelen ser datos demográficos.�
Muchas veces no vamos a contar con esta información pero el modelo podría tener comportamientos poco deseados o injustos de igual manera.
Luciana Benotti
¿Cómo se relacionan estos conceptos?
Poder entender y explicar el comportamiento del modelo es fundamental, muchas veces no basta con analizar/optimizar métricas de fairness.
Si entendemos sesgo como “errores sistemáticos” entender el comportamiento de nuestro modelo nos ayuda a detectar sesgos.
Luciana Benotti
¿Qué tipos de análisis podemos realizar?
Fairness
Utilizar indicadores de fairness para detectar posibles inequidades en datos y modelos.
¿Cómo definimos comportamiento injusto?
Explicabilidad
Dado un modelo nos ayuda a comprender mejor su comportamiento.
¿Que queremos entender?
Luciana Benotti
¡Depende de la aplicación y el contexto de uso!
Luciana Benotti
¿Porque utilizar frameworks orientados a ética?
Luciana Benotti
¿Porque utilizar frameworks orientados a ética?
Estas herramientas permiten que un experto de dominio pueda conducir análisis del modelo sin necesidad de saber programar, encontrando errores y facilitando el desarrollo iterativo.
Luciana Benotti
¿Porque utilizar frameworks orientados a ética?
Si bien hay partes del que se repiten el análisis depende tanto del contexto y los casos de uso que si se escribe código para cada parte del proceso puede volverse muy tedioso, gasta demasiado tiempo y esto dificulta el análisis.
Luciana Benotti
¿Porque utilizar frameworks orientados a ética?
Estas herramientas permiten acceder a comportamiento interno del modelo en el caso de modelos neuronales. Para todo tipo de modelo nos permiten encontrar casos borde, datos mal etiquetados, mala performance del modelo en grupos particulares, etc
Luciana Benotti
¿Porque utilizar frameworks orientados a ética?
Muchos de estos modelos nos permiten agregar datos artificiales de manera sencilla, incluyen procesos de data augmentation, agregan ruido, hacer análisis de ablacion, de causalidad, etc...
Luciana Benotti
¿Porque utilizar frameworks orientados a ética?
En muchos casos las métricas tradicionales no van a ser suficientes como medida de calidad de los modelos.
Es necesario entender en profundidad el comportamiento de los modelos, sobretodo cuando estos impactan en la vida de las personas.
Luciana Benotti
Algunos frameworks para python:
What-if tool: Orientado a métricas de fairness, exploración de datos tabulares y contrafácticos. Tiene soporte para imágenes y texto. UI interactiva, no hace falta escribir código.
Scikit Fairness: Ofrece herramientas para cada etapa del pipeline de datos: datos, preprocesamiento, modelo, post-procesamiento y métricas. Requiere escribir bastante código. Curva de aprendizaje alta.
Fairlearn: Métricas de fairness, algoritmos de mitigación, visualizaciones. Recursos educativos y buena documentación, pero requiere mucha escritura de código y tiene una complejidad técnica alta.
Luciana Benotti
Algunos frameworks para python:
What-if tool: Orientado a métricas de fairness, exploración de datos tabulares y contrafácticos. Tiene soporte para imágenes y texto. UI interactiva, no hace falta escribir código.
Scikit Fairness: Ofrece herramientas para cada etapa del pipeline de datos: datos, preprocesamiento, modelo, post-procesamiento y métricas. Requiere escribir bastante código. Curva de aprendizaje alta.
Fairlearn: Métricas de fairness, algoritmos de mitigación, visualizaciones. Recursos educativos y buena documentación, pero requiere mucha escritura de código y tiene una complejidad técnica alta.
Luciana Benotti
Algunos frameworks para python:
Shap-index/values: Orientado a explicabilidad. Los valores Shapley son un concepto del campo de teoría de juegos cooperativos cuyo objetivo es medir la contribución de cada jugador en el juego. Requiere escribir código.
AllenNLP: Orientado a explicabilidad de modelos de NLP. Complejidad técnica alta. Requiere mucho expertise en NLP, pero está bien documentado. Requiere escribir código.
LIT (Language Interpretability Tool): Orientado a explicabilidad de modelos de NLP. Complejidad técnica baja. Puede usarse a distintos niveles de profundidad técnica. Muy adaptable a casi cualquier tipo de modelo de texto. Buena documentación y soporte activo, sigue en desarrollo activo. Desarrollado por Google
Alibi: Orientado a explicabilidad, incluye técnicas para imágenes y texto. Requiere escribir código.
Luciana Benotti
Algunos frameworks para python:
Yellowbrick: Orientado a visualización de varias métricas de evaluacion de clusters. MInimiza escritura de código comparado a otras herramientas de visualizacion.
Presidio: Orientado a anonimización de datos. Provee analiticas y anonimización para textos sensible como números de tarjetas de cŕedito, nombres, lugares, números de seguridad social, billeteras de bitcoins, números de teléfono de EEUU y datos financieros.
Aequitas: toolkit para auditar modelos de AA orientado a desarrolladores, analistas, organizaciones gubernamentales y entes legislativos.
Luciana Benotti
Conclusión
Los frameworks nos dan libertad para realizar mucho análisis sin escribir código.� �Nos permiten formular hipótesis y descartarlas rápidamente.�
El análisis debe adaptarse a los distintos casos de uso de nuestras aplicaciones
Es fácil perderse en el análisis y no tener conclusiones claras
Inspección sencilla de los datos
¿Podría ser utilizado por personas no técnicas?
Luciana Benotti
More on privacy
Luciana Benotti
Trends in Language Modeling
82
E Bender et al. On the Dangers of Stochastic Parrots: Can Language Models Be Too Big?🦜. FAccT 2021
Luciana Benotti
Large Models are Leaky!
83
xkcd.com/2169/
Luciana Benotti
What does preserving privacy in language modeling require?
84
which people know the secret (the "in-group")?
what information is contained in the secret?
in what contexts a secret can be shared without violating privacy?
Brown, Hannah, et al. "What Does it Mean for a Language Model to Preserve Privacy?." FACcT 2022
Luciana Benotti
Challenges in Identifying Secrets
85
Language evolves, and so does private information.
Repeated information can still be private information.
Form and Meaning: There are many ways to communicate any piece of information.
Luciana Benotti
Privacy Expectations: What Are We Doing Now?
Scrubbing:
Differential Privacy:
86
Luciana Benotti
Privacy Expectations: What Are We Doing Now?
87
Luciana Benotti
What Can We Do?
88
Luciana Benotti
What Can We Do?
89
Luciana Benotti
AI Belongs to Everyone
90
Luciana Benotti
Costs of Generative AI
91
Answer all your burning questions
Chat about any topic
Generate realistic images
Do your homework for you
“AGI”
Exploitation of underpaid workers
Copyright infringement
Tonnes of carbon emissions
Huge quantities of energy/water
Rare metals for manufacturing hardware
Biases and hallucinations
Harmful and violent content
Private information
Crowdsourced via Twitter
Luciana Benotti
Thanks!
RECREO!!
92
|
Luciana Benotti