# M1 · Entorno de Datos e Inteligencia Artificial **Máster en Inteligencia Artificial, Automatización y Agentes Digitales** · Next Educación · Próxima edición **6 ECTS · 12 sesiones de una hora · Responsable de producción y coordinación: Sami Halawa Ribas** ## Descripción Módulo de nivelación y encuadre. Sitúa la IA en la organización, fija el vocabulario común, monta el entorno de trabajo en Python y presenta las arquitecturas de referencia de datos e IA en cloud sobre las que se apoyan el resto de módulos. ## Competencias del módulo 1. Comprender la evolución y el alcance de la IA en organizaciones. 2. Identificar fases, entregables y roles de un proyecto de IA/GenAI. 3. Manejar un entorno de trabajo básico en Python para análisis. 4. Reconocer arquitecturas de referencia de datos e IA en Cloud. ## Evaluación | Instrumento | Peso | |---|---:| | Prácticas de sesión (cuadernos entregados) | 40% | | Caso de módulo: ficha de proyecto de IA | 40% | | Participación y defensa oral | 20% | ## Mapa de sesiones | # | Sesión | Entregable | |---:|---|---| | 1 | Qué es hoy la IA y qué no lo es | Cuaderno con la tabla de clasificación y dos párrafos de justificación. | | 2 | El ciclo de vida de un proyecto de IA | Ficha de proyecto de una página con métricas y riesgos. | | 3 | Entorno de trabajo reproducible en Python | Repositorio con estructura, entorno reproducible y cuaderno de verificación ejecutado. | | 4 | Python para análisis: datos tabulares | Cuaderno con dataset consolidado y registro de decisiones. | | 5 | Exploración y visualización orientada a decisión | Cuaderno con perfilado y figura final anotada. | | 6 | Fundamentos estadísticos imprescindibles | Cuaderno con intervalo, gráfico y conclusión escrita. | | 7 | Arquitecturas de referencia de datos | Diagrama de arquitectura y una página de justificación. | | 8 | IA en la nube: servicios y coste | Cuaderno con el modelo de coste y la recomendación. | | 9 | Datos, privacidad y uso responsable: primeras reglas | Data card completa y revisada. | | 10 | Del problema de negocio a la métrica | Cuaderno con curva de valor esperado y umbral recomendado. | | 11 | Taller integrador: ficha de proyecto | Ficha de proyecto revisada con registro de objeciones. | | 12 | Evaluación del módulo y defensa | Prueba resuelta y defensa realizada. | --- ## Programación sesión a sesión ### Sesión 01 — Qué es hoy la IA y qué no lo es **Objetivos** - Distinguir IA simbólica, aprendizaje automático, deep learning e IA generativa. - Situar el estado actual del campo y sus límites reales. - Reconocer los errores de expectativa más frecuentes en empresa. **Contenidos** - **Genealogía del campo** - De los sistemas expertos al aprendizaje estadístico - El punto de inflexión de 2012: ImageNet y GPUs - El punto de inflexión de 2017: la arquitectura Transformer - Qué cambia con los modelos fundacionales - **Anatomía de una solución de IA** - Datos, modelo, inferencia y producto - Entrenamiento vs. inferencia: quién paga qué - Modelo propio, modelo abierto o API de terceros - Dónde está realmente el coste de un sistema de IA - **Límites y expectativas** - Alucinación, sesgo y deriva: definiciones operativas - Tareas donde la IA rinde y tareas donde no - Criterios para descartar un caso de uso a tiempo - Coste de oportunidad frente a automatización clásica **Práctica — Diagnóstico de diez casos de uso** Clasificación de diez enunciados reales de empresa según técnica adecuada, dato disponible y viabilidad. 1. Leer los diez enunciados del dataset de casos. 2. Etiquetar cada uno con técnica candidata (regla, ML clásico, DL, GenAI, no-IA). 3. Estimar dato necesario y dato disponible. 4. Justificar dos descartes por escrito. - *Stack:* Python 3.11, pandas - *Entregable:* Cuaderno con la tabla de clasificación y dos párrafos de justificación. **Lecturas** - Russell & Norvig, AIMA, cap. 1 - OECD AI Principles (resumen ejecutivo) *Materiales:* `teoria/M1_S01_Que_es_hoy_la_IA_y_que_no_lo_es.html` · `code/M1_S01_Que_es_hoy_la_IA_y_que_no_lo_es.ipynb` --- ### Sesión 02 — El ciclo de vida de un proyecto de IA **Objetivos** - Descomponer un proyecto de IA en fases con entregables verificables. - Asignar roles y responsabilidades a cada fase. - Detectar los puntos donde fracasan la mayoría de los proyectos. **Contenidos** - **Fases y entregables** - Encuadre de negocio y métrica de éxito - Exploración de datos y prueba de concepto - Industrialización y despliegue - Operación, monitorización y retirada - **Roles del equipo** - Product owner de datos, data engineer, data scientist, ML engineer - El papel del experto de dominio - Quién decide el paso a producción - Modelos de gobierno: centralizado, federado, híbrido - **Modos de fallo** - La PoC eterna: síntomas y salida - Métrica técnica sin métrica de negocio - Datos que no existirán en producción - Ausencia de propietario tras el despliegue **Práctica — Mapa de proyecto end-to-end** Construcción del mapa de fases, entregables, roles y riesgos de un proyecto real elegido por el alumno. 1. Elegir un caso propio o de la lista. 2. Rellenar la plantilla de fases con entregable y criterio de aceptación. 3. Marcar los dos riesgos de mayor impacto. 4. Definir la métrica de negocio y la métrica técnica asociada. - *Stack:* Plantilla Markdown + diagrama - *Entregable:* Ficha de proyecto de una página con métricas y riesgos. **Lecturas** - CRISP-DM: guía de referencia - Google, Rules of Machine Learning (reglas 1-10) *Materiales:* `teoria/M1_S02_El_ciclo_de_vida_de_un_proyecto_de_IA.html` · `code/M1_S02_El_ciclo_de_vida_de_un_proyecto_de_IA.ipynb` --- ### Sesión 03 — Entorno de trabajo reproducible en Python **Objetivos** - Montar un entorno aislado y reproducible. - Usar cuadernos y control de versiones sin perder trazabilidad. - Fijar la convención de proyecto que se usará todo el máster. **Contenidos** - **Entornos y dependencias** - venv, conda y uv: cuándo cada uno - Fijado de versiones y ficheros de requisitos - Kernels de Jupyter y entornos múltiples - Errores clásicos de instalación y cómo leerlos - **Estructura de proyecto** - Separación data / notebooks / src / outputs - Rutas relativas y configuración externa - Semillas aleatorias y reproducibilidad - Datos sensibles fuera del repositorio - **Control de versiones para analítica** - Git básico aplicado a cuadernos - Por qué un .ipynb genera conflictos y cómo evitarlos - Commits legibles y ramas de trabajo - Publicación de resultados sin publicar datos **Práctica — Plantilla de proyecto del máster** Creación del repositorio personal que el alumno usará en todos los módulos y en el TFM. 1. Crear el entorno y fijar dependencias. 2. Generar la estructura de carpetas estándar. 3. Inicializar git con .gitignore adecuado. 4. Ejecutar el cuaderno de comprobación de entorno. - *Stack:* Python 3.11, uv/venv, Jupyter, git - *Entregable:* Repositorio con estructura, entorno reproducible y cuaderno de verificación ejecutado. **Lecturas** - Cookiecutter Data Science: estructura de proyecto *Materiales:* `teoria/M1_S03_Entorno_de_trabajo_reproducible_en_Python.html` · `code/M1_S03_Entorno_de_trabajo_reproducible_en_Python.ipynb` --- ### Sesión 04 — Python para análisis: datos tabulares **Objetivos** - Cargar, filtrar y transformar datos tabulares con solvencia. - Escribir transformaciones legibles y encadenables. - Evitar los errores silenciosos más frecuentes de pandas. **Contenidos** - **Estructuras y carga** - Series y DataFrame: modelo mental - Tipos, categorías y ahorro de memoria - Lectura de CSV, Parquet y Excel - Verificaciones mínimas tras cargar - **Transformación** - Selección, filtrado y asignación segura - groupby, agregaciones y ventanas - Uniones: tipos de join y cardinalidad - Encadenamiento con assign y pipe - **Errores silenciosos** - SettingWithCopy y vistas frente a copias - Nulos en agregaciones y comparaciones - Uniones que duplican filas sin avisar - Comprobaciones de forma y cardinalidad **Práctica — Limpieza y consolidación de un dataset comercial** Unificación de tres ficheros de ventas con claves inconsistentes y nulos. 1. Cargar y perfilar los tres ficheros. 2. Normalizar claves y tipos. 3. Unir controlando la cardinalidad. 4. Documentar cada decisión de limpieza. - *Stack:* pandas, pyarrow - *Entregable:* Cuaderno con dataset consolidado y registro de decisiones. **Lecturas** - pandas: guía de usuario, secciones de indexación y merge *Materiales:* `teoria/M1_S04_Python_para_analisis_datos_tabulares.html` · `code/M1_S04_Python_para_analisis_datos_tabulares.ipynb` --- ### Sesión 05 — Exploración y visualización orientada a decisión **Objetivos** - Perfilar un dataset con criterio antes de modelar. - Elegir el gráfico correcto para cada pregunta. - Comunicar un hallazgo en una sola figura. **Contenidos** - **Perfilado sistemático** - Distribuciones, nulos y cardinalidades - Detección de valores imposibles - Relación entre variables y con el objetivo - Fugas de información detectables en exploración - **Gramática de gráficos** - Qué gráfico para qué pregunta - Escalas, agregación y engaño visual - Color con propósito y accesibilidad - Anotación: la figura que se explica sola - **De la exploración al informe** - Del cuaderno al material presentable - Una figura, un mensaje - Qué se omite y por qué - Trazabilidad del número mostrado **Práctica — Informe exploratorio de una página** Exploración completa de un dataset y síntesis en una figura y cinco frases. 1. Perfilar el dataset y registrar anomalías. 2. Formular tres preguntas de negocio. 3. Producir la figura que responde a la más relevante. 4. Redactar el hallazgo en cinco frases. - *Stack:* pandas, matplotlib, seaborn - *Entregable:* Cuaderno con perfilado y figura final anotada. **Lecturas** - Wilke, Fundamentals of Data Visualization, caps. 5 y 29 *Materiales:* `teoria/M1_S05_Exploracion_y_visualizacion_orientada_a_decision.html` · `code/M1_S05_Exploracion_y_visualizacion_orientada_a_decision.ipynb` --- ### Sesión 06 — Fundamentos estadísticos imprescindibles **Objetivos** - Interpretar correctamente variabilidad, incertidumbre y correlación. - Evitar conclusiones inválidas en muestras pequeñas. - Preparar el terreno para la validación de modelos. **Contenidos** - **Descripción e incertidumbre** - Medidas de centralidad y dispersión: cuál engaña y cuándo - Variabilidad muestral e intervalos de confianza - Bootstrap como herramienta práctica - Tamaño de muestra y potencia - **Relación entre variables** - Correlación, causalidad y confusión - Paradoja de Simpson con un caso real - Comparación de grupos y contraste de hipótesis - p-valor: qué dice y qué no dice - **Aplicación a IA** - Por qué una diferencia de accuracy puede no significar nada - Comparación honesta entre dos modelos - Estabilidad de métricas entre particiones - Riesgo de mirar el test demasiadas veces **Práctica — ¿La diferencia es real?** Comparación de dos alternativas con bootstrap e interpretación del resultado. 1. Calcular la métrica en ambos grupos. 2. Estimar el intervalo por bootstrap. 3. Decidir si la diferencia es accionable. 4. Redactar la conclusión sin sobreafirmar. - *Stack:* numpy, scipy, pandas - *Entregable:* Cuaderno con intervalo, gráfico y conclusión escrita. **Lecturas** - Bruce & Bruce, Practical Statistics for Data Scientists, caps. 2-3 *Materiales:* `teoria/M1_S06_Fundamentos_estadisticos_imprescindibles.html` · `code/M1_S06_Fundamentos_estadisticos_imprescindibles.ipynb` --- ### Sesión 07 — Arquitecturas de referencia de datos **Objetivos** - Reconocer los patrones de arquitectura de datos más habituales. - Elegir el patrón adecuado según volumen, latencia y madurez. - Situar dónde encaja la IA dentro de la arquitectura. **Contenidos** - **Patrones** - Data warehouse, data lake y lakehouse - Batch, micro-batch y streaming - Capas bronce, plata y oro - Formatos columnares y tablas abiertas - **Decisiones de diseño** - Coste frente a latencia - Esquema en escritura o en lectura - Gobierno y catálogo desde el día uno - Antipatrones frecuentes - **Encaje de la IA** - De dónde lee el modelo en entrenamiento y en inferencia - Feature store: cuándo compensa - Datos no estructurados y su indexación - Trazabilidad del dato hasta la predicción **Práctica — Diseño de arquitectura para un caso dado** Propuesta razonada de arquitectura para un caso con requisitos de latencia y volumen explícitos. 1. Extraer requisitos del enunciado. 2. Proponer patrón y justificar el descarte de los otros. 3. Dibujar el diagrama de flujo del dato. 4. Estimar el orden de magnitud del coste. - *Stack:* Diagrama + memoria técnica - *Entregable:* Diagrama de arquitectura y una página de justificación. **Lecturas** - Reis & Housley, Fundamentals of Data Engineering, cap. 3 *Materiales:* `teoria/M1_S07_Arquitecturas_de_referencia_de_datos.html` · `code/M1_S07_Arquitecturas_de_referencia_de_datos.ipynb` --- ### Sesión 08 — IA en la nube: servicios y coste **Objetivos** - Reconocer el catálogo de servicios de IA de los principales proveedores. - Estimar el coste de una solución antes de construirla. - Decidir entre servicio gestionado y construcción propia. **Contenidos** - **Catálogo** - Cómputo, almacenamiento y servicios gestionados de IA - Modelos como servicio frente a modelos autoalojados - GPU: tipos, disponibilidad y coste real - Regiones, residencia del dato y latencia - **Modelo de coste** - Coste de entrenamiento frente a coste de inferencia - Precio por token y por hora de GPU - Estimación por unidad de negocio - Palancas de reducción de coste - **Construir o contratar** - Criterios de decisión - Dependencia de proveedor y estrategia de salida - Requisitos regulatorios que condicionan la elección - Prueba de coste antes del compromiso **Práctica — Modelo de coste de un asistente corporativo** Hoja de cálculo de coste mensual de una solución de IA generativa según volumen de uso. 1. Definir volumen de consultas y tamaño medio de contexto. 2. Calcular coste por consulta en dos alternativas. 3. Proyectar a tres escenarios de adopción. 4. Identificar la palanca de coste dominante. - *Stack:* Python + pandas - *Entregable:* Cuaderno con el modelo de coste y la recomendación. **Lecturas** - Documentación de precios de los proveedores (consulta guiada en clase) *Materiales:* `teoria/M1_S08_IA_en_la_nube_servicios_y_coste.html` · `code/M1_S08_IA_en_la_nube_servicios_y_coste.ipynb` --- ### Sesión 09 — Datos, privacidad y uso responsable: primeras reglas **Objetivos** - Aplicar las reglas básicas de tratamiento de datos personales en un proyecto. - Anticipar los requisitos que impondrá el Módulo 8. - Documentar decisiones desde el inicio del proyecto. **Contenidos** - **Reglas básicas** - Base legal, finalidad y minimización - Anonimización, seudonimización y sus límites - Datos de terceros y condiciones de uso - Qué no debe entrar nunca en un prompt - **Documentación mínima** - Registro de origen y de tratamiento del dato - Model card y data card: contenido útil - Decisiones que hay que poder justificar a posteriori - Conservación y retirada - **Riesgos tempranos** - Sesgo introducido en la recogida - Reidentificación en datasets pequeños - Fuga de datos a servicios externos - Consecuencias reputacionales y económicas **Práctica — Data card del proyecto propio** Documentación del dataset del proyecto personal con origen, tratamiento y limitaciones. 1. Documentar origen y base legal. 2. Describir tratamiento y transformaciones. 3. Declarar limitaciones y usos no recomendados. 4. Revisión cruzada con otro alumno. - *Stack:* Plantilla Markdown - *Entregable:* Data card completa y revisada. **Lecturas** - Gebru et al., Datasheets for Datasets *Materiales:* `teoria/M1_S09_Datos_privacidad_y_uso_responsable_primeras_regl.html` · `code/M1_S09_Datos_privacidad_y_uso_responsable_primeras_regl.ipynb` --- ### Sesión 10 — Del problema de negocio a la métrica **Objetivos** - Traducir un objetivo de negocio a una métrica optimizable. - Definir el umbral de decisión con criterio económico. - Evitar métricas que premian el comportamiento equivocado. **Contenidos** - **Traducción** - Objetivo, indicador, métrica y umbral - Métricas de negocio frente a métricas técnicas - Horizonte temporal y estacionalidad - Línea base honesta - **Economía de la decisión** - Matriz de coste de errores - Umbral óptimo según coste asimétrico - Valor esperado de la decisión automática - Cuándo no automatizar - **Métricas perversas** - Optimizar lo medible en lugar de lo importante - Efectos de segundo orden - Gaming del indicador - Revisión periódica de la métrica **Práctica — Ficha de métrica y umbral** Definición completa de la métrica y el umbral económico de un caso con costes asimétricos. 1. Construir la matriz de costes. 2. Calcular el valor esperado por umbral. 3. Elegir umbral y justificar. 4. Comparar con la línea base actual. - *Stack:* Python, pandas, matplotlib - *Entregable:* Cuaderno con curva de valor esperado y umbral recomendado. **Lecturas** - Provost & Fawcett, Data Science for Business, cap. 7 *Materiales:* `teoria/M1_S10_Del_problema_de_negocio_a_la_metrica.html` · `code/M1_S10_Del_problema_de_negocio_a_la_metrica.ipynb` --- ### Sesión 11 — Taller integrador: ficha de proyecto **Objetivos** - Integrar los contenidos del módulo en un documento único. - Someter el proyecto a crítica estructurada. - Dejar el proyecto listo para los módulos siguientes. **Contenidos** - **Contenido de la ficha** - Problema, métrica y línea base - Dato disponible y dato necesario - Arquitectura tentativa y coste estimado - Riesgos regulatorios y de adopción - **Revisión entre pares** - Protocolo de crítica en 15 minutos - Preguntas que deben poder responderse - Detección de supuestos no verificados - Registro de las objeciones recibidas - **Cierre** - Qué falta para pasar a exploración - Plan de datos para el Módulo 2 - Compromisos para el TFM **Práctica — Revisión cruzada de fichas** Cada alumno presenta su ficha y recibe crítica estructurada de dos compañeros. 1. Presentar la ficha en cinco minutos. 2. Recibir y registrar objeciones. 3. Corregir los dos puntos más débiles. 4. Entregar la versión revisada. - *Stack:* Documento + sesión de defensa - *Entregable:* Ficha de proyecto revisada con registro de objeciones. *Materiales:* `teoria/M1_S11_Taller_integrador_ficha_de_proyecto.html` · `code/M1_S11_Taller_integrador_ficha_de_proyecto.ipynb` --- ### Sesión 12 — Evaluación del módulo y defensa **Objetivos** - Defender oralmente el encuadre del proyecto. - Demostrar dominio del entorno técnico. - Cerrar el módulo con el material listo para el siguiente. **Contenidos** - **Prueba práctica** - Ejercicio cronometrado de manipulación de datos - Lectura e interpretación de una figura - Diagnóstico de un caso de uso - **Defensa** - Presentación de siete minutos - Preguntas del tribunal docente - Criterios de la rúbrica - **Cierre y transición** - Devolución individual - Errores comunes detectados en el grupo - Preparación del Módulo 2 **Práctica — Prueba práctica y defensa** Evaluación sumativa del módulo. 1. Resolver la prueba práctica. 2. Defender la ficha de proyecto. 3. Recibir devolución. - *Stack:* Entorno del máster - *Entregable:* Prueba resuelta y defensa realizada. *Materiales:* `teoria/M1_S12_Evaluacion_del_modulo_y_defensa.html` · `code/M1_S12_Evaluacion_del_modulo_y_defensa.ipynb` ---