M3 · Sesión 4 de 12

Árboles y modelos de conjunto

Modelos de Aprendizaje Automático
Máster en Inteligencia Artificial, Automatización y Agentes Digitales
Next Educación · Próxima edición
Sami Halawa Ribas

Índice

  • 1Árboles
  • 2Conjuntos
  • 3Modos de fallo
  • 4Práctica: Gradient boosting ajustado

Mapa de la sesión

Mapa de la sesiónBLOQUE 1ÁrbolesBLOQUE 2ConjuntosBLOQUE 3Modos de falloPRÁCTICA ENTREGABLEModelo ajustado con comparación documentada.
Objetivos de la sesión

Al terminar, el alumno será capaz de

1. Comprender el funcionamiento de árboles, bosques y boosting.
2. Ajustar gradient boosting con criterio.
3. Reconocer sus modos de fallo.
Estos objetivos son los que se evalúan en la práctica de la sesión y en la prueba del módulo.
1

Árboles

M3 · Sesión 4 · Árboles y modelos de conjunto

Árboles

Criterios de división y podaVentajas e inestabilidadTratamiento nativo de categóricas y nulosInterpretabilidad real de un árbol
M3 · Sesión 4 · figura 1 de 3

Árboles — en la práctica

Qué hay que saber decidir

  • Criterios de división y poda
  • Ventajas e inestabilidad

Dónde suele fallar

  • Tratamiento nativo de categóricas y nulos
  • Interpretabilidad real de un árbol
Criterio: ninguna de estas decisiones se toma por costumbre; cada una se justifica por escrito en el cuaderno de la sesión.
2

Conjuntos

M3 · Sesión 4 · Árboles y modelos de conjunto

Conjuntos

Bagging y random forestBoosting: AdaBoost y gradientboostingXGBoost, LightGBM y CatBoostHiperparámetros que realmenteimportan
M3 · Sesión 4 · figura 2 de 3

Conjuntos — en la práctica

Qué hay que saber decidir

  • Bagging y random forest
  • Boosting: AdaBoost y gradient boosting

Dónde suele fallar

  • XGBoost, LightGBM y CatBoost
  • Hiperparámetros que realmente importan
Criterio: ninguna de estas decisiones se toma por costumbre; cada una se justifica por escrito en el cuaderno de la sesión.
3

Modos de fallo

M3 · Sesión 4 · Árboles y modelos de conjunto

Modos de fallo

SesiónExtrapolación fuera del rangoCategóricas de altísimacardinalidadSobreajuste con boosting sinparada tempranaCoste computacional y deinferencia
M3 · Sesión 4 · figura 3 de 3

Modos de fallo — en la práctica

Qué hay que saber decidir

  • Extrapolación fuera del rango
  • Categóricas de altísima cardinalidad

Dónde suele fallar

  • Sobreajuste con boosting sin parada temprana
  • Coste computacional y de inferencia
Criterio: ninguna de estas decisiones se toma por costumbre; cada una se justifica por escrito en el cuaderno de la sesión.
4

Práctica

Gradient boosting ajustado

Práctica: Gradient boosting ajustado

Ajuste de un modelo de boosting con parada temprana y comparación contra el lineal regularizado.

Pasos

  1. Ajustar con parada temprana.
  2. Explorar los hiperparámetros relevantes.
  3. Comparar con la línea base y el lineal.
  4. Medir tiempo de inferencia.
StackLightGBM, scikit-learn
EntregableModelo ajustado con comparación documentada.

Ideas que hay que retener

Árboles: Criterios de división y poda
Conjuntos: Bagging y random forest
Modos de fallo: Extrapolación fuera del rango
Comprender el funcionamiento de árboles, bosques y boosting.

Para seguir

  • Ke et al., LightGBM (paper)
Lectura opcional. El material de referencia obligatorio es el manual del módulo y el cuaderno de la sesión.

Sesión 4 completada

Siguiente paso: entregar «Modelo ajustado con comparación documentada.»

M3 · Modelos de Aprendizaje Automático
Sami Halawa Ribas · Next Educación