○ planned · proyecto

Otorga nivel a: Reinforcement Learning · Q-Learning

Usa: Reinforcement Learning · Q-Learning · Policy Gradient · Deep Q-Network · Actor-Critic Methods

Charla introductoria al aprendizaje por refuerzo (RL) entendido como “simulaciones inteligentes”, partiendo de la psicología conductual (recompensa/castigo) y pasando por los marcos de Markov y Q-Learning. El ponente, de la Escuela de Gobierno y Transformación Pública del Tec de Monterrey, muestra aplicaciones en cadenas de suministro, videojuegos, robótica y política pública, y cierra con los riesgos y sesgos propios de usar RL en salud pública.

Hallazgos clave

  • Lo más difícil de un modelo de RL es definir la función de recompensa: determina la policy resultante. Programar mal la función de valor (p. ej. omitir las monedas en Mario) hace que el agente “olvide” objetivos que para ti eran importantes.
  • Q-Learning aprende “hacia atrás” (propaga la recompensa desde el queso, generando un mapa de calor de utilidades) y es resiliente ante caídas fuera de la policy óptima; los modelos de Markov aprenden “hacia adelante” y convergen con Policy/Value Iteration.
  • Epsilon-greedy balancea exploración y explotación: el agente empieza explorando todo y termina explotando, dejando un epsilon pequeño que le permite escapar de óptimos locales.
  • En política pública no se pueden explorar policies malas (riesgo) ni tratar a todos igual (sesgo): nadie acepta experimentar decisiones que dañen en salud pública, y hay que decidir explícitamente si se prioriza a ciertos grupos (mujeres en STEM, personas con discapacidad).

Módulos

  1. Fundamentos de RL — Agente, estado, mundo, acciones, recompensa y policy, con la analogía del ratón y el queso.
  2. Marcos de decisión — Procesos de Decisión de Markov vs. Q-Learning: aprender hacia adelante vs. hacia atrás.
  3. Ecuación de Bellman — Por qué el valor de un estado no es solo su recompensa inmediata y el factor de descuento.
  4. Algoritmos de optimización — Policy Iteration, Value Iteration y epsilon-greedy (exploración vs. explotación).
  5. Aplicaciones clásicas — Cadena de suministro (juego de la cerveza), videojuegos (Mario, Celeste) y robótica (robot que aprende a caminar).
  6. RL en política pública — Riesgo, sesgo y diseño de recompensas en salud: evaluación de lockdowns por COVID, transporte vehicular y multiagente.

Fuente: https://www.youtube.com/watch?v=U4xPgOYIkYo · Transcript local: data/cursos/datapub-reinforcement-learning/reinforcement-learning.srt

Enlaces

Otorga nivel a: Reinforcement Learning · Q-Learning Usa: Reinforcement Learning · Q-Learning · Policy Gradient · Deep Q-Network · Actor-Critic Methods