○ planned · proyecto
Otorga nivel a: Reinforcement Learning · Q-Learning
Usa: Reinforcement Learning · Q-Learning · Policy Gradient · Deep Q-Network · Actor-Critic Methods
Charla introductoria al aprendizaje por refuerzo (RL) entendido como “simulaciones inteligentes”, partiendo de la psicología conductual (recompensa/castigo) y pasando por los marcos de Markov y Q-Learning. El ponente, de la Escuela de Gobierno y Transformación Pública del Tec de Monterrey, muestra aplicaciones en cadenas de suministro, videojuegos, robótica y política pública, y cierra con los riesgos y sesgos propios de usar RL en salud pública.
Hallazgos clave
- Lo más difícil de un modelo de RL es definir la función de recompensa: determina la policy resultante. Programar mal la función de valor (p. ej. omitir las monedas en Mario) hace que el agente “olvide” objetivos que para ti eran importantes.
- Q-Learning aprende “hacia atrás” (propaga la recompensa desde el queso, generando un mapa de calor de utilidades) y es resiliente ante caídas fuera de la policy óptima; los modelos de Markov aprenden “hacia adelante” y convergen con Policy/Value Iteration.
- Epsilon-greedy balancea exploración y explotación: el agente empieza explorando todo y termina explotando, dejando un epsilon pequeño que le permite escapar de óptimos locales.
- En política pública no se pueden explorar policies malas (riesgo) ni tratar a todos igual (sesgo): nadie acepta experimentar decisiones que dañen en salud pública, y hay que decidir explícitamente si se prioriza a ciertos grupos (mujeres en STEM, personas con discapacidad).
Módulos
- Fundamentos de RL — Agente, estado, mundo, acciones, recompensa y policy, con la analogía del ratón y el queso.
- Marcos de decisión — Procesos de Decisión de Markov vs. Q-Learning: aprender hacia adelante vs. hacia atrás.
- Ecuación de Bellman — Por qué el valor de un estado no es solo su recompensa inmediata y el factor de descuento.
- Algoritmos de optimización — Policy Iteration, Value Iteration y epsilon-greedy (exploración vs. explotación).
- Aplicaciones clásicas — Cadena de suministro (juego de la cerveza), videojuegos (Mario, Celeste) y robótica (robot que aprende a caminar).
- RL en política pública — Riesgo, sesgo y diseño de recompensas en salud: evaluación de lockdowns por COVID, transporte vehicular y multiagente.
Fuente: https://www.youtube.com/watch?v=U4xPgOYIkYo · Transcript local: data/cursos/datapub-reinforcement-learning/reinforcement-learning.srt
Enlaces
Otorga nivel a: Reinforcement Learning · Q-Learning Usa: Reinforcement Learning · Q-Learning · Policy Gradient · Deep Q-Network · Actor-Critic Methods