○ unseen · kind concept · level 0 · 0h
- Aplica: Reinforcement Learning
Agent World Models (AWM) son representaciones internas aprendidas por un agente que permiten simular o predecir el resultado de acciones antes de ejecutarlas, similar a como los humanos construyen un modelo mental del mundo.
Mecanismo: Un AWM aprende la dinámica de entorno: dado un estado actual s y una acción a, predice el próximo estado s’. Esto permite:
- Planning por simulación: El agente puede imaginar secuencias de acciones y sus resultados sin interactuar con el entorno real
- Imaginación / Rollouts: Generar escenarios futuros posibles para evaluar políticas
- Model-based RL: Usar el modelo aprendido para generar datos de entrenamiento adicionales
Tipos de AWM:
- Textuales: LLMs que predicen próximas observaciones como texto (World Models textuales)
- Visuales: Modelos generativos (diffusion, transformers) que predicen próximos frames en pixel space
- Simbólicos: Modelos programáticos (PDDL, código) que simulan entornos de manera determinista
Pitfall: Los AWM pueden ser inexactos — si el modelo no captura la dinámica real del entorno, el planning basado en simulación puede llevar a decisiones incorrectas (model bias). También son caros de entrenar y mantener para entornos complejos. La brecha entre simulación y realidad (reality gap) es un problema fundamental.
Temas relacionados: Reinforcement Learning, World Models, Agent Planning, Model-based RL, Simulation.
Enlaces
- Aplica: Reinforcement Learning