SPAB — Pendientes acumulados (toda la conversación)
Fecha: 2026-09-14 · Proyecto: ~/nef/estado_turismo/spab-retrieval
A. Datos que faltan capturar
- SESNSP (
delitos_100k) — CSV público de gob.mx. Plantilla lista. Trivial. - Sargazo (
severidad_sargazo) — archivo NOAA (PDF→CSV) o NLP de reseñas. Plantilla lista. - AFAC (asientos) — xlsx manual o DataTur
/SitePages/afac.aspx. - Ocupación Tulum/Bacalar — no son centro turístico. Tulum → proxy “Riviera Maya”; Bacalar → decidir.
- Divergencia CDMX: Airbnb 0.18 vs DataTur 0.52 de ocupación → fijar fuente canónica (recomiendo DataTur).
- Alineación de periodos del panel (precio/rating 2026-09 vs ocupación 2026-06).
- Places: paginar lugares (20→60) + dos
reviews_sort+ persistir textos (hoy se tiran). - Airbnb reviews de otros destinos — solo CDMX publicado; Tulum/Bacalar no.
B. Precio
- MonitorHotels (€5/destino) — probar cobertura MX con el Basic gratis (1 destino).
- TripAdvisor Terra (1,000 gratis) — registrar, probar Tulum + Hotel Pricing API.
- Booking local — HECHO; queda re-correrlo periódicamente (es manual).
C. Modelo / índice
- Ocupación canónica (corrige el índice CDMX inflado).
- Calibrar los cortes del índice contra colapsos observados (el RUTA lo exige).
confianza/npor fuente (Airbnb, OpenSky) — revisar ponderación.
D. Análisis del plan (RUTA §5) — casi todo pendiente
- Clustering (KMeans + jerárquico) sobre el vector por destino-periodo — era “el primer paso” ya pedido.
- Reglas de asociación (Apriori/FP-Growth) sobre atributos de experiencia.
- Tópicos/sentimiento reales (BERTopic/LDA) — hoy solo léxico.
- Detección de anomalías (ancla del caso Tulum).
- ML: predicción de ocupación (3/6 meses), clasificación de nivel burbuja, walk-forward, prueba retrospectiva Tulum, SHAP.
- Estocásticos: Monte Carlo, cadena de Markov, escenarios, sensibilidad.
- IO: modelo de asignación de presupuesto con restricción del Burbuja_Index + multiobjetivo.
- Campaña: branding, buyer persona, canales, umbral de apagado.
E. Entrega universidad (RUTA §8)
- Esquema del informe (23 apartados + páginas + criterio).
- Planteamiento + justificación + mapa de actores.
- Formulación matemática completa del modelo de IO.
- Diseño experimental de ML (cortes, base, métricas, retrospectiva).
F. Infra / operación
CRON_SECRET(openssl rand -hex 32) + scheduler (hoy todo manual).- Deploy (Vercel vs Workers vs local) sin decidir; WIF para BigQuery en servidor (SA bloqueada).
G. Documentos
- CF.md desactualizado (dice que
googleplacesfue removido; describe extracción vía Claude). - “Fundir” el doc de alternativas (versión corregida/verificada) — quedó ofrecido y sin hacer.
Repetir el pipeline (hoy a mano)
datatur (UPM+Monitoreo) · booking · oferta · corpus social · corpus youtube.
Ideal: un scripts/actualizar.sh que corra todo en orden.