SPAB — Pendientes acumulados (toda la conversación)

Fecha: 2026-09-14 · Proyecto: ~/nef/estado_turismo/spab-retrieval

A. Datos que faltan capturar

  1. SESNSP (delitos_100k) — CSV público de gob.mx. Plantilla lista. Trivial.
  2. Sargazo (severidad_sargazo) — archivo NOAA (PDF→CSV) o NLP de reseñas. Plantilla lista.
  3. AFAC (asientos) — xlsx manual o DataTur /SitePages/afac.aspx.
  4. Ocupación Tulum/Bacalar — no son centro turístico. Tulum → proxy “Riviera Maya”; Bacalar → decidir.
  5. Divergencia CDMX: Airbnb 0.18 vs DataTur 0.52 de ocupación → fijar fuente canónica (recomiendo DataTur).
  6. Alineación de periodos del panel (precio/rating 2026-09 vs ocupación 2026-06).
  7. Places: paginar lugares (20→60) + dos reviews_sort + persistir textos (hoy se tiran).
  8. Airbnb reviews de otros destinos — solo CDMX publicado; Tulum/Bacalar no.

B. Precio

  1. MonitorHotels (€5/destino) — probar cobertura MX con el Basic gratis (1 destino).
  2. TripAdvisor Terra (1,000 gratis) — registrar, probar Tulum + Hotel Pricing API.
  3. Booking local — HECHO; queda re-correrlo periódicamente (es manual).

C. Modelo / índice

  1. Ocupación canónica (corrige el índice CDMX inflado).
  2. Calibrar los cortes del índice contra colapsos observados (el RUTA lo exige).
  3. confianza/n por fuente (Airbnb, OpenSky) — revisar ponderación.

D. Análisis del plan (RUTA §5) — casi todo pendiente

  1. Clustering (KMeans + jerárquico) sobre el vector por destino-periodo — era “el primer paso” ya pedido.
  2. Reglas de asociación (Apriori/FP-Growth) sobre atributos de experiencia.
  3. Tópicos/sentimiento reales (BERTopic/LDA) — hoy solo léxico.
  4. Detección de anomalías (ancla del caso Tulum).
  5. ML: predicción de ocupación (3/6 meses), clasificación de nivel burbuja, walk-forward, prueba retrospectiva Tulum, SHAP.
  6. Estocásticos: Monte Carlo, cadena de Markov, escenarios, sensibilidad.
  7. IO: modelo de asignación de presupuesto con restricción del Burbuja_Index + multiobjetivo.
  8. Campaña: branding, buyer persona, canales, umbral de apagado.

E. Entrega universidad (RUTA §8)

  1. Esquema del informe (23 apartados + páginas + criterio).
  2. Planteamiento + justificación + mapa de actores.
  3. Formulación matemática completa del modelo de IO.
  4. Diseño experimental de ML (cortes, base, métricas, retrospectiva).

F. Infra / operación

  1. CRON_SECRET (openssl rand -hex 32) + scheduler (hoy todo manual).
  2. Deploy (Vercel vs Workers vs local) sin decidir; WIF para BigQuery en servidor (SA bloqueada).

G. Documentos

  1. CF.md desactualizado (dice que googleplaces fue removido; describe extracción vía Claude).
  2. “Fundir” el doc de alternativas (versión corregida/verificada) — quedó ofrecido y sin hacer.

Repetir el pipeline (hoy a mano)

datatur (UPM+Monitoreo) · booking · oferta · corpus social · corpus youtube. Ideal: un scripts/actualizar.sh que corra todo en orden.