Corpus social — Twitter + prensa (narrativa “qué se dice”)

Fecha: 2026-09-14 · Proyecto: ~/nef/estado_turismo/spab-retrieval

Tesis

Places = cuánto vale (rating, %caro). Airbnb reviews.csv = corpus STR (solo ciudades publicadas). Corpus social = qué se dice, y cubre todos los destinos, incluso donde Airbnb no publica.

Fuentes (credenciales reusadas de ~/nef/surtido/.env.local)

FuenteVariableQué da
twitterapi.ioTWITTERAPI_IO_KEYtweets por término (búsqueda live)
NewsAPINEWSAPI_KEYartículos de prensa en español

Script: scripts/corpus_social.py → data/corpus/<slug>.jsonl (documentos {fuente, fecha, texto, url}). Es corpus de texto, separado del almacén numérico data/obs/ (no es Observacion).

Corrida

430 documentos en los 10 destinos (Twitter 20 c/u + prensa según cobertura).

Señales (menciones por término):

destinosargazolleno/sat.caroinseguridadagua/serv.clima
oaxaca0011430
cancun601329
cdmx005202
bacalar101031
tulum1111020
playa-del-carmen101208

Nota: la prensa trae temas del plan — “turismofobia”, “proliferación del alga (sargazo)”, “aguas residuales”. La narrativa que ninguna fuente oficial captura.

Bloqueos / límites

  • Reddit: 403 sin OAuth (no usable tal cual).
  • YouTube (comentarios): requiere API key (no está en ningún .env).
  • NewsAPI: free tier ~100 req/día → 1 llamada por destino cabe.
  • El corpus crece (append): re-correr periódicamente acumula histórico.

Siguiente

  1. Sentimiento/tópicos sobre el corpus (robertuito/LLM) → series por destino.
  2. Enriquecer con YouTube (transcripciones de vlogs) si se consigue API key.
  3. TripAdvisor Terra (1,000 gratis) para reseñas turismo-nativo de los 9.