Contexto: guía para obtener publicaciones de X/Twitter de forma sostenible y con el menor mantenimiento.

Para un "scraper de Twitter", evitaría depender de automatización del navegador o endpoints internos: cambian con frecuencia, tienen barreras anti-bot y pueden incumplir términos de X.
 
Elegiría según el caso:
 
1. Cuentas concretas que monitoreamos: RSSHub local (o Nitter si está estable) -> RSS -> nuestro recolector. Es barato, se integra con un pipeline editorial y basta para un MVP.
2. Búsqueda por palabra, hashtag, fechas o volumen: API oficial de X o un proveedor con API y contrato. Guardar ID, URL, fecha, autor, texto, métricas y la consulta origen.
3. Investigación histórica o una sola extracción: export/API de proveedor. Nunca compraría un scraper propio antes de validar que el corpus es útil.
 
MVP recomendado:
- Un archivo YAML/JSON de fuentes: handle, prioridad y tema.
- Un cron cada 30-60 minutos que lea feeds/APIs.
- SQLite/Postgres con tweet_id único para deduplicar.
- Guardar texto, permalink, timestamp, cuenta, adjuntos y fecha de captura.
- Cola editorial que clasifique por tema y evidencia; no publicar automáticamente.
- Backoff, rate limits, logs y una fuente alternativa por cuenta crítica.
 
No recolectar DMs, datos no públicos, ni evadir autenticación, CAPTCHA, bloqueos o rate limits. Respetar términos de la fuente, licencias y privacidad.