○ unseen · kind concept · level 0 · 0h

Curator: Un sistema de monitoreo social para LLMs no es un scraper pasivo, sino una “pipeline de inteligencia” que transforma señales ruidosas en playbooks estructurados. Requiere separación temática (Agentes A/B/C) y orquestación asíncrona para ahorrar tokens.

Mecanismo:

  1. Ingestión Multi-fuente: APIs oficiales preferidas sobre scraping (Reddit API, GitHub REST, RSS feeds). Fallback a Nitter/Telethon solo con rotación de IPs/proxies si es necesario.
  2. Filtrado Pre-LLM: Capa crítica que elimina >60% del ruido antes de tocar modelos costosos. Usa embeddings para deduplicar y keyword match + engagement threshold (score > 20, comments > 5).
  3. Orquestación Temática:
    • Agent Builder: GitHub/Dev.to/SO → Código/arquitectura.
    • Agent Field: Reddit/X/HN → Usos reales/fallas/hacks.
    • Agent Signal: Trends/RSS → Señales macro emergentes.
  4. Procesamiento Batch: Agrupar 10-20 posts en un solo prompt para resumen y extracción de patrones (herramientas, casos de uso).
  5. Agregación Final: Un modelo potente (ej. Claude) sintetiza las salidas parciales semanales: “Top 5 mejores prácticas”, “Nuevas herramientas”.

Límite:

  • Dependencia crítica de la calidad del filtrado inicial; si falla aquí, el LLM recibe basura y genera alucinaciones o ruido estructurado.
  • Scraping directo en X/Telegram requiere estrictos límites de frecuencia (30-60 min) para evitar bloqueos IP.

Ejercicio: Implementar script Python asíncoro (asyncio) que use feedparser + requests + telethon. Probar deduplicación con embeddings simples antes del paso al LLM.

Enlaces

Fuentes