○ unseen · kind concept · level 0 · 0h
- Requiere: Large Language Models · Web Scraping
- Aplica: Embeddings
Curator: Un sistema de monitoreo social para LLMs no es un scraper pasivo, sino una “pipeline de inteligencia” que transforma señales ruidosas en playbooks estructurados. Requiere separación temática (Agentes A/B/C) y orquestación asíncrona para ahorrar tokens.
Mecanismo:
- Ingestión Multi-fuente: APIs oficiales preferidas sobre scraping (Reddit API, GitHub REST, RSS feeds). Fallback a Nitter/Telethon solo con rotación de IPs/proxies si es necesario.
- Filtrado Pre-LLM: Capa crítica que elimina >60% del ruido antes de tocar modelos costosos. Usa embeddings para deduplicar y keyword match + engagement threshold (score > 20, comments > 5).
- Orquestación Temática:
- Agent Builder: GitHub/Dev.to/SO → Código/arquitectura.
- Agent Field: Reddit/X/HN → Usos reales/fallas/hacks.
- Agent Signal: Trends/RSS → Señales macro emergentes.
- Procesamiento Batch: Agrupar 10-20 posts en un solo prompt para resumen y extracción de patrones (herramientas, casos de uso).
- Agregación Final: Un modelo potente (ej. Claude) sintetiza las salidas parciales semanales: “Top 5 mejores prácticas”, “Nuevas herramientas”.
Límite:
- Dependencia crítica de la calidad del filtrado inicial; si falla aquí, el LLM recibe basura y genera alucinaciones o ruido estructurado.
- Scraping directo en X/Telegram requiere estrictos límites de frecuencia (30-60 min) para evitar bloqueos IP.
Ejercicio:
Implementar script Python asíncoro (asyncio) que use feedparser + requests + telethon. Probar deduplicación con embeddings simples antes del paso al LLM.
Enlaces
- Requiere: Large Language Models · Web Scraping
- Aplica: Embeddings