Contexto: convertir los likes propios exportados desde X/Twitter en una capa de memoria y recomendación para una IA personal.
Los likes propios son datos de preferencia, no un corpus suficiente para entrenar un modelo base. El primer producto no debe ser un fine-tune: debe ser búsqueda y recomendación sobre ese archivo.
Flujo mínimo:
1. Solicitar el archivo de datos de X desde Configuración > Tu cuenta > Descargar un archivo de tus datos.
2. Extraer data/like.js. Usualmente contiene tweetId, fullText y expandedUrl.
3. Convertir cada like a un registro normalizado: id, texto, URL, fecha disponible, autor si existe, enlaces, idioma y etiquetas generadas.
4. Deduplicar, conservar el JSON original y almacenar los registros en SQLite.
5. Crear embeddings locales o mediante API y una búsqueda semántica.
6. Construir una interfaz con dos tareas reales: "encuentra ideas que ya me interesaron" y "dime si esta nueva fuente se parece a mis likes".
Una fase posterior puede entrenar un clasificador pequeño con likes como positivos y ejemplos explícitamente descartados como negativos. Solo haría fine-tuning cuando exista una tarea estrecha, métrica de éxito y cientos o miles de ejemplos limpios.
No volver a descargar contenido restringido ni intentar evadir las protecciones de X. Para enriquecer un tweet cuyo texto falte, priorizar su URL pública, una API autorizada o dejarlo como metadato incompleto.
Browser Run /crawl es útil para enriquecer los enlaces externos ya presentes en los likes, no para extraer X. Enviar cada dominio enlazado como un crawl acotado (limit bajo, depth 0 o 1, formats markdown), declarar crawlPurposes ["ai-input"] y contentUse "reference" si el sitio lo permite. Indexar el Markdown resultante junto al like que lo originó. El endpoint respeta robots.txt, Content Signals, rate limits y bot protection, por lo que no debe usarse como mecanismo para sortear las restricciones de X.