Cómo se construye un “LLM” tipo txyz.ai / Lucien / scihub.ru
Fecha: 2026-09-21
Corrección de premisa
Ninguna de esas apps entrena un LLM. No hay pretraining propio en el camino crítico. Son apps agénticas de RAG sobre un corpus científico + modelos frontier alquilados (o locales). scihub.ru ni siquiera es una app de IA: es una fuente de corpus (papers paywalled, riesgo legal alto). El producto real es: índice del corpus + retrieval + loop de agente + UI de lectura con citas.
Capas
-
Corpus / metadata
- arXiv (bulk S3 + API), OpenAlex, Semantic Scholar, Crossref, PubMed, Unpaywall, bioRxiv/medRxiv. PDFs open access vía Unpaywall/OpenAlex.
- Sci-Hub solo como referencia de qué existe; integrarlo es riesgo legal.
- txyz dice “millones de papers”; Lucien apunta a full-text + agentes que diseñan experimentos. La diferencia es cobertura y profundidad de lectura, no el modelo.
-
Ingesta (aquí se gana o se pierde el producto)
- PDF → texto estructurado: GROBID (secciones, referencias), Nougat o Marker (ecuaciones, tablas). PyMuPDF solo como fallback barato.
- Chunking semántico por sección, no por tokens ciegos.
- Metadata por chunk: DOI, año, autores, venue, sección.
- Embeddings: bge-m3, SPECTER2 (científico), e5-large. Vector DB: Qdrant / pgvector / LanceDB.
-
Retrieval
- Híbrido: BM25 (términos exactos, siglas) + denso (semántica) + reranker (bge-reranker-v2, Cohere Rerank).
- Jerárquico para papers largos: paper → sección → pasaje.
- Filtros por metadata (año, campo, citas) antes de rankear.
-
Agente (el “LLM” que ve el usuario)
- Loop de tool-calling:
search(query)→read(paper, sección)→follow_citations()→synthesize(). - Respuestas ancladas a pasaje exacto (txyz lo vende como “document location reference”; es el antídoto anti-hallucination).
- Multi-paso, no un solo prompt con contexto pegado.
- Modelo: API frontier (Claude/GPT/Gemini) o local (Ollama/vLLM con Qwen3 / Llama). Los submodelos de extracción pueden ser pequeños fine-tuneados.
- Loop de tool-calling:
-
UI
- Chat + PDF viewer con highlight del pasaje citado + library personal + uploads privados + generación de literature reviews.
Versión mínima local-first (1 sesión de prototipo)
arXiv API → PyMuPDF/GROBID → chunks por sección
→ bge-m3 (Ollama o sentence-transformers) → LanceDB
→ agente con 3 tools: buscar, leer, citar
→ Ollama (Qwen3) para síntesis
Eso ya responde “¿qué se sabe de X?” con citas verificables sobre un dominio acotado. La distancia a txyz es cobertura, calidad de parsing y escala de infra — no ciencia nueva.
Partes difíciles (en orden)
- Parsing de PDF: ecuaciones, tablas, columnas dobles, figuras.
- Grounding: que cada afirmación apunte a un pasaje real y verificable.
- Evaluación: medir hallucination y recall de retrieval, no vibes.
- Escala de ingesta: millones de PDFs, dedupe, versiones (arXiv v1/v2).
Referencias
- https://txyz.ai/ (products: searching / reading / writing / API)
- https://lucien.science/ (agente de investigación, ai4.science)
- GROBID: https://github.com/kermitt2/grobid
- SPECTER2: https://github.com/allenai/specter2