Cómo se construye un “LLM” tipo txyz.ai / Lucien / scihub.ru

Fecha: 2026-09-21

Corrección de premisa

Ninguna de esas apps entrena un LLM. No hay pretraining propio en el camino crítico. Son apps agénticas de RAG sobre un corpus científico + modelos frontier alquilados (o locales). scihub.ru ni siquiera es una app de IA: es una fuente de corpus (papers paywalled, riesgo legal alto). El producto real es: índice del corpus + retrieval + loop de agente + UI de lectura con citas.

Capas

  1. Corpus / metadata

    • arXiv (bulk S3 + API), OpenAlex, Semantic Scholar, Crossref, PubMed, Unpaywall, bioRxiv/medRxiv. PDFs open access vía Unpaywall/OpenAlex.
    • Sci-Hub solo como referencia de qué existe; integrarlo es riesgo legal.
    • txyz dice “millones de papers”; Lucien apunta a full-text + agentes que diseñan experimentos. La diferencia es cobertura y profundidad de lectura, no el modelo.
  2. Ingesta (aquí se gana o se pierde el producto)

    • PDF → texto estructurado: GROBID (secciones, referencias), Nougat o Marker (ecuaciones, tablas). PyMuPDF solo como fallback barato.
    • Chunking semántico por sección, no por tokens ciegos.
    • Metadata por chunk: DOI, año, autores, venue, sección.
    • Embeddings: bge-m3, SPECTER2 (científico), e5-large. Vector DB: Qdrant / pgvector / LanceDB.
  3. Retrieval

    • Híbrido: BM25 (términos exactos, siglas) + denso (semántica) + reranker (bge-reranker-v2, Cohere Rerank).
    • Jerárquico para papers largos: paper → sección → pasaje.
    • Filtros por metadata (año, campo, citas) antes de rankear.
  4. Agente (el “LLM” que ve el usuario)

    • Loop de tool-calling: search(query) → read(paper, sección) → follow_citations() → synthesize().
    • Respuestas ancladas a pasaje exacto (txyz lo vende como “document location reference”; es el antídoto anti-hallucination).
    • Multi-paso, no un solo prompt con contexto pegado.
    • Modelo: API frontier (Claude/GPT/Gemini) o local (Ollama/vLLM con Qwen3 / Llama). Los submodelos de extracción pueden ser pequeños fine-tuneados.
  5. UI

    • Chat + PDF viewer con highlight del pasaje citado + library personal + uploads privados + generación de literature reviews.

Versión mínima local-first (1 sesión de prototipo)

arXiv API → PyMuPDF/GROBID → chunks por sección
  → bge-m3 (Ollama o sentence-transformers) → LanceDB
  → agente con 3 tools: buscar, leer, citar
  → Ollama (Qwen3) para síntesis

Eso ya responde “¿qué se sabe de X?” con citas verificables sobre un dominio acotado. La distancia a txyz es cobertura, calidad de parsing y escala de infra — no ciencia nueva.

Partes difíciles (en orden)

  1. Parsing de PDF: ecuaciones, tablas, columnas dobles, figuras.
  2. Grounding: que cada afirmación apunte a un pasaje real y verificable.
  3. Evaluación: medir hallucination y recall de retrieval, no vibes.
  4. Escala de ingesta: millones de PDFs, dedupe, versiones (arXiv v1/v2).

Referencias