2026-09-21 — Dónde se implementa RAG a nivel empresa + guías fullstack

Continuación de [CREDENCIAL].md. Pregunta de Nef: ¿dónde se están haciendo estas implementaciones a nivel empresas/servicios, y cuáles son las guías desde el fullstack?

1. Mapa por capas (quién ocupa qué)

CapaJugadores
Modelo frontierOpenAI, Anthropic, Google; open-weights: Qwen, DeepSeek, Llama, Mistral, Nemotron
Gateway/routing (donde la empresa controla keys, caché, costo, fallback)LiteLLM, Portkey, Vercel AI Gateway, Cloudflare AI Gateway, Kong, OpenRouter
Vector/retrievalPinecone, Weaviate, Qdrant, Milvus/Zilliz, Chroma, LanceDB, Turbopuffer, Vespa; incumbentes: Elastic, Postgres/pgvector, Mongo Atlas, Redis, ClickHouse
Parsing/ingestaUnstructured, Reducto, LlamaParse, Docling (IBM, open), Marker, Firecrawl, Chonkie (chunking)
OrquestaciónLangChain/LangGraph, LlamaIndex, Haystack (deepset), DSPy, CrewAI, Strands (AWS)
Eval/observabilidadLangSmith, Langfuse (OSS), Arize Phoenix, W&B Weave, Galileo, Braintrust, Ragas
RAG managed (“no-build”)Bedrock Managed Knowledge Bases (AWS), Vertex AI Search/Agent Builder (GCP), Azure AI Search + Foundry, Cloudflare AutoRAG, Vectara, Ragie, LlamaCloud
Serving open-weightsvLLM, SGLang, TGI, TEI (embeddings), Ollama, NVIDIA NIM; clouds: Together, Fireworks, Groq, Cerebras, Baseten, Modal, RunPod
Plataformas de datos que absorben RAGDatabricks (Vector Search + Agent Framework), Snowflake (Cortex Search), BigQuery, Palantir AIP
Producto vertical (lo que ve el usuario)Glean, Onyx (OSS), Dust, Hebbia (finanzas), Harvey (legal), OpenEvidence (medicina), Elicit/Consensus/SciSpace (ciencia), NotebookLM, Perplexity, Notion AI, Atlassian Rovo

2. Evidencia 2026 (verificada esta sesión)

  • AWS Bedrock Managed Knowledge Bases: RAG totalmente gestionado (ingesta, vector store, embeddings, rerank). Conectores a SharePoint, Confluence, Google Drive, OneDrive, S3, web crawler. “Agentic Retrieval” con precio por query (no por tokens) para evitar la varianza de costo de los loops agénticos. Clientes citados en la página: OpenAI misma usa Bedrock RAG para grounding a escala de millones de usuarios, Syngenta (SharePoint/Confluence), MRH Trowe (copilot interno ES/DE), Sony (AgentCore + KB + búsqueda web).
  • Anthropic — Contextual Retrieval (la guía técnica de referencia): contextualizar chunks antes de embeber reduce fallos de retrieval top-20 en 35%; + BM25 contextual 49%; + rerank 67%. Costo de contextualizar: ~$1.02 por millón de tokens de documento con prompt caching. Regla dura: si la base es <200k tokens, no hagas RAG — mete todo al prompt con caching. Top-20 chunks al modelo, no top-5.
  • Vercel AI SDK 7 (ruta fullstack JS/TS): UI de chat con streaming, embeddings, reranking, evaluación, middleware de RAG, templates listos (chatbot, internal knowledge base, semantic search) y AI Gateway.
  • NVIDIA GenerativeAIExamples (ruta self-hosted/enterprise GPU): reference workflows con docker compose, RAG básico y avanzado (multi-turn, multimodal, structured data, query decomposition), herramientas de evaluación y observabilidad, y “Data Flywheel” para fine-tuning del modelo de embeddings con datos de uso.

3. Patrón organizacional (dónde vive esto dentro de la empresa)

  • Platform/retrieval team: dueño de ingesta, índice, evals y gateway.
  • Product teams: dueños de prompts, tools y UI.
  • FDE (forward-deployed engineer): rol que OpenAI/Anthropic y las verticales (Harvey, Hebbia, Glean) usan para implementar esto dentro del cliente. Es el trabajo real del “AI engineer” hoy.
  • Regla que se repite: la capa de modelo es reemplazable; la de datos no. Por eso las empresas invierten en su índice y ponen al modelo detrás de un gateway (routing, caché, fallback, auditoría).

4. Guías fullstack (de UI a DB)

Pila de referencia:

UI streaming + citas        → AI SDK UI / assistant-ui / CopilotKit; PDF.js para highlight
API/BFF                     → Next.js route handlers o FastAPI; auth, tenant, rate limit, cola de ingesta
Servicio de retrieval       → híbrido + RRF + rerank; filtros por tenant
Datos                       → Postgres+pgvector por defecto; S3/R2 para crudos; FTS nativo
Modelo                      → gateway con routing/caching/fallback
Evals                       → golden set en CI + trazas en producción

Guías concretas, en orden de utilidad:

  1. Anthropic — Contextual Retrieval + cookbook: la más accionable sobre retrieval. https://www.anthropic.com/news/contextual-retrieval
  2. AWS — Bedrock Knowledge Bases (si no quieres operar nada): https://aws.amazon.com/bedrock/knowledge-bases/
  3. Google — Vertex AI RAG Engine / Agent Builder; Azure — AI Search + “RAG solution design” + Foundry (equivalentes managed).
  4. NVIDIA — GenerativeAIExamples (control total self-hosted, incluye eval y observabilidad): https://github.com/NVIDIA/GenerativeAIExamples
  5. Vercel — AI SDK docs (embeddings, reranking, evaluation, middleware) y templates: https://ai-sdk.dev/docs/introduction
  6. Frameworks OSS — LlamaIndex (RAG from scratch), LangChain (tutorial RAG), Haystack (pipelines); starters fullstack: Onyx, RAGFlow, Quivr.
  7. Evals — Ragas + Langfuse/Phoenix (ambos OSS).
  8. Si el dato ya vive en Databricks/Snowflake: usa su vector search nativo antes de montar infraestructura aparte.

5. Árbol de decisión fullstack

  • ¿El dato ya está en una plataforma de datos? → vector search nativo de esa plataforma (Databricks/Snowflake/BigQuery).
  • ¿No quieres operar ingesta ni índice? → managed (Bedrock / Vertex / Azure).
  • ¿Necesitas control total o local-first? → LangChain/LlamaIndex + pgvector o Qdrant + vLLM/Ollama + Langfuse. NVIDIA blueprint si hay GPU.
  • ¿El corpus cabe en <200k tokens? → no construyas RAG: prompt + caching.

6. Para Nef

Su caso (second-brain, nef-silo) es la esquina local-first del mapa: el equivalente a “LangChain + pgvector + Ollama + Langfuse” pero aún más simple (SQLite). Lo que las empresas compran managed (parsing, eval, observabilidad) es exactamente lo que en su escala se escribe a mano en una sesión. El valor de mirar el mapa no es adoptar la pila grande: es copiar los patrones (contextual retrieval, RRF+rerank, golden set, gateway de modelos) sin adoptar los servicios.

7. Addendum — Claude (verificado 2026-09-21)

Dos piezas de Anthropic que caen directo en esta conversación:

  • Claude Science (beta): app de escritorio (Mac/Win/Linux, en planes Pro/Max/Team/Enterprise) que es literalmente la categoría txyz/Lucien: workbench de investigación con especialistas por dominio (genómica, single-cell, proteómica, estructura de proteínas, cheminformatics), conexión a 60+ bases científicas, kernels Python/R persistentes, envío de jobs a cluster por SSH o Modal, y provenance completo en cada artefacto (código + entorno + conversación que lo produjo). Incluye un reviewer en background que marca citas incorrectas y números sin trazar. No es un modelo nuevo: es la app alrededor del modelo. Datos crudos y compute quedan locales; el prompt/respuesta sí pasa por Anthropic. Hay plan Team gratuito para científicos académicos/sin fines de lucro. Docs: https://claude.com/docs/claude-science/overview
  • Citations API: citas nativas con punteros exactos — cited_text con índices de carácter (texto), página (PDF) o bloque (custom content), garantizados válidos porque la API los parsea, no el modelo. cited_text no cuenta como output tokens. Compatible con prompt caching y batch; incompatible con structured outputs. Para RAG: poner cada chunk como documento plain-text hace que Claude pueda citar oraciones específicas. Disponible en API, Bedrock, Vertex y Microsoft Foundry. Docs: https://platform.claude.com/docs/en/build-with-claude/citations Esto reemplaza el “document location reference” que txyz vende como diferenciador: hoy es una feature de API.