2026-09-21 — Dónde se implementa RAG a nivel empresa + guías fullstack
Continuación de [CREDENCIAL].md.
Pregunta de Nef: ¿dónde se están haciendo estas implementaciones a nivel
empresas/servicios, y cuáles son las guías desde el fullstack?
1. Mapa por capas (quién ocupa qué)
| Capa | Jugadores |
|---|---|
| Modelo frontier | OpenAI, Anthropic, Google; open-weights: Qwen, DeepSeek, Llama, Mistral, Nemotron |
| Gateway/routing (donde la empresa controla keys, caché, costo, fallback) | LiteLLM, Portkey, Vercel AI Gateway, Cloudflare AI Gateway, Kong, OpenRouter |
| Vector/retrieval | Pinecone, Weaviate, Qdrant, Milvus/Zilliz, Chroma, LanceDB, Turbopuffer, Vespa; incumbentes: Elastic, Postgres/pgvector, Mongo Atlas, Redis, ClickHouse |
| Parsing/ingesta | Unstructured, Reducto, LlamaParse, Docling (IBM, open), Marker, Firecrawl, Chonkie (chunking) |
| Orquestación | LangChain/LangGraph, LlamaIndex, Haystack (deepset), DSPy, CrewAI, Strands (AWS) |
| Eval/observabilidad | LangSmith, Langfuse (OSS), Arize Phoenix, W&B Weave, Galileo, Braintrust, Ragas |
| RAG managed (“no-build”) | Bedrock Managed Knowledge Bases (AWS), Vertex AI Search/Agent Builder (GCP), Azure AI Search + Foundry, Cloudflare AutoRAG, Vectara, Ragie, LlamaCloud |
| Serving open-weights | vLLM, SGLang, TGI, TEI (embeddings), Ollama, NVIDIA NIM; clouds: Together, Fireworks, Groq, Cerebras, Baseten, Modal, RunPod |
| Plataformas de datos que absorben RAG | Databricks (Vector Search + Agent Framework), Snowflake (Cortex Search), BigQuery, Palantir AIP |
| Producto vertical (lo que ve el usuario) | Glean, Onyx (OSS), Dust, Hebbia (finanzas), Harvey (legal), OpenEvidence (medicina), Elicit/Consensus/SciSpace (ciencia), NotebookLM, Perplexity, Notion AI, Atlassian Rovo |
2. Evidencia 2026 (verificada esta sesión)
- AWS Bedrock Managed Knowledge Bases: RAG totalmente gestionado (ingesta, vector store, embeddings, rerank). Conectores a SharePoint, Confluence, Google Drive, OneDrive, S3, web crawler. “Agentic Retrieval” con precio por query (no por tokens) para evitar la varianza de costo de los loops agénticos. Clientes citados en la página: OpenAI misma usa Bedrock RAG para grounding a escala de millones de usuarios, Syngenta (SharePoint/Confluence), MRH Trowe (copilot interno ES/DE), Sony (AgentCore + KB + búsqueda web).
- Anthropic — Contextual Retrieval (la guía técnica de referencia): contextualizar chunks antes de embeber reduce fallos de retrieval top-20 en 35%; + BM25 contextual 49%; + rerank 67%. Costo de contextualizar: ~$1.02 por millón de tokens de documento con prompt caching. Regla dura: si la base es <200k tokens, no hagas RAG — mete todo al prompt con caching. Top-20 chunks al modelo, no top-5.
- Vercel AI SDK 7 (ruta fullstack JS/TS): UI de chat con streaming, embeddings, reranking, evaluación, middleware de RAG, templates listos (chatbot, internal knowledge base, semantic search) y AI Gateway.
- NVIDIA GenerativeAIExamples (ruta self-hosted/enterprise GPU): reference workflows con docker compose, RAG básico y avanzado (multi-turn, multimodal, structured data, query decomposition), herramientas de evaluación y observabilidad, y “Data Flywheel” para fine-tuning del modelo de embeddings con datos de uso.
3. Patrón organizacional (dónde vive esto dentro de la empresa)
- Platform/retrieval team: dueño de ingesta, índice, evals y gateway.
- Product teams: dueños de prompts, tools y UI.
- FDE (forward-deployed engineer): rol que OpenAI/Anthropic y las verticales (Harvey, Hebbia, Glean) usan para implementar esto dentro del cliente. Es el trabajo real del “AI engineer” hoy.
- Regla que se repite: la capa de modelo es reemplazable; la de datos no. Por eso las empresas invierten en su índice y ponen al modelo detrás de un gateway (routing, caché, fallback, auditoría).
4. Guías fullstack (de UI a DB)
Pila de referencia:
UI streaming + citas → AI SDK UI / assistant-ui / CopilotKit; PDF.js para highlight
API/BFF → Next.js route handlers o FastAPI; auth, tenant, rate limit, cola de ingesta
Servicio de retrieval → híbrido + RRF + rerank; filtros por tenant
Datos → Postgres+pgvector por defecto; S3/R2 para crudos; FTS nativo
Modelo → gateway con routing/caching/fallback
Evals → golden set en CI + trazas en producción
Guías concretas, en orden de utilidad:
- Anthropic — Contextual Retrieval + cookbook: la más accionable sobre retrieval. https://www.anthropic.com/news/contextual-retrieval
- AWS — Bedrock Knowledge Bases (si no quieres operar nada): https://aws.amazon.com/bedrock/knowledge-bases/
- Google — Vertex AI RAG Engine / Agent Builder; Azure — AI Search + “RAG solution design” + Foundry (equivalentes managed).
- NVIDIA — GenerativeAIExamples (control total self-hosted, incluye eval y observabilidad): https://github.com/NVIDIA/GenerativeAIExamples
- Vercel — AI SDK docs (embeddings, reranking, evaluation, middleware) y templates: https://ai-sdk.dev/docs/introduction
- Frameworks OSS — LlamaIndex (RAG from scratch), LangChain (tutorial RAG), Haystack (pipelines); starters fullstack: Onyx, RAGFlow, Quivr.
- Evals — Ragas + Langfuse/Phoenix (ambos OSS).
- Si el dato ya vive en Databricks/Snowflake: usa su vector search nativo antes de montar infraestructura aparte.
5. Árbol de decisión fullstack
- ¿El dato ya está en una plataforma de datos? → vector search nativo de esa plataforma (Databricks/Snowflake/BigQuery).
- ¿No quieres operar ingesta ni índice? → managed (Bedrock / Vertex / Azure).
- ¿Necesitas control total o local-first? → LangChain/LlamaIndex + pgvector o Qdrant + vLLM/Ollama + Langfuse. NVIDIA blueprint si hay GPU.
- ¿El corpus cabe en <200k tokens? → no construyas RAG: prompt + caching.
6. Para Nef
Su caso (second-brain, nef-silo) es la esquina local-first del mapa: el equivalente a “LangChain + pgvector + Ollama + Langfuse” pero aún más simple (SQLite). Lo que las empresas compran managed (parsing, eval, observabilidad) es exactamente lo que en su escala se escribe a mano en una sesión. El valor de mirar el mapa no es adoptar la pila grande: es copiar los patrones (contextual retrieval, RRF+rerank, golden set, gateway de modelos) sin adoptar los servicios.
7. Addendum — Claude (verificado 2026-09-21)
Dos piezas de Anthropic que caen directo en esta conversación:
- Claude Science (beta): app de escritorio (Mac/Win/Linux, en planes Pro/Max/Team/Enterprise) que es literalmente la categoría txyz/Lucien: workbench de investigación con especialistas por dominio (genómica, single-cell, proteómica, estructura de proteínas, cheminformatics), conexión a 60+ bases científicas, kernels Python/R persistentes, envío de jobs a cluster por SSH o Modal, y provenance completo en cada artefacto (código + entorno + conversación que lo produjo). Incluye un reviewer en background que marca citas incorrectas y números sin trazar. No es un modelo nuevo: es la app alrededor del modelo. Datos crudos y compute quedan locales; el prompt/respuesta sí pasa por Anthropic. Hay plan Team gratuito para científicos académicos/sin fines de lucro. Docs: https://claude.com/docs/claude-science/overview
- Citations API: citas nativas con punteros exactos —
cited_textcon índices de carácter (texto), página (PDF) o bloque (custom content), garantizados válidos porque la API los parsea, no el modelo.cited_textno cuenta como output tokens. Compatible con prompt caching y batch; incompatible con structured outputs. Para RAG: poner cada chunk como documento plain-text hace que Claude pueda citar oraciones específicas. Disponible en API, Bedrock, Vertex y Microsoft Foundry. Docs: https://platform.claude.com/docs/en/build-with-claude/citations Esto reemplaza el “document location reference” que txyz vende como diferenciador: hoy es una feature de API.