Dónde correr open-weights para un harness/RAG custom para empresas

Fecha: 2026-09-27 Tipo: análisis / decisión de infraestructura

Marco: separa dos capas

  1. El modelo (open weights) = commodity. Llama/Qwen/DeepSeek/GLM/Nemotron se sirven en 10+ lados al mismo precio. NO te cases con uno.
  2. Tu harness + RAG (retrieval, orquestación, evals, UI, integración con el ERP/CRM del cliente) = aquí está el valor y el lock-in real. Es lo que el cliente compra.

Regla: el modelo debe ser una variable de configuración, no una decisión arquitectónica.

Los 4 niveles de “dónde”, de menor a mayor compromiso

Nivel 0 — Tu máquina (System76 + Ollama / llama.cpp)

  • Para: dev, demos, clientes con datos sensibles que caben en tu hardware.
  • Ya lo tienes. Empieza aquí siempre.

Nivel 1 — Proveedor serverless de open-weights (pago por token)

  • OpenRouter — router, 300+ modelos, cambias de modelo/upstream sin tocar código. Ojo: no es proveedor directo, es proxy (no controla el cómputo).
  • Fireworks / Together — proveedores directos, catálogo amplio, embeddings, function calling, fine-tuning (LoRA). Los más “todo en uno”.
  • Groq / Cerebras — latencia extrema (LPU / wafer-scale). Ideal si el harness es interactivo o agéntico. Catálogo corto (<10 modelos productivos).
  • DeepInfra / Nebius / Novita — más barato, menos SLA.
  • Cloudflare Workers AI + Vectorize + AI Gateway — la ruta más “producto para empresa” y sin ops: modelo serverless en el edge, vector DB incluida, gateway con observabilidad/routing/facturación. Barato, facturable con markup.
  • Para: el experimento real. Costo marginal casi cero, cero infra.

Nivel 2 — GPU rentada por hora o escala-a-cero (modelo dedicado)

  • RunPod / Modal / Baseten / Vast.ai / Lambda — despliegas vLLM con tu modelo o tu LoRA, endpoint OpenAI-compatible, escala a cero.
  • Cuándo: un cliente ya paga, o el volumen supera el crossover serverless, o necesitas tus pesos / LoRA, o residencia de datos en un proveedor específico.
  • Regla: no rentes GPU hasta que haya contrato o volumen medido.

Nivel 3 — Servidor propio / on-prem del cliente

  • Cuándo: el contrato exige que los datos NO salgan (banca, gobierno, salud, corporativo).
  • Vende “llévalo y córrelo” (app entregable + docs), no SaaS. Encaja con tu línea local-first.

Eje de decisión (4 preguntas que deciden todo)

PreguntaSi la respuesta es…Entonces
¿Los datos pueden salir del cliente?NoNivel 2/3 (dedicado / on-prem)
¿Volumen bajo y esporádico?SíNivel 1 (serverless por token)
¿Latencia interactiva por request?SíGroq/Cerebras o GPU local
¿Necesitas LoRA/pesos/fine-tune?SíFireworks/Together o Nivel 2
¿Vendes a SMB sin equipo de ops?SíCloudflare Workers AI (nivel 1 edge)

Recomendación: smallest real version

  1. Capa de abstracción: LiteLLM proxy delante de todo. Cambias de proveedor cambiando una línea, sin tocar el harness. Evita el lock-in desde el día 1.
  2. Harness + RAG local con Ollama (dev) + pgvector o Qdrant. Embeddings open (bge/e5/gte) para no depender de otro API. Construye las evals aquí — ese es el trabajo real, no elegir proveedor.
  3. Ruta “empresa” lista para vender: Cloudflare (Workers AI + Vectorize + AI Gateway). Serverless, edge, sin ops, y puedes facturar por token con markup.
  4. Sube a Nivel 2 (GPU dedicada) solo cuando un cliente firme o el volumen lo justifique. Hasta entonces, rentar GPU es quemar dinero en un problema que no tienes.

Advertencia (anti-rabbit-hole)

Comparar 15 proveedores es la trampa. Como tu CRM: 4 intentos muertos. El modelo es intercambiable; el harness, las evals y el cliente son lo único que no se puede copiar. Elige uno (Cloudflare o Fireworks) y ship.

Fuentes consultadas (2026-09)

  • Fireworks “Best LLM API Providers 2026” y “Inference Providers vs API Routers” (mar 2026)
  • OpenRouter “Open Weight Models that Matter” (jun 2026)
  • Cerebras / W&B Serverless Inference pricing (2026)
  • pricepertoken.com comparativas Fireworks/Together (sep 2026)