Dónde correr open-weights para un harness/RAG custom para empresas
Fecha: 2026-09-27 Tipo: análisis / decisión de infraestructura
Marco: separa dos capas
- El modelo (open weights) = commodity. Llama/Qwen/DeepSeek/GLM/Nemotron se sirven en 10+ lados al mismo precio. NO te cases con uno.
- Tu harness + RAG (retrieval, orquestación, evals, UI, integración con el ERP/CRM del cliente) = aquí está el valor y el lock-in real. Es lo que el cliente compra.
Regla: el modelo debe ser una variable de configuración, no una decisión arquitectónica.
Los 4 niveles de “dónde”, de menor a mayor compromiso
Nivel 0 — Tu máquina (System76 + Ollama / llama.cpp)
- Para: dev, demos, clientes con datos sensibles que caben en tu hardware.
- Ya lo tienes. Empieza aquí siempre.
Nivel 1 — Proveedor serverless de open-weights (pago por token)
- OpenRouter — router, 300+ modelos, cambias de modelo/upstream sin tocar código. Ojo: no es proveedor directo, es proxy (no controla el cómputo).
- Fireworks / Together — proveedores directos, catálogo amplio, embeddings, function calling, fine-tuning (LoRA). Los más “todo en uno”.
- Groq / Cerebras — latencia extrema (LPU / wafer-scale). Ideal si el harness es interactivo o agéntico. Catálogo corto (<10 modelos productivos).
- DeepInfra / Nebius / Novita — más barato, menos SLA.
- Cloudflare Workers AI + Vectorize + AI Gateway — la ruta más “producto para empresa” y sin ops: modelo serverless en el edge, vector DB incluida, gateway con observabilidad/routing/facturación. Barato, facturable con markup.
- Para: el experimento real. Costo marginal casi cero, cero infra.
Nivel 2 — GPU rentada por hora o escala-a-cero (modelo dedicado)
- RunPod / Modal / Baseten / Vast.ai / Lambda — despliegas vLLM con tu modelo o tu LoRA, endpoint OpenAI-compatible, escala a cero.
- Cuándo: un cliente ya paga, o el volumen supera el crossover serverless, o necesitas tus pesos / LoRA, o residencia de datos en un proveedor específico.
- Regla: no rentes GPU hasta que haya contrato o volumen medido.
Nivel 3 — Servidor propio / on-prem del cliente
- Cuándo: el contrato exige que los datos NO salgan (banca, gobierno, salud, corporativo).
- Vende “llévalo y córrelo” (app entregable + docs), no SaaS. Encaja con tu línea local-first.
Eje de decisión (4 preguntas que deciden todo)
| Pregunta | Si la respuesta es… | Entonces |
|---|---|---|
| ¿Los datos pueden salir del cliente? | No | Nivel 2/3 (dedicado / on-prem) |
| ¿Volumen bajo y esporádico? | Sí | Nivel 1 (serverless por token) |
| ¿Latencia interactiva por request? | Sí | Groq/Cerebras o GPU local |
| ¿Necesitas LoRA/pesos/fine-tune? | Sí | Fireworks/Together o Nivel 2 |
| ¿Vendes a SMB sin equipo de ops? | Sí | Cloudflare Workers AI (nivel 1 edge) |
Recomendación: smallest real version
- Capa de abstracción: LiteLLM proxy delante de todo. Cambias de proveedor cambiando una línea, sin tocar el harness. Evita el lock-in desde el día 1.
- Harness + RAG local con Ollama (dev) + pgvector o Qdrant. Embeddings open (bge/e5/gte) para no depender de otro API. Construye las evals aquí — ese es el trabajo real, no elegir proveedor.
- Ruta “empresa” lista para vender: Cloudflare (Workers AI + Vectorize + AI Gateway). Serverless, edge, sin ops, y puedes facturar por token con markup.
- Sube a Nivel 2 (GPU dedicada) solo cuando un cliente firme o el volumen lo justifique. Hasta entonces, rentar GPU es quemar dinero en un problema que no tienes.
Advertencia (anti-rabbit-hole)
Comparar 15 proveedores es la trampa. Como tu CRM: 4 intentos muertos. El modelo es intercambiable; el harness, las evals y el cliente son lo único que no se puede copiar. Elige uno (Cloudflare o Fireworks) y ship.
Fuentes consultadas (2026-09)
- Fireworks “Best LLM API Providers 2026” y “Inference Providers vs API Routers” (mar 2026)
- OpenRouter “Open Weight Models that Matter” (jun 2026)
- Cerebras / W&B Serverless Inference pricing (2026)
- pricepertoken.com comparativas Fireworks/Together (sep 2026)