Servicio “te hago la LLM de tu negocio” sobre Cloudflare
Contexto: con el stack Workers AI + templates oficiales (llm-chat-app, workflows-starter) se puede vender asistentes de negocio. No es fine-tuning; es RAG + personalidad + citas.
Respuesta corta
Sí. Pero “LLM custom” en la práctica = asistente entrenado en los DATOS del negocio (RAG), no un modelo re-entrenado. Cloudflare lo permite sin GPUs y con costo por consulta en céntimos.
Stack (todo serverless, cero infra)
- Workers AI → inferencia de modelos open (Llama 3.x, Qwen3, gpt-oss-120b, Gemma) y embeddings multilingües (EmbeddingGemma, 100+ idiomas — crítico para clientes MX).
- Vectorize → base vectorial para RAG (knowing del negocio: docs, web, PDFs, chats).
- D1 + KV + R2 → historial de conversación, caché, almacén de documentos.
- Queues / Workflows → ingesta y embedding asíncrono de documentos grandes (workflows-starter-template).
- AI Gateway → caché, rate limiting, observabilidad; y proxy a OpenAI/Anthropic si el cliente pide “el ChatGPT de su negocio” (GPT-4o/Claude como generador).
- Turnstile → anti-bots en el chat público.
- Fine-tunes con LoRA (beta) → solo para estilo/formato/tono; sobre-ingeniería para la mayoría de casos.
Producto por cliente
- Rebrand del llm-chat-app-template: dominio propio, colores, voz del negocio, foto/persona.
- Ingesta: cliente sube docs o sitemap → Workflow chunkea → embeddings → Vectorize.
- Respuesta con citas a fuentes (patrón Martech Zone: gpt-oss-120b + [1][2]).
- Panel admin: caja de prueba live, ver top resultados y score de retrieval (feedback loop).
- Umbral de score: si retrieval débil → “no tengo info” (evita alucinaciones).
Negocio
- Setup fee + mensualidad de mantenimiento. El costo marginal es céntimos/pregunta → margen alto.
- Se vende el trabajo y el asistente, no los tokens.
- Despliegue:
npm create cloudflare@latest -- --template cloudflare/templates/llm-chat-app-templatepor cliente + wrangler.
Límites a conocer
- Vectorize: máx 5M vectores / índice, 100 índices por cuenta, metadata 10KB.
- Workers AI: catálogo de modelos open limitado; sin GPT-4o/Claude nativos (van por AI Gateway).
- Embeddings: no hay fine-tune de modelos de embedding (solo LoRA en algunos LLM).
- Cold starts ~200ms en tráfico bajo; mitigar con Durable Objects o warm.