Servicio “te hago la LLM de tu negocio” sobre Cloudflare

Contexto: con el stack Workers AI + templates oficiales (llm-chat-app, workflows-starter) se puede vender asistentes de negocio. No es fine-tuning; es RAG + personalidad + citas.

Respuesta corta

Sí. Pero “LLM custom” en la práctica = asistente entrenado en los DATOS del negocio (RAG), no un modelo re-entrenado. Cloudflare lo permite sin GPUs y con costo por consulta en céntimos.

Stack (todo serverless, cero infra)

  • Workers AI → inferencia de modelos open (Llama 3.x, Qwen3, gpt-oss-120b, Gemma) y embeddings multilingües (EmbeddingGemma, 100+ idiomas — crítico para clientes MX).
  • Vectorize → base vectorial para RAG (knowing del negocio: docs, web, PDFs, chats).
  • D1 + KV + R2 → historial de conversación, caché, almacén de documentos.
  • Queues / Workflows → ingesta y embedding asíncrono de documentos grandes (workflows-starter-template).
  • AI Gateway → caché, rate limiting, observabilidad; y proxy a OpenAI/Anthropic si el cliente pide “el ChatGPT de su negocio” (GPT-4o/Claude como generador).
  • Turnstile → anti-bots en el chat público.
  • Fine-tunes con LoRA (beta) → solo para estilo/formato/tono; sobre-ingeniería para la mayoría de casos.

Producto por cliente

  1. Rebrand del llm-chat-app-template: dominio propio, colores, voz del negocio, foto/persona.
  2. Ingesta: cliente sube docs o sitemap → Workflow chunkea → embeddings → Vectorize.
  3. Respuesta con citas a fuentes (patrón Martech Zone: gpt-oss-120b + [1][2]).
  4. Panel admin: caja de prueba live, ver top resultados y score de retrieval (feedback loop).
  5. Umbral de score: si retrieval débil → “no tengo info” (evita alucinaciones).

Negocio

  • Setup fee + mensualidad de mantenimiento. El costo marginal es céntimos/pregunta → margen alto.
  • Se vende el trabajo y el asistente, no los tokens.
  • Despliegue: npm create cloudflare@latest -- --template cloudflare/templates/llm-chat-app-template por cliente + wrangler.

Límites a conocer

  • Vectorize: máx 5M vectores / índice, 100 índices por cuenta, metadata 10KB.
  • Workers AI: catálogo de modelos open limitado; sin GPT-4o/Claude nativos (van por AI Gateway).
  • Embeddings: no hay fine-tune de modelos de embedding (solo LoRA en algunos LLM).
  • Cold starts ~200ms en tráfico bajo; mitigar con Durable Objects o warm.