2026-09-18 — Regreso a HF para vender “LLM custom”: arquitectura de IP y modelo base

Contexto: retomar Hugging Face como fábrica de artefactos por cliente (no como caja fuerte de la IP). Pregunta central: ¿qué modelo hace valer la suscripción? Respuesta corta: no es un modelo suelto, es estandarizar en UN modelo base Apache 2.0 para que adapters/evals/demos sean intercambiables entre clientes. Elegido: familia Qwen3.


1. Privado ≠ invisible para HF (el punto que hay que dejar claro)

  • Un repo/Model/Dataset/Space privado no aparece en búsquedas ni es visible para terceros; solo tú y colaboradores autorizados.
  • Pero HF no adquiere propiedad de tus modelos/datos, y a la vez sus términos le otorgan una licencia para operar el servicio y acceso a contenido privado bajo su política de privacidad (seguridad, cumplimiento legal).
  • Conclusión: “private repo” no equivale a “guardado solo en mi servidor”.
  • En cuentas personales/PRO los repos se almacenan en EE. UU.; el control de región de almacenamiento es de Team/Enterprise, no de PRO.

2. Regla de tres niveles (qué sube y qué no)

🟢 HF PRO — razonable modelos, datasets, fine-tuning, adapters, benchmarks, demos, prototipos, experimentos.

🟡 HF PRO + precaución — separar lo sensible algoritmos propios, workflow diferencial, datos de clientes, datasets caros de construir, arquitectura comercial. Se mantienen privados, pero se desacopla la parte nuclear.

🔴 No subir — queda en infraestructura propia secreto industrial, IP central sin proteger, RTL/diseño físico de un chip, llaves privadas, credenciales, fórmulas propietarias críticas, datos con exposición grave.

3. Arquitectura híbrida (HF = fábrica, no caja fuerte)

              TU SERVIDOR / CONTROL LOCAL
              ┌─────────────────────────┐
              │ IP central              │
              │ metodología:            │
              │ decisions → process →   │
              │ customization           │
              └───────────┬─────────────┘
                          │
                          ↓
                    Hugging Face (privado)
              ┌───────────┼───────────┐
              ↓           ↓           ↓
           Dataset     Adapter      Model
           privado     privado     privado
              └───────────┼───────────┘
                          ↓
                        Space

El algoritmo secreto que convierte las decisiones de un cliente en su política de comportamiento no se sube. Sí se suben artefactos por cliente del tipo client-x-qwen-adapter, client-x-evaluation-dataset, client-x-demo, client-x-rag-index.

Frontera análoga: “nuevo e-commerce” → prototipar en HF privado es razonable; “chip Wi-Fi” (RTL, layout, RF, firmware) → el núcleo fuera de HF.

4. ¿Qué modelo hace valer la suscripción?

No es un modelo, es la decisión de estandarizar en uno. La suscripción PRO ($9/mes: 1 TB privado, 10 Spaces ZeroGPU, créditos de inferencia) se paga sola como fábrica por cliente solo si el pipeline es repetible. Eso exige un modelo base cuyos adapters, evals y demos se reutilicen entre clientes.

Base elegida: Qwen3 (Apache 2.0 en todos los tamaños)

UsoModeloPor qué
Adapter por cliente (default)Qwen3-8BApache 2.0 · buen español/MX · LoRA en 1 GPU · ya servible en Workers AI
Liviano / edge / baratoQwen3-4B o 1.7Bmismo linaje, mismo tooling
Casos durosQwen3-14B / 32Bmás capacidad sin cambiar de familia
Embeddings RAGQwen3-Embedding-0.6B/8B (Apache 2.0)multilingüe, misma familia; alternativas bge-m3 / EmbeddingGemma

Por qué Qwen y no otro para revender:

  • Licencia Apache 2.0 en todo el rango → uso comercial y redistribución limpios.
  • Llama (Meta Community License) y Gemma (Gemma Terms) son usables, pero traen cláusulas/atribuciones que ensucian una reventa. No estandarizar ahí.
  • Coincide con lo que Workers AI ya sirve (Qwen3 + EmbeddingGemma) → el artefacto que entrenas en HF corre en el mismo runtime del producto sin conversión.

Regla de negocio

  1. No hacer fine-tuning hasta que RAG tope. “LLM custom” vendible = RAG + personalidad + citas (ver [CREDENCIAL].md). LoRA solo para estilo/formato/tono.
  2. Un solo base = adapters intercambiables. Perseguir el SOTA distinto por cliente multiplica tooling y la suscripción deja de pagar.
  3. Consistencia HF ↔ Workers AI. Mismo modelo en fábrica (HF) y en runtime (Workers AI) = menos fricción, evals válidas.

5. Regla de trabajo: artefactos, no tachados

Un pendiente cuenta como progreso solo si produce un artefacto real y utilizable. Un dataset de 20 GB terminado vale más que seis tareas cosméticas.

PENDIENTE → ¿produce artefacto? → ¿requiere ingeniería real? → FOCO

Primer caso de prueba del proceso (decisions → process → customization): el dataset de 20 GB. No se construye a ciegas.

Hito 1 — Inventario + diagnóstico + estrategia (NO procesar todavía)

Definition of Done: poder responder

  • Tamaño real
  • Número de archivos
  • Tipos
  • Distribución
  • Duplicados
  • Calidad
  • Estructura
  • Metadatos
  • Problemas
  • Costo estimado
  • Pipeline propuesto
  • Output esperado

Trabajar por hitos técnicos, no por sesiones. Cada decisión importante alimenta el futuro decision/process model (nunca se sube a HF).


A verificar antes de pagar/decidir

  • Cifras exactas de PRO 2026 y créditos incluidos (docs HF: PRO ≈ 18/TB/mes). Confirmar en huggingface.co/pricing.
  • Licencia vigente de cada base elegido en su model card al momento de usarlo.
  • Política del proveedor final de inferencia si se usa Inference Providers (HF dice no entrenar con esos datos ni almacenar request/response; logs ~30 días).