2026-09-18 — Regreso a HF para vender “LLM custom”: arquitectura de IP y modelo base
Contexto: retomar Hugging Face como fábrica de artefactos por cliente (no como caja fuerte de la IP). Pregunta central: ¿qué modelo hace valer la suscripción? Respuesta corta: no es un modelo suelto, es estandarizar en UN modelo base Apache 2.0 para que adapters/evals/demos sean intercambiables entre clientes. Elegido: familia Qwen3.
1. Privado ≠ invisible para HF (el punto que hay que dejar claro)
- Un repo/Model/Dataset/Space privado no aparece en búsquedas ni es visible para terceros; solo tú y colaboradores autorizados.
- Pero HF no adquiere propiedad de tus modelos/datos, y a la vez sus términos le otorgan una licencia para operar el servicio y acceso a contenido privado bajo su política de privacidad (seguridad, cumplimiento legal).
- Conclusión: “private repo” no equivale a “guardado solo en mi servidor”.
- En cuentas personales/PRO los repos se almacenan en EE. UU.; el control de región de almacenamiento es de Team/Enterprise, no de PRO.
2. Regla de tres niveles (qué sube y qué no)
🟢 HF PRO — razonable modelos, datasets, fine-tuning, adapters, benchmarks, demos, prototipos, experimentos.
🟡 HF PRO + precaución — separar lo sensible algoritmos propios, workflow diferencial, datos de clientes, datasets caros de construir, arquitectura comercial. Se mantienen privados, pero se desacopla la parte nuclear.
🔴 No subir — queda en infraestructura propia secreto industrial, IP central sin proteger, RTL/diseño físico de un chip, llaves privadas, credenciales, fórmulas propietarias críticas, datos con exposición grave.
3. Arquitectura híbrida (HF = fábrica, no caja fuerte)
TU SERVIDOR / CONTROL LOCAL
┌─────────────────────────┐
│ IP central │
│ metodología: │
│ decisions → process → │
│ customization │
└───────────┬─────────────┘
│
↓
Hugging Face (privado)
┌───────────┼───────────┐
↓ ↓ ↓
Dataset Adapter Model
privado privado privado
└───────────┼───────────┘
↓
Space
El algoritmo secreto que convierte las decisiones de un cliente en su política de
comportamiento no se sube. Sí se suben artefactos por cliente del tipo
client-x-qwen-adapter, client-x-evaluation-dataset, client-x-demo,
client-x-rag-index.
Frontera análoga: “nuevo e-commerce” → prototipar en HF privado es razonable; “chip Wi-Fi” (RTL, layout, RF, firmware) → el núcleo fuera de HF.
4. ¿Qué modelo hace valer la suscripción?
No es un modelo, es la decisión de estandarizar en uno. La suscripción PRO ($9/mes: 1 TB privado, 10 Spaces ZeroGPU, créditos de inferencia) se paga sola como fábrica por cliente solo si el pipeline es repetible. Eso exige un modelo base cuyos adapters, evals y demos se reutilicen entre clientes.
Base elegida: Qwen3 (Apache 2.0 en todos los tamaños)
| Uso | Modelo | Por qué |
|---|---|---|
| Adapter por cliente (default) | Qwen3-8B | Apache 2.0 · buen español/MX · LoRA en 1 GPU · ya servible en Workers AI |
| Liviano / edge / barato | Qwen3-4B o 1.7B | mismo linaje, mismo tooling |
| Casos duros | Qwen3-14B / 32B | más capacidad sin cambiar de familia |
| Embeddings RAG | Qwen3-Embedding-0.6B/8B (Apache 2.0) | multilingüe, misma familia; alternativas bge-m3 / EmbeddingGemma |
Por qué Qwen y no otro para revender:
- Licencia Apache 2.0 en todo el rango → uso comercial y redistribución limpios.
- Llama (Meta Community License) y Gemma (Gemma Terms) son usables, pero traen cláusulas/atribuciones que ensucian una reventa. No estandarizar ahí.
- Coincide con lo que Workers AI ya sirve (Qwen3 + EmbeddingGemma) → el artefacto que entrenas en HF corre en el mismo runtime del producto sin conversión.
Regla de negocio
- No hacer fine-tuning hasta que RAG tope. “LLM custom” vendible = RAG +
personalidad + citas (ver
[CREDENCIAL].md). LoRA solo para estilo/formato/tono. - Un solo base = adapters intercambiables. Perseguir el SOTA distinto por cliente multiplica tooling y la suscripción deja de pagar.
- Consistencia HF ↔ Workers AI. Mismo modelo en fábrica (HF) y en runtime (Workers AI) = menos fricción, evals válidas.
5. Regla de trabajo: artefactos, no tachados
Un pendiente cuenta como progreso solo si produce un artefacto real y utilizable. Un dataset de 20 GB terminado vale más que seis tareas cosméticas.
PENDIENTE → ¿produce artefacto? → ¿requiere ingeniería real? → FOCO
Primer caso de prueba del proceso (decisions → process → customization): el dataset de 20 GB. No se construye a ciegas.
Hito 1 — Inventario + diagnóstico + estrategia (NO procesar todavía)
Definition of Done: poder responder
- Tamaño real
- Número de archivos
- Tipos
- Distribución
- Duplicados
- Calidad
- Estructura
- Metadatos
- Problemas
- Costo estimado
- Pipeline propuesto
- Output esperado
Trabajar por hitos técnicos, no por sesiones. Cada decisión importante alimenta el futuro decision/process model (nunca se sube a HF).
A verificar antes de pagar/decidir
- Cifras exactas de PRO 2026 y créditos incluidos (docs HF: PRO ≈ 18/TB/mes). Confirmar en huggingface.co/pricing.
- Licencia vigente de cada base elegido en su model card al momento de usarlo.
- Política del proveedor final de inferencia si se usa Inference Providers (HF dice no entrenar con esos datos ni almacenar request/response; logs ~30 días).