SUPERADO POR
2026-09-27-plan-hf-unificado.md. El objetivo sigue; la ruta cambió (ZeroGPU ya está asignado y operativo, el bloqueador de este doc ya no aplica).
Provisionar RAG/harnessing a clientes con tecnología HF (2026-09-27)
Contexto: aclaración de Nef sobre el objetivo de fondo de la conversación. No es solo “hacer un benchmark” — es adaptar tecnología de Hugging Face para provisionar un servicio de RAG/harnessing a clientes (clínicas dentales / PyMEs).
El objetivo
Convertir la pila de HF (Spaces ZeroGPU + modelos abiertos + Inference) en un servicio de RAG que se pueda desplegar por cliente:
- Cada cliente (clínica) aporta sus documentos → se construye su índice.
- El asistente responde por los canales del cliente (web/WhatsApp) con citas.
- Se mide y se reporta (benchmark E1) para vender con evidencia.
Arquitectura objetivo
- Capa de cómputo (HF): Space ZeroGPU
[usuario]/sonrisa-inferencecon modelos abiertos: Qwen3-Embedding-4B (embed), Qwen3-Reranker-0.6B (rerank), Qwen3-14B-Instruct (chat/juez). Sustituye APIs pagadas y Ollama local. - Capa de aplicación: el harness RAG de
proyecto_1_dentistas(chunking, retrieval híbrido + RRF, rerank, respuesta con citas, evaluación RAGAS). - Capa de servicio: exponer el RAG por cliente (API/web/WhatsApp) con su propio corpus. Aquí está el “harnessing a clientes”.
Estado actual (2026-09-27)
proyecto_1_dentistas: scaffold + corpus sintético + golden set 20 + pipeline verificado (generación 20/20 con Groq; RAGAS parcial por límite TPD de Groq).- Space
[usuario]/sonrisa-inference: creado, código pusheado, build OK, pero en CPU (no se asignó ZeroGPU) → la app no puede cargar los modelos. - Bloqueadores:
- Hardware: el token fine-grained no puede cambiar hardware (403). El ZeroGPU debe asignarse desde la web (Settings → Hardware → ZeroGPU).
- Escritura paralela: otro proceso añadió
zero_gpu: trueal README (commit3e3eaff, no mío). Hay 2 sesiones opencode más corriendo. Coordinar/cerrar.
Respuesta a la pregunta de fondo
La capacidad de adaptar HF para provisionar RAG/harnessing a clientes sí existe y es la vía: Spaces ZeroGPU + modelos abiertos como backend de inferencia escalable y de bajo coste, con el harness RAG encima y despliegue por cliente. No depende de APIs pagadas (Groq/HF Inference) ni de hardware local (Ollama).
Siguiente paso
- Asignar ZeroGPU al Space desde la web (lo único que falta para arrancar).
- Cerrar/coordinar la otra sesión opencode que escribe en paralelo.
- Probar embed/rerank/chat del Space y correr el golden set 20/20 con juez propio.
- Con eso, el servicio está listo para un piloto con una clínica real.