SUPERADO POR 2026-09-27-plan-hf-unificado.md. El objetivo sigue; la ruta cambió (ZeroGPU ya está asignado y operativo, el bloqueador de este doc ya no aplica).

Provisionar RAG/harnessing a clientes con tecnología HF (2026-09-27)

Contexto: aclaración de Nef sobre el objetivo de fondo de la conversación. No es solo “hacer un benchmark” — es adaptar tecnología de Hugging Face para provisionar un servicio de RAG/harnessing a clientes (clínicas dentales / PyMEs).

El objetivo

Convertir la pila de HF (Spaces ZeroGPU + modelos abiertos + Inference) en un servicio de RAG que se pueda desplegar por cliente:

  • Cada cliente (clínica) aporta sus documentos → se construye su índice.
  • El asistente responde por los canales del cliente (web/WhatsApp) con citas.
  • Se mide y se reporta (benchmark E1) para vender con evidencia.

Arquitectura objetivo

  1. Capa de cómputo (HF): Space ZeroGPU [usuario]/sonrisa-inference con modelos abiertos: Qwen3-Embedding-4B (embed), Qwen3-Reranker-0.6B (rerank), Qwen3-14B-Instruct (chat/juez). Sustituye APIs pagadas y Ollama local.
  2. Capa de aplicación: el harness RAG de proyecto_1_dentistas (chunking, retrieval híbrido + RRF, rerank, respuesta con citas, evaluación RAGAS).
  3. Capa de servicio: exponer el RAG por cliente (API/web/WhatsApp) con su propio corpus. Aquí está el “harnessing a clientes”.

Estado actual (2026-09-27)

  • proyecto_1_dentistas: scaffold + corpus sintético + golden set 20 + pipeline verificado (generación 20/20 con Groq; RAGAS parcial por límite TPD de Groq).
  • Space [usuario]/sonrisa-inference: creado, código pusheado, build OK, pero en CPU (no se asignó ZeroGPU) → la app no puede cargar los modelos.
  • Bloqueadores:
    • Hardware: el token fine-grained no puede cambiar hardware (403). El ZeroGPU debe asignarse desde la web (Settings → Hardware → ZeroGPU).
    • Escritura paralela: otro proceso añadió zero_gpu: true al README (commit 3e3eaff, no mío). Hay 2 sesiones opencode más corriendo. Coordinar/cerrar.

Respuesta a la pregunta de fondo

La capacidad de adaptar HF para provisionar RAG/harnessing a clientes sí existe y es la vía: Spaces ZeroGPU + modelos abiertos como backend de inferencia escalable y de bajo coste, con el harness RAG encima y despliegue por cliente. No depende de APIs pagadas (Groq/HF Inference) ni de hardware local (Ollama).

Siguiente paso

  1. Asignar ZeroGPU al Space desde la web (lo único que falta para arrancar).
  2. Cerrar/coordinar la otra sesión opencode que escribe en paralelo.
  3. Probar embed/rerank/chat del Space y correr el golden set 20/20 con juez propio.
  4. Con eso, el servicio está listo para un piloto con una clínica real.