hf-chat-api — alcance y precio (R&D chat para clientes)
Fecha: 2026-09-19
Estado: prototipo construido, pendiente de deploy
Código: ~/nef/Proyectos/chat-hf/
URL (post-deploy): https://hf-chat-api.nef.workers.dev
Contexto
R&D, no encargo de cliente. Pregunta original: ¿HF Storage sirve para una API de chat? No — Storage Buckets es almacén, no inferencia. La ruta correcta es HF Inference Providers (router OpenAI-compatible, incluido en HF Pro) detrás de un Worker de Cloudflare. Objetivo medible: recuperar la mensualidad de HF Pro (~$9/mes) con lo que este prototipo pueda ofrecer.
Alcance v1 (construido, 19-sep)
POST /v1/chat— auth Bearer por cliente (CLIENT_KEYS="key:Nombre,..."), strip del rolsystem(el prompt de negocio nunca lo manda el cliente), proxy arouter.huggingface.co/v1/chat/completions(Qwen2.5-72B), cap de 1024 tokens de salida, últimos 20 mensajes.GET /— chat page vanilla (dark, key en localStorage), demo a cliente.GET /health— diagnóstico.- Deploy: Worker gratuito (100k req/día), secrets:
HF_TOKEN,CLIENT_KEYS. Wrangler CLI sin auth al construir; se despliega connpx wrangler login && npx wrangler deploy(API de CF vía MCP es read-only para workers).
Fuera de alcance v1 (v2 solo si hay cliente real)
- Rate limits por key (KV/DO), persistencia de conversaciones, streaming SSE, RAG con datos del cliente, dominio propio, multi-modelo por cliente.
Precio / matemática de recuperación
- HF Pro: ~2/mes en credits de Inference Providers.
- Qwen2.5-72B vía providers: ~0.35/M salida — un cliente de chat típico consume centavos al día.
- Infraestructura: Worker free tier = costo marginal por cliente ≈ 0.
- Un solo cliente a $20–30/mes recupera Pro 2–3 veces. Margen > 90%.
- Alternativa evaluada y descartada por ahora: VPS + Ollama (Hetzner ~$40/mes) — mejor para datos sensibles de cliente (LFPDPPP), pero overkill para validar demanda; la vía HF valida con costo casi cero.
Criterio de siguiente paso
Este prototipo es demo, no producto. Antes de construir v2: mostrarlo a un cliente real y ver si alguien paga. Si nadie muerde en 2–3 demos, se congela y HF Pro se evalúa por sí sola (¿la uso para study/knowledge-engine?). Nudge aplica: esto sí necesita testigo esta semana.