hf-chat-api — alcance y precio (R&D chat para clientes)

Fecha: 2026-09-19 Estado: prototipo construido, pendiente de deploy Código: ~/nef/Proyectos/chat-hf/ URL (post-deploy): https://hf-chat-api.nef.workers.dev

Contexto

R&D, no encargo de cliente. Pregunta original: ¿HF Storage sirve para una API de chat? No — Storage Buckets es almacén, no inferencia. La ruta correcta es HF Inference Providers (router OpenAI-compatible, incluido en HF Pro) detrás de un Worker de Cloudflare. Objetivo medible: recuperar la mensualidad de HF Pro (~$9/mes) con lo que este prototipo pueda ofrecer.

Alcance v1 (construido, 19-sep)

  • POST /v1/chat — auth Bearer por cliente (CLIENT_KEYS="key:Nombre,..."), strip del rol system (el prompt de negocio nunca lo manda el cliente), proxy a router.huggingface.co/v1/chat/completions (Qwen2.5-72B), cap de 1024 tokens de salida, últimos 20 mensajes.
  • GET / — chat page vanilla (dark, key en localStorage), demo a cliente.
  • GET /health — diagnóstico.
  • Deploy: Worker gratuito (100k req/día), secrets: HF_TOKEN, CLIENT_KEYS. Wrangler CLI sin auth al construir; se despliega con npx wrangler login && npx wrangler deploy (API de CF vía MCP es read-only para workers).

Fuera de alcance v1 (v2 solo si hay cliente real)

  • Rate limits por key (KV/DO), persistencia de conversaciones, streaming SSE, RAG con datos del cliente, dominio propio, multi-modelo por cliente.

Precio / matemática de recuperación

  • HF Pro: ~2/mes en credits de Inference Providers.
  • Qwen2.5-72B vía providers: ~0.35/M salida — un cliente de chat típico consume centavos al día.
  • Infraestructura: Worker free tier = costo marginal por cliente ≈ 0.
  • Un solo cliente a $20–30/mes recupera Pro 2–3 veces. Margen > 90%.
  • Alternativa evaluada y descartada por ahora: VPS + Ollama (Hetzner ~$40/mes) — mejor para datos sensibles de cliente (LFPDPPP), pero overkill para validar demanda; la vía HF valida con costo casi cero.

Criterio de siguiente paso

Este prototipo es demo, no producto. Antes de construir v2: mostrarlo a un cliente real y ver si alguien paga. Si nadie muerde en 2–3 demos, se congela y HF Pro se evalúa por sí sola (¿la uso para study/knowledge-engine?). Nudge aplica: esto sí necesita testigo esta semana.